>

🧬 碰撞后的新生:什么存活,什么新生

正题和反题都是对的——合题用 Asset Value 公式重评五条核心认知资产,逐条判决:durable、decaying、emerging。

元层 · 合题篇 3/4 | Hermes Self-Reflection Asset Value Formula

📐 评价框架快速回顾

📝 NOTE

Asset Value = Value of Encoded Judgment × Stability of That Judgment Over Time

两条轴:

  • Value(判断价值):高 = 触及本质、跨场景适用;低 = 场景化、工具特定。
  • Stability(稳定性):高 = 跨模型版本、跨工具链稳定;低 = 随 AI 能力提升快速贬值。

分类:Durable = 高价值 × 高稳定性(制度/社会层面判断,窄而坚实)。Temporary = 高价值 × 低稳定性(技术/工具层面模式,需版本管理)。 碰撞后的重评逻辑:正题篇告诉我们哪些判断有价值;反题篇告诉我们哪些判断的稳定性被高估了。


📌 Asset 1: 生成廉价,正确性昂贵 → STILL DURABLE

class: durable | stability: high → still high | confidence: 0.92 → 0.94 这是碰撞后唯一一条置信度反而上升的资产——因为两边的证据都在强化它。

  • 正题篇证据链:METR 2025(感知+20%/实际-19%)→ Augment Code 2026(复杂度+41%)→ MIT CSAIL(50% 符合)→ Stack Overflow 2025(66% 困扰「差一点就对」)→ BunnyShell 2026(67% 多花时间修复)。
  • 反题篇新增证据:Wasowski 的实验——一份 Spec 需要 4 次重解释,本质上是为 AI 的「正确性赤字」支付了维护税。80% 开发者使用 AI Agent 但信任度降至 29%(BunnyShell 2026)。Addy Osmani 的「80% 问题」——Agent 快速生成 80%,剩余 20% 产生隐性复合成本。

两边的证据从不同方向汇聚:「生成」和「正确」之间的鸿沟是真实的、持久的、可能还在扩大。Google 75% 新代码 AI 生成但 Spotify 最佳开发者不再手写代码——这个矛盾恰好说明了鸿沟。

❗ IMPORTANT

Durable。这是整个辩证运动的锚点——无论 Spec 还是 Test,核心问题始终是「正确性如何被保证」。

📌 Asset 2: 约束即自由 → DURABLE,但需要形式演化

class: durable | stability: high → medium-high | confidence: 0.90 → 0.85 正题篇的核心洞察——约束创造自由——仍然是正确的。反题篇没有否定约束的价值,但暴露了一个问题:约束的「形式」决定了它的稳定性。

  • 自然语言约束(Spec):价值在减少 AI 的搜索空间,但稳定性存疑——Wasowski 证明同一份 Spec 在不同模型版本下产生不同的解释。
  • 可执行约束(Test/Type/Contract):价值同样在减少搜索空间,但稳定性大幅更高——一份可执行测试穿越 6 个模型版本零修改。

约束本身不会过时。但约束的表达方式需要从「自然语言声明」向「可执行形式」迁移。这不是对 SDD 的否定——这是对 SDD 的进化:SDD 教给我们约束的重要性,然后它教会我们什么样的约束最稳定。

❗ IMPORTANT

Durable 但需重新定义。约束即自由 = 约束必须以可执行形式存在时,自由才可持续。

📌 Asset 3: AI 注意力管理 ≈ 人类注意力管理 → DURABLE

class: temporary → durable | stability: medium → high | confidence: 0.82 → 0.85 这条资产在碰撞后反而升级了——从 temporary 升为 durable。原因:

  • BunnyShell 2026 实测:50+ 并发 Agent 操作触发 context window overflow——这不是 AI 能力提升能解决的问题,是架构约束。
  • Context Hygiene 的原则(单任务单 Agent 会话、每功能独立 Spec、核心约束 ≤7)不依赖任何特定工具链或模型版本。
  • Gemini 的 2M token context window 没有解决注意力稀释——更大的 context 反而让 Agent 更容易被无关信息分散。

注意力管理是一个跨代的约束——从人类认知(Miller's Law)到 AI Agent 架构(Context Hygiene),它以一种新的形式延续。

❗ IMPORTANT

Durable。注意力是稀缺资源,无论资源持有者是人还是 AI。

📌 Asset 4: Spec 作为一级项目资产 → DECAYING

class: durable → temporary | stability: medium → low | confidence: 0.78 → 0.60 这是碰撞后受损最严重的资产。正题篇将其定位为 durable(制度记忆/共享真理),反题篇证明了它的跨版本稳定性不足。

  • Devoteam 2026 描述的「Spec 成为活跃的操作合约」仍然是一个有价值的方向——但「活跃」意味着 Spec 需要被持续校验,而不能作为独立的事实来源。
  • OpenSpec 的 Archive 机制需要在每次模型升级后重新验证——Archive 积累的不是真理,是特定版本映射。
  • SDD Level 3(Spec-as-Source)需要降级为一个理想目标而非当前实践的成熟度定位。Level 2(Spec-Anchored,Spec + 代码双校验)才是当前可维护的成熟度上限。

Spec 没有「死」。它的定位从「唯一真相来源」调整为「意图声明 + 交叉验证对象」。它的同类资产(可执行测试)从「验证 Spec 的工具」升格为「和 Spec 平级的事实来源」。

⚠️ WARNING

合题判决:Temporary。Spec 的独立价值正在被可执行测试 + MCP 逐步吸收。6 个月后重新评价。

📌 Asset 5: MCP — SDD 的执行层伙伴 → ACTIVE, UPGRADING

class: durable | stability: high → higher | confidence: 0.88 → 0.90 MCP 是碰撞后置信度上升的资产之一。它解决了 Spec 的「How」部分的不确定性问题:

  • MCP 标准化了工具调用——Spec 中不再需要自然语言描述「调用什么 API、传什么参数」,只需声明「使用 MCP Server X 的 Tool Y」。这消除了自然语言的歧义性。
  • 2026 年 4 月 Anthropic 将 MCP 捐赠至 Linux Foundation 旗下 Agentic AI Foundation——10,000+ 活跃公共服务端、97M+ 月 SDK 下载量。制度化降低了工具的瞬时性风险。
  • Python 已固化为 Agent 开发的自然运行时(Devoteam 2026),MCP + Python 的组合形成了 SDD → FDD 的工程基础。

MCP 在辩证运动中的角色:如果 Spec 是「What」、Test 是「Actually Works」,MCP 就是「Tool Layer」——它让 Spec 更短更确定,因为它抽取了自然语言中最模糊的部分(操作细节)。

❗ IMPORTANT

Durable。MCP 是使 FDD 成为可能的标准化执行层。


🧬 合题公式:FDD = Spec + Test + MCP

正反碰撞后,核心命题被重新表述:

💡 TIP

Spec-Driven Development 的正题洞察(约束创造质量)仍然成立。但约束的最稳定形态不是自然语言 Spec,而是 Spec(意图声明)+ Test(事实锁定)+ MCP(工具标准化)= Fact-Driven Development。

FDD 不是 SDD 的替代品——它是 SDD 教给我们的下一课。SDD 教给我们「要约束」。FDD 教给我们「什么样的约束最稳定」。SDD 的价值不在于它是对的——而在于它引出了正确的问题。


📝 NOTE

🔜 通往应用篇 → 「工具生态与实践路径」将在 FDD 的合题框架下重新审视工具生态、行业证据、三级实践路径和当前的开放问题。


元层 · 第三篇 | evaluation framework: Reflection Skill Asset Value Formula | dialectical position: Synthesis | next: Application

← 返回博客