# 上周三件小事：agent 的账本、接口与房间

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-09T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55654
- 原文：https://yage.ai/share/agent-ledger-interface-room-20260909.html

## 摘要

上周几拨人撞上了同一个工程瓶颈：agent 记性差、协作乱、碰不到物理世界。安全研究员 Jordy Zomer 开源了 Lemmalog，把 agent 记忆拆成两半：前面用模型从对话里提取事实，后面用确定性的规则引擎管因果推演和级联撤销，一条前提错了，依赖它的推论自动作废。Anthropic 和 Janelia 推出模型硬件标准 MHS，让大模型用大...

## 推荐理由

三件事撞在同一个工程瓶颈上：agent 记性差、协作乱、碰不到物理世界。Lemmalog 的因果账本有具体实现和开源代码，是这篇里最扎实的部分；MHS 和多 agent 协作部分正文着墨不多，细节偏弱。整体是个人博客的周报汇总，不是一手发布，我会先打个折，但 Lemmalog 的思路值得关注。

## 锐评

这三件事表面各说各的，底子却指向同一个工程共识：大模型擅长理解意图，但管不了事实真假、物理安全和协作时序。Zomer 把记忆拆成“模型提取事实+规则引擎管因果”，Anthropic 把安全红线写死在驱动固件里，Raft 则把多 agent 打架归咎于聊天室没有“草稿暂存”和“沉默即动作”的机制。三拨人都在做同一件事——用确定性的工程外壳把概率模型包起来，让模型只干它擅长的活，别碰它兜不住的底。

数字上得留个心眼。Lemmalog 在偏好类任务上只拿了 0.128 分，说明这套账本一碰到模糊语义就抓瞎；MHS 宣称的 99.3% 无人工介入和 3 倍提速全是合作方自报，标准规范正文没公开，厂商大多还停在口头支持；Raft 的规模声称也缺第三方讨论。这些数字目前只能当方向参考，离落地验证还有距离。

还缺什么？Lemmalog 缺第三方独立复现和更大规模的真实 agent 场景压测；MHS 缺公开的技术规范细节和跨厂商的互操作实测；Raft 缺除报数游戏外的复杂协作基准分数。如果这些缺口能补上，确定性脚手架这条路才算真正踩实了。
