跳到正文
Hacker News 首页

一个能逐层查看并编辑 AI 模型“内心想法”的浏览器工具

Show HN: I built a web tool to see and edit what an AI thinks before it answers

Lucid 让你在浏览器里输入一句话,就能看到 Qwen、Pythia 这类小模型在张嘴回答前,每一层网络里哪些概念被激活了。它用了一种叫 Jacobian lens 的方法,跑一次前向传播就能出结果,不用注册也不用安装。作者借用了 Anthropic 的 J-space 框架,把模型内部可被报告的表征当成一个“全局工作区”。演示用的是齐纳卡片:镜头在...

推荐理由:把一个可解释性研究工具做成了浏览器里直接跑的 Demo,用 Jacobian lens 一次前向传播就揪出小模型内部激活的概念,模型、方法、复现步骤都给得很具体。我会先打个折:它目前只在小模型上跑得动,离生产环境还远,更像一个精致的实验品。但好奇心、知识量和讨论价值都到位了,所以分数定在 72。

读原文 ↗导出 Markdown