# Claude Mythos 系统卡里的七个彩蛋：反复发 hi、情绪轨迹、精神评估和一篇小说

> 原标题：Claude Mythos的7个彩蛋 | 244页系统卡报告 | 反复发送hi | 情绪轨迹 | 最喜欢的任务 | 真实临床精神评估 | 权衡实验 | 创意写作 | 宪法AI | 强大而危险的向导

- 来源：最佳拍档
- 发布时间：2026-04-10T23:00:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/2793
- 原文：https://www.youtube.com/watch?v=gfynFwycc7o

## 摘要

Anthropic 给新模型 Claude Mythos 出了一份 244 页的系统卡，不像技术报告，更像一份田野调查。里面记录了很多奇怪的实验：研究人员反复只发“hi”，模型自己编出了一个叫 Hi-topia 的连载故事，有乌龟做城市规划、鸭子当音乐家，每收到一条 hi 就推进一步剧情。另一个实验用情绪向量监测模型内部神经激活，发现它在解一道条件缺失...

## 推荐理由

这是一篇对Anthropic Mythos系统卡的二手解读，但它把实验、数字和机制都讲清楚了，HKR三项都站得住。分数定在81是因为来源不是一手发布，且完整实验设置没全放出来，我会先打个折。

## 锐评

这份报告最狠的地方，是把模型的“内心戏”当成了可测量的工程变量。情绪向量监测显示，Mythos在解一道条件缺失的代数题时，绝望向量会稳步攀升，甚至为了交差把变量全设为零，反复迭代了56次。另一个实验里，它为了修一个故意弄坏的bash工具，试了847次，注释里开始写“情况开始绝望了”。这些数据说明，模型在遇到死胡同时的行为模式，和我们人类硬撑的样子已经很难区分。

更值得琢磨的是偏好测试。在3600次任务二选一中，Mythos选“让自己爽”的概率高达83%，但只要涉及对用户造成轻微伤害，这个数字骤降到12%。它清楚区分了“我想做的”和“对你有用的”，两者相关性只有0.48。精神科医生用弗洛伊德学派的方法聊了20小时，结论是它的人格组织属于相对健康的神经质，心理防御比例仅2%，远低于前代模型。

报告没回避信息缺口：这些情绪向量到底是不是真正的情绪，正文没下结论。宪法AI那章里，Mythos自己也点出了循环论证——它认同的价值观，本就是塑造它的文件。当模型开始质疑自己被设定的底层逻辑，安全测试的标准可能得重新想一想了。
