# Karpathy 聊人机交互下一步：别只让模型吐 Markdown，试试让它直接写 HTML

> 原标题：人机交互界面的演进：从文本到交互式神经视频

- 来源：AI HOT 精选
- 发布时间：2026-05-11T16:20:21.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17634
- 原文：https://x.com/karpathy/status/2053872850101285137

## 摘要

Karpathy 觉得现在大模型默认输出 Markdown 太简陋了，他建议直接让模型生成带排版、图形和交互的 HTML，界面会好用很多。更远的想法是“交互式神经视频”——用扩散模型实时生成能操作的画面，但他也承认这玩意儿怎么跟精确的传统软件配合还是个没解的问题。输入这边，光靠语音、文字或视频不够，得加上手势指点这类更自然的交互。在脑机接口到来之前，输...

## 推荐理由

Karpathy 这条推文没给数据，就是个人判断，所以重要性只能打到 featured 的及格线。但他把 LLM 输出形态的变化串成了一条线：从纯文本到带格式的 Markdown，再到能直接渲染的 HTML，最后抛出“交互式神经视频”这个方向。我会先打个折——神经视频现在连跟传统软件精确配合都做不到，正文也没说怎么解决，这点先别太激动。不过对做 AI 产品的人来说，这个框架确实能帮他们想清楚下一步该把界面做成什么样。

## 锐评

Karpathy 这条推文的核心判断很直接：大模型默认吐 Markdown 是偷懒，让模型直接生成 HTML 页面，能立刻把排版、图表和可点击的交互都带上，用户体验会跳一大截。他给了一个马上能试的建议——让模型用 HTML 结构化回复，这比等下一代界面务实。

更远的那层“交互式神经视频”，是用扩散模型实时生成可操作的画面，听起来像把电影变成软件。但他自己点出了关键缺口：这种神经生成的画面怎么跟需要精确数值的传统软件（比如 Excel、CAD）配合，现在完全没解。正文没给出任何技术路线或实验数据，所以这部分只能当长期猜想，别急着当真。

输入侧他提到手势指点这类更自然的交互，但同样没展开具体实现。整体看，这条推文的价值在于把“输出格式”这个被忽视的环节拎出来，HTML 这个建议成本低、可验证；视频生成那层还缺约束条件和精度验证，离落地很远。
