跳到正文

#MCP/工具调用

今日 5 条

5月14日星期四

AI HOT 精选

Anthropic 给小型企业做了个 Claude 服务包,直接连 QuickBooks、PayPal 等工具跑自动化流程

Anthropic 推出 Claude for Small Business,一个在 Claude Cowork 里一键开启的服务包。它把 Claude 接进了小企业常用的工具:Intuit QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspace 和 Microsoft 365。自带 15 个...

推荐理由:Anthropic 这次把 Claude 做成小企业套餐,给了 15 个现成工作流和几个常用工具的连接器,还加了手动审批环节,产品更新挺实在。不过正文没提价格、具体铺开范围和实际用量数据,所以先别太激动,重要性到不了必写级别。

5月13日星期三

Hacker News 首页

Rotunda:一个专为 AI 智能体设计的浏览器,能模拟人类打字节奏

Pierce 发布了 Rotunda,一个基于 Firefox 150 的浏览器,专门给 Claude、Codex 这类 AI 智能体用。它最大的不同是能模拟人类的鼠标移动和键盘输入节奏——作者用自己一周的操作数据训练了一个 RNN 模型来生成这些时序,让智能体操作网页时看起来更像真人。控制方式有两种:命令行或者 Playwright API,方便接入...

推荐理由:Rotunda 把 Firefox 150 改成了给 Claude、Codex 这类工具用的浏览器,核心卖点是拿 RNN 模拟人类敲键盘、动鼠标的时序,让网站不容易识别出是机器在操作。接入方式走 CLI 或 Playwright API,对已经在用 Playwright 的人上手成本低。不过目前只是一个 Show HN 的开源仓库,正文没披露实际跑在哪些业务里、也没给延迟或成功率数据,所以效果到底怎么样还得看后续验证。

AI HOT 精选

Cursor 给云端 AI 编程助手配上了开发环境,支持多仓库和 Dockerfile 配置

Cursor 发布了一套给云端 agent 用的开发环境工具。现在一个环境里能挂多个代码仓库,让 agent 跨仓库改代码、跑测试。环境配置改用 Dockerfile 来管,支持构建密钥,缓存命中时构建速度能快 70%。不想手写 Dockerfile 的话,Cursor 可以自动检查你的仓库并生成一份可编辑的配置,这个功能还在内测。环境还加了版本历史、...

推荐理由:Cursor 给智能体配了个云端开发环境,不是简单加个按钮,而是把多仓库、Dockerfile、审计日志和环境权限都塞进去了。缓存命中后构建能快 70%,这个数字挺实在,说明他们不是只做了个壳。我会先打个折:正文没提安全隔离做到什么程度,也没说缓存命中率在真实项目里能到多少,所以别急着当万能方案。但整体看,它解决的是让模型进业务流程干活时环境乱、权限杂、构建慢这几个真问题,对从业者来说值得关注。

量子位 · 公众号

百度发布秒哒3.0,8岁小孩也能把想法变成手机App

百度在2026 Create大会上推出了秒哒3.0,一个无代码开发平台。这次更新直接支持生成iOS和安卓App,还能打包成安卓安装包、在线热更新。企业版加了三级权限、环境隔离和服务等级协议。现场演示里,一个8岁小学生用语音说了几个想法,平台就自动生成了一个完整应用。不过正文没披露这个演示App的实际复杂度和后续维护成本,也没说生成代码的质量和可维护性怎么样。

推荐理由:秒哒3.0这次主要把应用生成从网页端扩展到了iOS和Android,还加了安卓打包和热更新,等于让不会写代码的人也能直接出手机应用。企业版给了三级权限和SLA,明显在往团队和公司场景推。我会先打个折:标题里“8岁小学生”的案例正文没给出具体细节,不知道是完整可用应用还是简单页面,这点先别太激动。整体是产品功能更新,不是底层模型换代,但移动端生成和打包能力对低代码赛道有实际推进。

纽约时报中文网

中国智库向Anthropic要Mythos模型被拒,美方视作AI竞赛升级信号

上个月在新加坡一场非官方对话中,一家中国智库要求Anthropic向北京开放其最新的Mythos模型,被直接拒绝。Mythos是个擅长找软件漏洞的模型,Anthropic目前只给美国政府和40多家机构用,理由是怕引发网络安全危机。美方官员认为这次接触虽非正式外交,但背后大概率有中国政府授意,并把它看作中美AI竞赛升温的又一个迹象。文章提到,美国最新模型...

推荐理由:这条消息我会先打个折:正文没披露中国智库具体是哪家、怎么谈的、Anthropic 拒绝的细节也没展开。但核心信息够硬——Mythos 是个找漏洞的模型,Anthropic 只给美国政府和 40 多个组织用,中国想要但拿不到。这比一般的模型封锁更敏感,因为直接关系到软件供应链安全。对从业者来说,说明顶尖漏洞挖掘能力正在变成国家级的受控资源,以后这类模型可能越来越难公开拿到。

AI HOT 精选

Google 出了第一款围绕 Gemini 做的笔记本 Googlebook,不再是 Chromebook 那种云优先的路子

Google 发了台叫 Googlebook 的笔记本,系统层面把 Gemini 塞了进去。这次说了三个功能:Magic Pointer 把光标变成一个 AI 入口,点哪都能弹出上下文建议和任务;Create Your Widget 让你用大白话描述需求,自动生成一个能聚合不同信息的桌面小组件;还打通了安卓生态,在电脑上直接调用手机 App 和文件。正...

推荐理由:我会先打个折:正文没披露具体配置、价格、上市时间和实际演示,所以没法往更高分打。但“Googlebook”这个命名和围绕 Gemini Intelligence 的设计,说明 Google 想把 AI 做成笔记本的原生能力,而不是外挂一个助手。三项机制里,Magic Pointer 听起来像用意图预测代替传统光标操作,自然语言生成小组件是把“说人话就能搭界面”搬到桌面,Android 跨设备访问则打通了手机和笔记本的协同。这些点加起来,让这条消息在 AI 从业者眼里有讨论价值,但缺细节也意味着落地效果还得观望。

AI HOT 精选

Claude Code 加了个 /goal 指令,让模型自己跑到任务做完

Claude Code 新上线了 /goal 功能,你下完指令后 Claude 会持续干活直到任务完成,不用人在旁边盯着。帖子没写这个功能怎么触发、哪些版本能用、要不要额外付费,也没提任务卡住或跑偏时怎么处理。

推荐理由:HKR 三项都过,因为 /goal 解决的是 Claude Code 用户常遇到的 agent 中途停摆问题。这只是 Anthropic 单功能更新,细节披露不多,所以放在 featured 低位,不算当天重磅消息。

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。

AI HOT 精选

OpenAI 演示 Codex 在 Mac 上跨应用后台干活,不用占着你的电脑

OpenAI 开发者账号发了一段演示,Codex 能跨 Mac 应用点击、输入、在后台持续执行任务,不会锁住你的鼠标键盘。视频里 @AriX 和 @romainhuet 聊了这种代理能干的事,但正文没披露发布时间、权限怎么设计、以及这次开放给哪些用户。

推荐理由:我会先打个折:正文只有一段演示描述,没给发布时间、权限模型、可用范围,所以重要性停在 76 分。钩子很直接——Codex 能在 Mac 后台帮你跨应用点按钮、填文字,听着像本地 RPA 但由模型驱动。这点先别太激动,因为没交代它怎么拿系统权限、会不会误操作、有没有沙箱。对开发者来说,这要么是桌面 agent 的一大步,要么是个安全坑,得等更多细节。

AI HOT 精选

Anthropic 安全团队用自家 Claude Code 搭了个威胁检测平台,一天出原型、一周上线

Anthropic 的检测平台工程团队用 Claude Code 开发了 CLUE 威胁检测与响应平台。他们一天就做出了概念验证,一周完成交付。这个平台把安全分析员查日志的时间从几小时压缩到了几分钟。文章是团队技术负责人 Jackie Bow 写的,主要讲他们怎么用 Claude Code 自动处理告警、加速调查,但没披露具体用了哪些模型、实际误报率多...

推荐理由:这是 Anthropic 安全团队自己吃狗粮的案例,不是 Claude Code 功能发布。CLUE 平台和一天 PoC、一周交付的时间线让它刚好够上 featured 门槛,但我会先打个折——内部案例的通用性还没验证,正文也没披露误报率、处理量这些硬指标。

AI HOT 精选

Claude Opus 4.7 快速模式开放研究预览,API 和 Claude Code 都能用

Anthropic 把 Claude Opus 4.7 的快速模式放出来了,现在可以在 API 和 Claude Code 里用,但还挂着研究预览的标签。正文没提模型参数量、具体定价、调用频率限制,也没说什么时候转正式版。如果是真的快又便宜,对日常开发场景会挺实用,不过这些关键信息都缺着,先别急着切生产环境。

推荐理由:我会先打个折:正文只说了开放研究预览,没披露模型大小、定价、速率限制和正式上线时间,所以别当成品看。但这条消息对用 Claude Code 干活的人很实在——快速模式意味着写代码、调工具的等待时间可能明显缩短,工作流会顺很多。信息缺口主要在成本和规模上,没这些数字就没法算账,这点先别太激动。整体判断挂在延迟改善和开发者体验上,信息不够的部分也标清楚了。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

AI HOT 精选

Claude 给律师和法务做了一套专用工具,能直接进 Word 和 Outlook 干活

Anthropic 发布了 20 多个 MCP 连接器和 12 个法律专用插件,让 Claude 能直接操作合同管理系统、研究平台、文档管理和电子取证软件。具体来说,它可以在 Word 里起草和修改合同,在 Outlook 里处理日常法律流程,还能做条款对比。正文没披露这些工具的实际准确率、客户测试数据或定价,所以效果和成本现在还没法判断。

推荐理由:Anthropic 这次不是发模型,而是给 Claude 配了一套法律行业的“工具包”:20 多个 MCP 连接器加 12 个插件,直接嵌进 Word 和 Outlook 里干活,合同起草、修订、条款比对都能做。我会先打个折——正文没披露这些连接器具体覆盖哪些系统、插件是自己做的还是第三方接的,也没给实际客户案例或效率数据,所以“省了多少时间”现在说不清。但方向很明确:让模型进业务流程干活,而且选了一个对准确率要求极高、人工成本也高的行业。如果是真的跑通了,律所和法务团队的重复劳动会被吃掉一大块。这点先别太激动,等看有没有律所站出来说实测结果。

AI HOT 精选

谷歌在 Android Show 2026 上发了新助理 Android Intelligence,能跨 App 自动干活

谷歌这次推的 Android Intelligence 是一个系统级智能助理,主打跨安卓应用的多步骤自动化任务,比如你让它订咖啡、回消息、填表,它可以自己切 App 完成。Chrome 里的 Gemini 也加了浏览器操作能力,能直接帮你操作网页。另外还有语音笔记转文字功能叫 Rambler,以及可以自定义的生成式 UI 小组件。整场发布没提具体推送时...

推荐理由:这条消息抓人是因为安卓系统级的智能助理,能跨 App 自动操作,不是某个 App 的小修小补。具体放出的功能点挺实在:Chrome 里让 Gemini 直接帮你用浏览器、自动填表、语音转文字,还有可定制的小组件,都是开发者能马上摸到的界面。正文没给技术细节和实际延迟数据,所以效果先打个折。但这件事本身是移动 AI 代理的卡位战,对做工具和分发的团队来说,风向意义大于单点功能。

Hacker News 首页

Hopper:给大型机配了一个能看懂 z/OS 的 AI 操作界面

Hypercubic 发布了 Hopper,一个把 AI 助手直接塞进大型机开发流程的桌面工具。它自带真实的 TN3270 终端,AI 能识别 ISPF 面板、写严格对齐列位的 JCL 作业、把 SDSF 里的失败信息翻译成具体的异常码和出错行,还能像查 SQL 一样查询 VSAM 数据集。编译、测试、上线可以一条指令完成,但每次改动前会暂停等你批准,...

推荐理由:Hypercubic 这个 Hopper 把 TN3270 终端、z/OS 面板和 AI agent 揉在一起,让 agent 能直接操作大型机上的 COBOL 系统,敏感步骤还得人工点个头才放行。想法挺有意思,但正文没给出任何客户、定价或实际跑起来的效果数据,目前只是 Show HN 阶段的小团队产品展示。我会先打个折,等有真实案例再往上调。

TechCrunch · AI

Google 在 Android Show 上发了什么:AI 笔记本、能帮你干活的 Gemini、随口说说的桌面小部件

Google 在 I/O 大会前办了一场 Android Show,把 Gemini 助手塞进了更多地方。新发布的 Googlebooks 笔记本主打 AI 优先,但正文没披露具体配置、价格和上市时间。Gemini 变得更“代理化”,意思是它能跨 App 帮你完成一连串操作,不过实际效果还得看落地。Android 桌面小部件现在支持“vibe codi...

推荐理由:Google 在 I/O 前一口气甩出好几个 Gemini 相关的 Android 更新,我会先打个折:正文没给参数、没标价格、也没说什么时候能用上,所以只能当产品信号看。比较有意思的是 vibe-coded widgets,等于让用户用自然语言描述就能生成桌面小组件,门槛降得很低;Googlebooks 则像是把笔记和 Gemini 的搜索/总结能力缝在一起,能不能打还得看实际体验。整体属于有话题但缺验证的 mid-weight 产品更新。

The Verge · AI

Google 给 Gemini 加了几个新功能,核心是让它能直接操作你的安卓手机

Google 在安卓发布会前搞了个预演,推出了叫 Gemini Intelligence 的东西。简单说,就是把 Gemini 塞进安卓版 Chrome 浏览器里,能帮你自动填表,还能跨 App 执行操作。这离“手机自己用自己”又近了一步。不过正文没提哪些机型能用、什么时候推送、要不要另外付费,这些关键信息都还空着。

推荐理由:H、K、R 三条都成立。Gemini 开始接管 Android 上的 Chrome、自动填充和 app 内操作,不再是纯对话工具。我会先打个折:正文没披露支持设备清单、推送时间和定价,所以只能算产品更新,分数压在 72–77 这个区间。

TechCrunch · AI

Google 给安卓加了能跨 App 干活的 AI,还能用嘴说一个桌面小组件

Google 在安卓发布会上甩出了 Gemini Intelligence 这面新旗号,核心是让 AI 在手机里帮你跨 App 跑腿,比如填表、语音输入、上网查东西。比较有意思的是“vibe-coded widgets”——你直接用自然语言描述想要什么小组件,它就能给你生成出来,不用写代码。不过正文没提这些功能什么时候上线、哪些手机能用、收不收费,也没...

推荐理由:我会先打个折:正文只说了 Gboard 听写和表单填写这两个具体能力,发布时间、设备范围和价格全都没提,所以信息增量有限,不能给太高。但“agentic AI + vibe-coded widgets”这个说法本身挺抓人——一边是让模型进系统流程干活,一边是用自然语言随手生成小组件,对移动端 AI 入口的想象空间有拉动。这点先别太激动,毕竟没落地细节,但作为平台级更新,值得放进 featured 里让从业者扫一眼。

TechCrunch · AI

Anthropic 也下场了,给律所做了五类文书自动化工具

Anthropic 发布了一套面向律所的工具,覆盖文档检索与审阅、判例法资源查找、庭前证词准备、文书起草等五类事务性工作。文章没披露具体定价、上线时间和背后用的是哪个模型,也没给出实际律所的测试数据。我会先打个折——目前看更像是一个产品方向声明,能不能在合同审查这种容错率极低的场景里用,还得等更多验证。

推荐理由:Anthropic 这次不是发模型,是直接卖法律行业工具,把文档搜索、审查、判例调取、证词准备和起草这五件事串成一个产品。我会先打个折:正文没披露定价、客户数量和底层模型有没有专门为法律微调,所以现在还看不出是认真做行业方案还是先占个坑。但方向本身值得关注,因为法律文书工作量大、容错率低,能跑通一部分就能验证 AI 在专业服务里的付费意愿。这点先别太激动,等看到实际律所采用数据和准确率再说。

AI HOT 精选

Anthropic 在 Code w/ Claude SF 2026 上给开发者工具加码:Claude Code 调用频率翻倍,托管智能体新增记忆审查、多...

Anthropic 在旧金山的年度开发者大会上宣布了几项更新。Claude Code 的速率限制直接翻了一倍,Opus 模型的 API 调用上限也提高了,对重度用户来说不用那么频繁撞墙了。Claude 平台上的托管智能体(hosted agents)这次加了四个新功能:记忆审查,让智能体能回顾之前的对话;多智能体委派,可以把任务分给其他智能体去干;输出...

推荐理由:Anthropic 这次更新有具体数字和功能列表,不是画饼。速率翻倍对重度用户是实打实的改善,托管智能体加 4 项功能也说明他们在推 agent 落地。没有新模型发布,所以重要性在 78–84 这个区间合理。

5月12日星期二

AI HOT 精选

在 Claude Code 里装 OpenAI 官方 Codex 插件,让两个模型搭伙干活

作者在 Claude Code 的插件市场里加了 OpenAI 的官方库,把 Codex 插件装好、重载、配完就能用。这么做的思路来自 HeavySkill 论文的“重思考”方法:让多个模型各自独立推理,再找一个模型当主持人把思路揉到一起,提高最终回答质量。作者现在搭的 Skill 就是 Claude Code 负责推理,Codex 当主持人。正文没提...

推荐理由:HKR 三项都成立:跨模型插件调用有新闻性,安装路径可操作,对 AI 开发工作流有实际影响。但这是一篇教程型分享,不是模型或平台发布,所以只给 featured 低档。

AI HOT 精选

GitHub 员工用 Copilot CLI 把代码库变成了地牢探险游戏

一个 GitHub 工程师拿 Copilot CLI 做了个扩展,能把任意代码仓库解析成 Roguelike 风格的地牢地图。核心机制是程序化生成关卡——说白了就是让代码结构自动变成房间和走廊。这更像一个创意编程和游戏原型 demo,展示 Copilot CLI 除了敲命令,还能用来快速搭出带交互的终端小玩意。正文没披露生成一张地图要多久、支持多大的代...

推荐理由:HKR-H 和 HKR-K 都成立:GitHub 官方教程里藏了个新奇的 Demo,机制也讲清楚了。但它不是 Copilot 核心能力的大更新,正文没给性能指标、定价或基准数据,就是个教程级别的 featured,我会先打个折,别当重磅发布看。

Hacker News 首页

Statewright:用可视化状态机给 AI 智能体上把锁,让它干活更靠谱

这是一个刚在 Hacker News 上展示的开源项目,核心思路是用 Rust 写一个状态机引擎,把 Claude Code 能调哪些工具、能跑多少轮、怎么跳转、什么条件下才能执行下一步,全部用状态图管起来。作者说 130 亿到 200 亿参数的模型在真实的 SWE-bench 任务上表现都有稳定提升,但正文没披露具体的基准分数、样本量和评测流程,这点...

推荐理由:我会先打个折:SWE-bench 具体分数没披露,没法判断改进幅度有多大。但用状态机硬约束工具调用这个思路本身靠谱,尤其对 Claude Code 这类编程 agent 的稳定性有帮助。小模型能跑是个加分项,说明不是堆算力的玩法。整体值得推荐,但别把“一致改进”当成碾压性提升。

AI HOT 精选

想让 AI 当个人管家?先得把你在淘宝、京东、美团上的消费记录弄出来

作者实测了五个主流消费平台的数据导出方法。淘宝自带导出功能;京东没有官方支持,但作者用 Codex 写了个 Chrome 插件,能一键导出订单,代码已开源在 GitHub;饿了么可以申请导出 Excel;美团外卖目前完全没办法导出;大众点评的收藏列表也能通过定制插件导出来。作者把京东和大众点评的工具都开源了,目的是让用户拿这些消费数据喂给 AI Age...

推荐理由:这篇文章不是平台官方发布,是一个开发者的实操记录,所以重要性停在 featured 档。但 H、K、R 三项都踩中了:用订单数据喂 AI 助手这个切入点够抓人,5 个平台的具体导出方式是新事实,开源工具直接降低了数据可移植性的实现成本。我会先打个折——正文没披露导出数据的字段完整度和后续清洗工作量,这点先别太激动,但作为动手参考已经够用。

FT · 科技

亚马逊员工用内部 AI 工具刷分,把没必要的活也丢给 AI 干

FT 报道,亚马逊内部有个叫 MeshClaw 的工具,员工可以把工作委托给 AI 代理去完成,公司还搞了个 AI 使用排行榜。结果有员工为了冲榜,开始把一些根本不需要 AI 处理的活也丢进去跑。报道没披露具体有多少人这么干、排行榜的计分规则是什么,也没说这些“没必要的任务”到底是哪些。

推荐理由:FT 这篇报道给了一个亚马逊内部 AI 落地被玩坏的实例,HKR 三项都踩中了。正文没写参与人数、评分规则和任务类型,所以放在 featured 而不是必写。

量子位 · 公众号

OpenClaw 悄悄更新,Peekaboo v3 让龙虾在 Mac 上长出手脚

OpenClaw 的 Peekaboo v3 给 Mac 加了 agent 能力,能直接截取像素级屏幕、读取 UI 位置,然后模拟点击、打字、快捷键、滚动和拖拽。它还把 MCP 服务接进了 Cursor、Claude Code 和 Codex,等于让模型能进桌面软件里干活。正文没披露延迟和准确率数据,这点先别太激动。

推荐理由:OpenClaw 的 Peekaboo v3 给 Mac agent 加了一套完整的 GUI 感知和操作原语,还打通了 MCP,让 Cursor、Claude Code、Codex 都能调用。对搞桌面自动化的开源玩家来说是个实用更新,但毕竟只是一篇 Reddit 帖子,没有论文或代码仓库佐证,所以放在 featured 低段,78 分。

量子位 · 公众号

Anthropic 工程师提议用 HTML 替代 Markdown,Karpathy 也表态支持

Anthropic 工程师 Thariq 发了条推,列出 5 个理由主张模型输出 HTML 而不是 Markdown,Karpathy 随后转发表示认同。他的核心论点是 Markdown 的语法歧义太多,解析器各家实现不一致,模型生成时容易出错;HTML 虽然啰嗦但结构明确,对自动化处理和前端渲染更友好。正文没披露具体是哪 5 个理由,只提到生成 HT...

推荐理由:Anthropic 工程师 Thariq 主张用 HTML 替代 Markdown,Karpathy 也表态支持,这事在开发者圈子里容易吵起来。我会先打个折:这不是模型发布或产品更新,只是一场格式辩论。但文章给了具体数字——HTML 生成时间是 Markdown 的 2 到 4 倍,说明成本差距不小,从业者会关心 token 消耗和维护复杂度。正文没披露实验环境或代码,所以别太激动,目前只是一篇 Reddit 帖子,没有独立复现或论文支撑。

AI HOT 精选

npm 大规模供应链投毒,TanStack、Mistral AI 等 160 多个包被植入窃密代码

安全机构 Socket 发现一起名为“Mini Shai-Hulud”的供应链攻击,攻击者利用 GitHub Actions 的三个漏洞,在 npm 上发布了近 373 个恶意版本,覆盖 160 多个包名。受影响的不只是 TanStack 旗下的 84 个包(其中 @tanstack/react-router 周下载量超 1200 万次),还包括 Mi...

推荐理由:这条是实打实的安全事件,不是模型或产品发布,所以分数没往上拉。Socket 的发现够硬,但正文里没提有独立复现或公开的论文/代码仓库,我会先打个折,78 分合理。

AI HOT 精选

Mira 的新公司 Thinking Machines 发了个原生多模态交互模型,前台 200 毫秒一响应,后台跑长线推理

这个模型把音频、视频、文字直接吃进去,不用再靠 agent 把一堆独立模型串起来。前台交互模型每 200 毫秒处理一次输入,保持对话的实时感,用户可以随时打断;后台推理模型负责长程规划和调工具。正文没披露具体参数量、训练数据和成本,也没给评测对比,所以实际效果和泛化能力还得看后续公开信息。

推荐理由:我会先打个折:正文没披露定价、开放范围和具体 benchmark,所以只能按现有信息给到 87。亮点在于 Thinking Machines 没有只发模型权重,而是给了一套前台 200 毫秒交互节点加后台推理的分层设计,原生多模态输入不是后期缝合的。这对正在折腾实时多模态 agent 的团队来说,至少提供了一个可参考的架构思路,但没看到代码或论文之前,不宜再往上拉。

Computing Life · 鸭哥

AI 怎么让我失眠,又怎么帮我找回了睡眠

作者三月底开始严重失眠,每晚只能睡两三个小时,辞职后也没好转。他没靠瞎猜,而是让 AI 花五分钟写了个 app,把苹果手表和手机里 HealthKit 的健康数据(咖啡因、酒精、入睡时间、深睡时段等)全导出来,再让 AI 跑多变量回归分析,看哪些因素和睡眠时长负相关最明显。结果发现,晚饭后最后一次用 AI 的时间是头号变量——用得越晚,睡得越差;而喝咖...

推荐理由:这篇是个人量化实验,不是行业大新闻,但数据很具体。作者先写了个 app 拉出 HealthKit 数据,做回归发现晚饭后最后一次用 AI 的时间越晚,当晚睡眠越短;停用后平均多睡 1 小时 40 分钟。我会先打个折:这只是单人数据,没有复现,也没公开代码或论文,所以重要性停在 78。但 HKR 三项都成立,角度新鲜,数字也够硬,对开源微调那批人来说,既戳中 AI 过劳的焦虑,又给了个可复现的追踪思路。

Computing Life · 鸭哥

我用 AI 治好了 AI 造成的失眠

作者在 2026 年 3 月左右开始严重失眠,每晚只能睡两三个小时。他让 AI 写了个工具,把 Apple Watch 和 iPhone 里的健康数据全导出来,再让 AI 跑多元回归分析,结果发现最影响睡眠的变量是晚饭后使用 AI 的时间——用得越晚,睡得越差。咖啡因、酒精这些反而没表现出明显关联。原因可能是用 AI 时人一直在高强度阅读、思考和并行处...

推荐理由:HKR 三项都成立:个人反转有传播力,HealthKit 加回归分析给了可验证的细节,睡眠损失直接打在 AI 从业者的痛点上。不过这只是单篇 Reddit 帖子,没有独立复现或论文/代码公开,所以保持在 featured 档的 72 分。

Sinocism · 比尔·毕晓普

中国三部门联合发文,要给 AI 智能体立规矩

网信办、发改委和工信部在 5 月 8 号发了一份《智能体规范应用与创新发展实施意见》,专门盯上了那些权限高、能自己干活的 AI 智能体。文件主要担心三点:隐私泄露、智能体擅自行动,以及行为失控。官方在答记者问里说,现在手机助手、端侧管家这类智能体产品铺得很快,但高自主性也带来了新风险。文件把这项工作跟一个 2027 年的目标绑在了一起——到那时,新出的...

推荐理由:这篇把智能体规范文件拎出来讲,角度抓得准:不是泛泛谈安全,而是直接点出高自主、高权限带来的三类失控风险,并挂上2027年普及率目标,让政策有了落地感。不过目前只是红迪上的一篇帖子,没有论文或代码佐证,所以重要性停在78,属于政策风向标而非产品级事件。

r/LocalLLaMA

Reddit 网友实测 288 次模型调用,把本地模型输出 JSON 时的各种翻车方式全整理了一遍,还写了个修复库

Reddit 用户 kexxty 用 OpenRouter 跑了 288 次结构化输出测试,覆盖 Llama 3、Mistral、Command R、DeepSeek、Qwen 等模型,发现本地模型和纯 API 模型在 JSON 上出的错其实差不多。他把这些失败归类后,写了一个叫 outputguard 的 Python 修复库,用 MIT 协议开源。...

推荐理由:HKR 三项都成立:288 次调用不是随便跑跑,outputguard 库和 15 步修复链给了可复用的实操细节。信息源是单篇 Reddit 帖子,没有第三方验证或论文背书,所以放在 72-77 的 featured 档位,不往上走。

AI HOT 精选

OpenAI 发布 Daybreak,把自家模型和 Codex 打包成网络安全防御工具

OpenAI 宣布推出 Daybreak,一个面向安全团队的 AI 防御系统,整合了他们最强的模型、Codex 以及安全合作伙伴的能力,目标是加快漏洞发现和软件防护的速度。正文没披露具体定价、上线时间,也没给出任何防御效果的实测数据,所以实际能防住什么级别的攻击、误报率多少都还不清楚。

推荐理由:OpenAI 发了个 Daybreak 的安全产品公告,把模型、Codex 和合作伙伴绑在一起做网络防御,听着像个正经产品。但我会先打个折:全文没给一个防御指标,也没说什么时候能用、花多少钱,目前更像一个概念拼盘。它踩中了 AI 攻防和合规的焦虑点,所以值得提一嘴,但缺干货让它只能停在产品更新这个档位。

AI HOT 精选

把大模型命令塞进脚本第一行:用 shebang 直接跑 LLM

Simon Willison 试了一种很野的玩法:把 LLM 命令行工具直接写在脚本的 shebang 行里,让一个纯文本文件变成可执行脚本。最简单的例子是 `#!/usr/bin/env -S llm -f` 下面直接跟一句“画个骑自行车的鹈鹕 SVG”,就能生成图片。复杂一点的可以用 `-T` 参数调用外部工具(比如报时),或者直接在 YAML 模...

推荐理由:Simon Willison 这次没发新模型,也没推平台,就是演示了一个把 LLM 当 shebang 解释器的命令行玩法。我会先打个折:这更像一个巧妙的黑客技巧,不是生产级方案,正文也没披露错误率或延迟数据。但它的价值在于把“用自然语言写脚本”这件事拉到了终端里,fragments 和 -T 这些参数让例子能直接跑通,对经常写胶水脚本的开发者来说,看一眼就会想试试。整体属于低配 featured,因为影响范围还在 CLI 自动化这个圈子里,没往外扩。

AI HOT 精选

Replit 上线并行代理,一次能跑 10 个代理同时干活

Replit 新出的并行代理功能,允许最多 10 个代理同时跑。每个代理拿到的都是你应用的独立副本,在各自的机器上互不干扰,最后通过一个代理工作流把结果合并回来。正文没披露合并冲突怎么处理、任务怎么拆分,也没给出具体提速数据,这点先别太激动。

推荐理由:Replit 这次把并行代理的上限拉到 10 个,每个代理独立跑应用副本再合并,相当于让多个 AI 程序员同时改代码然后合分支。正文没讲合并冲突怎么处理、代理间怎么分工,这点先别太激动。整体是个中等体量的开发者工具更新,还没到 Cursor Agent 模式那种量级,所以放在 featured 档。

AI HOT 精选

Gemini 现在能翻你的 Gmail 和相册,自动拼出一个旅行计划

Gemini App 推出了“个人智能”功能,可以把你的 Gmail、Google Photos、搜索记录和 YouTube 观看历史串起来,直接生成一份定制旅行行程。它省去了你自己翻邮件找酒店、从相册回忆地点的步骤。你随时可以选哪些 App 给它读,也能关掉个性化设置。正文没披露它具体怎么处理隐私数据、会不会把邮件内容喂给模型训练,这点先别太激动。

推荐理由:我会先打个折:正文只说了功能方向,没披露权限粒度、数据范围能不能自己勾选、行程质量怎么评估。亮点是 Google 第一次把四个核心数据源串起来给个人助手用,不再是单点功能。但这点先别太激动——没讲清楚用户能不能关掉某个数据源、数据是本地处理还是上传,也没给任何准确率或用户测试结果。对从业者的刺激在于:如果这套跑通,Google 助手的记忆深度会甩开只能读聊天记录的竞品一截;如果跑不通,就是一次隐私翻车现场。

AI HOT 精选

Anthropic 把 Claude 平台搬上了 AWS,现在能用 AWS 账号直接买单了

Claude 平台在 AWS 上正式上线,AWS 客户可以直接用现有的 AWS 账号登录、走 AWS 的账单付款,还能用已承诺的消费额度来抵扣。这意味着你不用再单独搞一套 Anthropic 的账户和支付,采购流程会简单不少。功能上,这次把完整的 Claude API 套件都带过来了,包括能托管运行 AI 智能体(让模型按流程自动干活)、代码执行、文件...

推荐理由:这事说白了就是 Claude 在 AWS 上开了个官方旗舰店。以前你可能得单独找 Anthropic 申请、单独结账,现在直接用 AWS 的账号体系和承诺消费额度就能买单,对已经绑在 AWS 上的公司来说,采购和合规流程会顺滑很多。功能上没新东西,就是把智能体、跑代码、传文件这些 API 打包进 AWS 的计费管道里。正文没提价格有没有变化,这点先别太激动。

AI HOT 精选

Karpathy 聊人机交互下一步:别只让模型吐 Markdown,试试让它直接写 HTML

Karpathy 觉得现在大模型默认输出 Markdown 太简陋了,他建议直接让模型生成带排版、图形和交互的 HTML,界面会好用很多。更远的想法是“交互式神经视频”——用扩散模型实时生成能操作的画面,但他也承认这玩意儿怎么跟精确的传统软件配合还是个没解的问题。输入这边,光靠语音、文字或视频不够,得加上手势指点这类更自然的交互。在脑机接口到来之前,输...

推荐理由:Karpathy 这条推文没给数据,就是个人判断,所以重要性只能打到 featured 的及格线。但他把 LLM 输出形态的变化串成了一条线:从纯文本到带格式的 Markdown,再到能直接渲染的 HTML,最后抛出“交互式神经视频”这个方向。我会先打个折——神经视频现在连跟传统软件精确配合都做不到,正文也没说怎么解决,这点先别太激动。不过对做 AI 产品的人来说,这个框架确实能帮他们想清楚下一步该把界面做成什么样。