跳到正文

#Agent

今日 39 条

5月13日星期三

TechCrunch · AI

Medicare 新支付模型 ACCESS 给 AI 留了买单通道,科技圈还没反应过来

美国联邦医保 Medicare 推出了一个叫 ACCESS 的新支付模型,第一次允许医疗机构为“两次门诊之间照顾病人”的服务向政府要钱。以前没有报销机制能覆盖这类工作:比如 AI 打电话问病人有没有按时吃药、帮忙协调住房转介、确认处方药有没有取。ACCESS 把这个口子打开了。文章没披露具体费率、哪些州先试点、什么时候落地,也没说对 AI 供应商的准入...

推荐理由:这条消息对做医疗 AI 的人是个信号:Medicare 开始给 agent 类服务留支付接口了。我会先打个折,因为正文没披露支付标准、上线时间和适用州,没法判断落地节奏。但光是“支付模型为 AI 设计”这个提法,就比大多数产品更新更值得关注,所以放在 featured 中档。

AI HOT 精选

Claude Code 加了个 /goal 指令,让模型自己跑到任务做完

Claude Code 新上线了 /goal 功能,你下完指令后 Claude 会持续干活直到任务完成,不用人在旁边盯着。帖子没写这个功能怎么触发、哪些版本能用、要不要额外付费,也没提任务卡住或跑偏时怎么处理。

推荐理由:HKR 三项都过,因为 /goal 解决的是 Claude Code 用户常遇到的 agent 中途停摆问题。这只是 Anthropic 单功能更新,细节披露不多,所以放在 featured 低位,不算当天重磅消息。

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。

AI HOT 精选

OpenAI 演示 Codex 在 Mac 上跨应用后台干活,不用占着你的电脑

OpenAI 开发者账号发了一段演示,Codex 能跨 Mac 应用点击、输入、在后台持续执行任务,不会锁住你的鼠标键盘。视频里 @AriX 和 @romainhuet 聊了这种代理能干的事,但正文没披露发布时间、权限怎么设计、以及这次开放给哪些用户。

推荐理由:我会先打个折:正文只有一段演示描述,没给发布时间、权限模型、可用范围,所以重要性停在 76 分。钩子很直接——Codex 能在 Mac 后台帮你跨应用点按钮、填文字,听着像本地 RPA 但由模型驱动。这点先别太激动,因为没交代它怎么拿系统权限、会不会误操作、有没有沙箱。对开发者来说,这要么是桌面 agent 的一大步,要么是个安全坑,得等更多细节。

AI HOT 精选

Anthropic 安全团队用自家 Claude Code 搭了个威胁检测平台,一天出原型、一周上线

Anthropic 的检测平台工程团队用 Claude Code 开发了 CLUE 威胁检测与响应平台。他们一天就做出了概念验证,一周完成交付。这个平台把安全分析员查日志的时间从几小时压缩到了几分钟。文章是团队技术负责人 Jackie Bow 写的,主要讲他们怎么用 Claude Code 自动处理告警、加速调查,但没披露具体用了哪些模型、实际误报率多...

推荐理由:这是 Anthropic 安全团队自己吃狗粮的案例,不是 Claude Code 功能发布。CLUE 平台和一天 PoC、一周交付的时间线让它刚好够上 featured 门槛,但我会先打个折——内部案例的通用性还没验证,正文也没披露误报率、处理量这些硬指标。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

AI HOT 精选

Claude 给律师和法务做了一套专用工具,能直接进 Word 和 Outlook 干活

Anthropic 发布了 20 多个 MCP 连接器和 12 个法律专用插件,让 Claude 能直接操作合同管理系统、研究平台、文档管理和电子取证软件。具体来说,它可以在 Word 里起草和修改合同,在 Outlook 里处理日常法律流程,还能做条款对比。正文没披露这些工具的实际准确率、客户测试数据或定价,所以效果和成本现在还没法判断。

推荐理由:Anthropic 这次不是发模型,而是给 Claude 配了一套法律行业的“工具包”:20 多个 MCP 连接器加 12 个插件,直接嵌进 Word 和 Outlook 里干活,合同起草、修订、条款比对都能做。我会先打个折——正文没披露这些连接器具体覆盖哪些系统、插件是自己做的还是第三方接的,也没给实际客户案例或效率数据,所以“省了多少时间”现在说不清。但方向很明确:让模型进业务流程干活,而且选了一个对准确率要求极高、人工成本也高的行业。如果是真的跑通了,律所和法务团队的重复劳动会被吃掉一大块。这点先别太激动,等看有没有律所站出来说实测结果。

AI HOT 精选

谷歌在 Android Show 2026 上发了新助理 Android Intelligence,能跨 App 自动干活

谷歌这次推的 Android Intelligence 是一个系统级智能助理,主打跨安卓应用的多步骤自动化任务,比如你让它订咖啡、回消息、填表,它可以自己切 App 完成。Chrome 里的 Gemini 也加了浏览器操作能力,能直接帮你操作网页。另外还有语音笔记转文字功能叫 Rambler,以及可以自定义的生成式 UI 小组件。整场发布没提具体推送时...

推荐理由:这条消息抓人是因为安卓系统级的智能助理,能跨 App 自动操作,不是某个 App 的小修小补。具体放出的功能点挺实在:Chrome 里让 Gemini 直接帮你用浏览器、自动填表、语音转文字,还有可定制的小组件,都是开发者能马上摸到的界面。正文没给技术细节和实际延迟数据,所以效果先打个折。但这件事本身是移动 AI 代理的卡位战,对做工具和分发的团队来说,风向意义大于单点功能。

Hacker News 首页

Hopper:给大型机配了一个能看懂 z/OS 的 AI 操作界面

Hypercubic 发布了 Hopper,一个把 AI 助手直接塞进大型机开发流程的桌面工具。它自带真实的 TN3270 终端,AI 能识别 ISPF 面板、写严格对齐列位的 JCL 作业、把 SDSF 里的失败信息翻译成具体的异常码和出错行,还能像查 SQL 一样查询 VSAM 数据集。编译、测试、上线可以一条指令完成,但每次改动前会暂停等你批准,...

推荐理由:Hypercubic 这个 Hopper 把 TN3270 终端、z/OS 面板和 AI agent 揉在一起,让 agent 能直接操作大型机上的 COBOL 系统,敏感步骤还得人工点个头才放行。想法挺有意思,但正文没给出任何客户、定价或实际跑起来的效果数据,目前只是 Show HN 阶段的小团队产品展示。我会先打个折,等有真实案例再往上调。

AI HOT 精选

Google 用 ADK 搭了一个能跑几周不丢上下文、会自己暂停和恢复的 AI 助手

Google 开发者博客发了一篇教程,用自家的 Agent Development Kit(ADK)搭了一个“新员工入职协调助手”。这个助手能跑好几周:发完欢迎邮件就自己暂停,等员工签完文件再继续,中间还能把装电脑的活派给另一个专门的小助手,最后发一份定制的第一天日程。文章没给具体性能数据,但重点讲了三个让 demo 变生产可用的架构思路:用结构化的持...

推荐理由:Google Developers 这篇教程没发新模型或新平台,但把长时运行智能体的持久化机制讲得很实在:状态机管流程、会话存储保上下文、Webhook 接外部系统。我会先打个折,因为只是工程实践分享,不是重大发布,但对正在落地 agent 的团队来说,这种能跑几天不丢状态的方案比很多 demo 更有用。

TechCrunch · AI

Google 在 Android Show 上发了什么:AI 笔记本、能帮你干活的 Gemini、随口说说的桌面小部件

Google 在 I/O 大会前办了一场 Android Show,把 Gemini 助手塞进了更多地方。新发布的 Googlebooks 笔记本主打 AI 优先,但正文没披露具体配置、价格和上市时间。Gemini 变得更“代理化”,意思是它能跨 App 帮你完成一连串操作,不过实际效果还得看落地。Android 桌面小部件现在支持“vibe codi...

推荐理由:Google 在 I/O 前一口气甩出好几个 Gemini 相关的 Android 更新,我会先打个折:正文没给参数、没标价格、也没说什么时候能用上,所以只能当产品信号看。比较有意思的是 vibe-coded widgets,等于让用户用自然语言描述就能生成桌面小组件,门槛降得很低;Googlebooks 则像是把笔记和 Gemini 的搜索/总结能力缝在一起,能不能打还得看实际体验。整体属于有话题但缺验证的 mid-weight 产品更新。

The Verge · AI

Google 给 Gemini 加了几个新功能,核心是让它能直接操作你的安卓手机

Google 在安卓发布会前搞了个预演,推出了叫 Gemini Intelligence 的东西。简单说,就是把 Gemini 塞进安卓版 Chrome 浏览器里,能帮你自动填表,还能跨 App 执行操作。这离“手机自己用自己”又近了一步。不过正文没提哪些机型能用、什么时候推送、要不要另外付费,这些关键信息都还空着。

推荐理由:H、K、R 三条都成立。Gemini 开始接管 Android 上的 Chrome、自动填充和 app 内操作,不再是纯对话工具。我会先打个折:正文没披露支持设备清单、推送时间和定价,所以只能算产品更新,分数压在 72–77 这个区间。

TechCrunch · AI

Google 给安卓加了能跨 App 干活的 AI,还能用嘴说一个桌面小组件

Google 在安卓发布会上甩出了 Gemini Intelligence 这面新旗号,核心是让 AI 在手机里帮你跨 App 跑腿,比如填表、语音输入、上网查东西。比较有意思的是“vibe-coded widgets”——你直接用自然语言描述想要什么小组件,它就能给你生成出来,不用写代码。不过正文没提这些功能什么时候上线、哪些手机能用、收不收费,也没...

推荐理由:我会先打个折:正文只说了 Gboard 听写和表单填写这两个具体能力,发布时间、设备范围和价格全都没提,所以信息增量有限,不能给太高。但“agentic AI + vibe-coded widgets”这个说法本身挺抓人——一边是让模型进系统流程干活,一边是用自然语言随手生成小组件,对移动端 AI 入口的想象空间有拉动。这点先别太激动,毕竟没落地细节,但作为平台级更新,值得放进 featured 里让从业者扫一眼。

AI HOT 精选

Anthropic 在 Code w/ Claude SF 2026 上给开发者工具加码:Claude Code 调用频率翻倍,托管智能体新增记忆审查、多...

Anthropic 在旧金山的年度开发者大会上宣布了几项更新。Claude Code 的速率限制直接翻了一倍,Opus 模型的 API 调用上限也提高了,对重度用户来说不用那么频繁撞墙了。Claude 平台上的托管智能体(hosted agents)这次加了四个新功能:记忆审查,让智能体能回顾之前的对话;多智能体委派,可以把任务分给其他智能体去干;输出...

推荐理由:Anthropic 这次更新有具体数字和功能列表,不是画饼。速率翻倍对重度用户是实打实的改善,托管智能体加 4 项功能也说明他们在推 agent 落地。没有新模型发布,所以重要性在 78–84 这个区间合理。

5月12日星期二

AI HOT 精选

在 Claude Code 里装 OpenAI 官方 Codex 插件,让两个模型搭伙干活

作者在 Claude Code 的插件市场里加了 OpenAI 的官方库,把 Codex 插件装好、重载、配完就能用。这么做的思路来自 HeavySkill 论文的“重思考”方法:让多个模型各自独立推理,再找一个模型当主持人把思路揉到一起,提高最终回答质量。作者现在搭的 Skill 就是 Claude Code 负责推理,Codex 当主持人。正文没提...

推荐理由:HKR 三项都成立:跨模型插件调用有新闻性,安装路径可操作,对 AI 开发工作流有实际影响。但这是一篇教程型分享,不是模型或平台发布,所以只给 featured 低档。

r/LocalLLaMA

一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

Reddit 用户 grumd 在一张 RTX 5080(16GB 显存)和 64GB 内存的单机上同时跑了两套模型:Qwen2.5-Coder-7B Q6 做代码补全,Qwen3.6-35B-A3B Q8 做智能体编程(让模型自己规划步骤、调用工具写代码)。35B 那个模型用了内存卸载,上下文能撑到约 145k,速度是每秒 35.29 个 token...

推荐理由:这是一篇 Reddit 个人实验帖,不是系统评测,没有对比其他方案或验证稳定性,所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了,对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率,这点先别太激动。

Google DeepMind

Google DeepMind 发布 Co-Scientist 多智能体科研系统

Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。

推荐理由:原文披露了多智能体系统的三阶段协作机制与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体路径。

Hacker News 首页

Statewright:用可视化状态机给 AI 智能体上把锁,让它干活更靠谱

这是一个刚在 Hacker News 上展示的开源项目,核心思路是用 Rust 写一个状态机引擎,把 Claude Code 能调哪些工具、能跑多少轮、怎么跳转、什么条件下才能执行下一步,全部用状态图管起来。作者说 130 亿到 200 亿参数的模型在真实的 SWE-bench 任务上表现都有稳定提升,但正文没披露具体的基准分数、样本量和评测流程,这点...

推荐理由:我会先打个折:SWE-bench 具体分数没披露,没法判断改进幅度有多大。但用状态机硬约束工具调用这个思路本身靠谱,尤其对 Claude Code 这类编程 agent 的稳定性有帮助。小模型能跑是个加分项,说明不是堆算力的玩法。整体值得推荐,但别把“一致改进”当成碾压性提升。

AI HOT 精选

想让 AI 当个人管家?先得把你在淘宝、京东、美团上的消费记录弄出来

作者实测了五个主流消费平台的数据导出方法。淘宝自带导出功能;京东没有官方支持,但作者用 Codex 写了个 Chrome 插件,能一键导出订单,代码已开源在 GitHub;饿了么可以申请导出 Excel;美团外卖目前完全没办法导出;大众点评的收藏列表也能通过定制插件导出来。作者把京东和大众点评的工具都开源了,目的是让用户拿这些消费数据喂给 AI Age...

推荐理由:这篇文章不是平台官方发布,是一个开发者的实操记录,所以重要性停在 featured 档。但 H、K、R 三项都踩中了:用订单数据喂 AI 助手这个切入点够抓人,5 个平台的具体导出方式是新事实,开源工具直接降低了数据可移植性的实现成本。我会先打个折——正文没披露导出数据的字段完整度和后续清洗工作量,这点先别太激动,但作为动手参考已经够用。

TechCrunch · AI

AI 语音公司 Vapi 拿下亚马逊 Ring 订单后估值冲到 5 亿美元,从 40 多家对手中胜出

Vapi 做的是让 AI 接打电话的语音平台。亚马逊旗下的 Ring 在评估了 40 多个方案后选了它,用来处理客户支持和销售电话。公司说从 2025 年初到现在,企业业务规模翻了十倍,最新一轮融资后估值达到 5 亿美元。不过正文没披露具体营收数字和 Ring 这笔单子的金额,所以这个十倍增长是从多小的基数算起的,得打个折看。

推荐理由:一条融资新闻能到 featured,靠的是 Amazon Ring 那场 40 选 1 的比稿。这不是 PR 通稿里自己说“领先”,而是客户掏钱投票的结果。5 亿美元估值和 10 倍企业增长让故事有厚度,但正文没披露收入基数,所以 10 倍到底是从 10 万涨到 100 万还是更大体量,这点先别太激动。整体看,语音 agent 进大客户采购流程这件事本身比估值数字更有信息量。

新智元 · 公众号

OpenAI 发布 GPT-Realtime-2,一个号称 GPT-5 级推理能力的实时音频模型

OpenAI 推出了 GPT-Realtime-2,官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口,提供五档推理强度可选,API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过,这篇文章因...

推荐理由:OpenAI 同一天发的产品更新,实时音频推理是个硬功能,不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果,32/64 美元的定价也给了算账依据。我会先打个折:正文没提延迟数据和实际录音样本,这点先别太激动。但语音 agent 的落地成本一直是瓶颈,这篇信息密度够,值得推给做实时交互的从业者。

新智元 · 公众号

智元机器人量产破万,人形机器人已在南昌 3C 产线连续干活 8 小时零失误

智元机器人(AgiBot)公布,到 3 月底已出货超过一万台通用具身机器人。在南昌一条 3C 产线上,他们的人形机器人连续工作了 8 小时,按正式节拍要求完成了 2283 项任务,没有出错。不过,文章正文因为微信环境验证被屏蔽了,具体是哪款机型、任务细节和成本都没法看到。

推荐理由:智元自己报的量产和产线数据,我会先打个折——没有第三方验证,也没披露单台成本和故障率。但 1 万台这个数字在通用机器人圈子里确实少见,南昌那条 3C 线能跑 8 小时零失误,至少说明在特定场景下稳定性过了门槛。正文没提具体客户和付费情况,这点先别太激动。

Latent Space

Thinking Machines 发布原生交互模型:2760 亿参数,120 亿激活,实时语音不再靠外挂

Thinking Machines 终于又冒泡了,这次直接扔了个新模型 TML-Interaction-Small。总参数 2760 亿,是个 MoE 架构,实际干活时只激活 120 亿参数。它最狠的地方是把实时语音交互做进了模型骨子里,不再像以前那样给大语言模型外挂语音识别和合成模块。模型能同时听、说、看、想,用 200 毫秒一个的“微对话轮次”连续...

推荐理由:我会先打个折——基准分是 Thinking Machines 自己跑的,还没第三方复现,所以“超过 GPT 和 Gemini”先别太激动。但这条消息值得推,因为它给出了具体架构(276B MoE、12B 激活)、200ms 微轮次这个硬指标,还直接挑战了语音 agent 里常用的 VAD 方案。对正在搭实时语音管线的从业者来说,哪怕只是思路参考也有价值。

FT · 科技

亚马逊员工用内部 AI 工具刷分,把没必要的活也丢给 AI 干

FT 报道,亚马逊内部有个叫 MeshClaw 的工具,员工可以把工作委托给 AI 代理去完成,公司还搞了个 AI 使用排行榜。结果有员工为了冲榜,开始把一些根本不需要 AI 处理的活也丢进去跑。报道没披露具体有多少人这么干、排行榜的计分规则是什么,也没说这些“没必要的任务”到底是哪些。

推荐理由:FT 这篇报道给了一个亚马逊内部 AI 落地被玩坏的实例,HKR 三项都踩中了。正文没写参与人数、评分规则和任务类型,所以放在 featured 而不是必写。

量子位 · 公众号

OpenClaw 悄悄更新,Peekaboo v3 让龙虾在 Mac 上长出手脚

OpenClaw 的 Peekaboo v3 给 Mac 加了 agent 能力,能直接截取像素级屏幕、读取 UI 位置,然后模拟点击、打字、快捷键、滚动和拖拽。它还把 MCP 服务接进了 Cursor、Claude Code 和 Codex,等于让模型能进桌面软件里干活。正文没披露延迟和准确率数据,这点先别太激动。

推荐理由:OpenClaw 的 Peekaboo v3 给 Mac agent 加了一套完整的 GUI 感知和操作原语,还打通了 MCP,让 Cursor、Claude Code、Codex 都能调用。对搞桌面自动化的开源玩家来说是个实用更新,但毕竟只是一篇 Reddit 帖子,没有论文或代码仓库佐证,所以放在 featured 低段,78 分。

Computing Life · 鸭哥

AI 怎么让我失眠,又怎么帮我找回了睡眠

作者三月底开始严重失眠,每晚只能睡两三个小时,辞职后也没好转。他没靠瞎猜,而是让 AI 花五分钟写了个 app,把苹果手表和手机里 HealthKit 的健康数据(咖啡因、酒精、入睡时间、深睡时段等)全导出来,再让 AI 跑多变量回归分析,看哪些因素和睡眠时长负相关最明显。结果发现,晚饭后最后一次用 AI 的时间是头号变量——用得越晚,睡得越差;而喝咖...

推荐理由:这篇是个人量化实验,不是行业大新闻,但数据很具体。作者先写了个 app 拉出 HealthKit 数据,做回归发现晚饭后最后一次用 AI 的时间越晚,当晚睡眠越短;停用后平均多睡 1 小时 40 分钟。我会先打个折:这只是单人数据,没有复现,也没公开代码或论文,所以重要性停在 78。但 HKR 三项都成立,角度新鲜,数字也够硬,对开源微调那批人来说,既戳中 AI 过劳的焦虑,又给了个可复现的追踪思路。

AI HOT 精选

OpenAI 办了一场“参数高尔夫”比赛,1000 多人用 AI 助手卷模型压缩,我们看到了什么

OpenAI 搞了个叫 Parameter Golf 的机器学习挑战赛,规则很硬:模型加代码总大小不能超过 16MB,训练时间只有 10 分钟(用 8 张 H100),看谁能在固定数据集上把测试损失压到最低。超过 1000 人提交了 2000 多次结果。我会先打个折,正文没披露最终冠军的具体分数,但重点讲了技术路数。最卷的方向是训练优化,有人把前人的好...

推荐理由:OpenAI 的 Parameter Golf 复盘靠一场实打实的比赛、1000多名参与者和2000多份提交撑住了 HKR 三项。它属于研究/基准信号,不是模型或产品发布,所以 78 分放在 featured 里偏低的那一档是合理的。我会先打个折:目前只有一篇 Reddit 帖子,没有独立复现,也没看到论文或代码放出来。

The Verge · AI

OpenAI 发布 Daybreak,正面回应 Anthropic 的安全模型 Claude Mythos

OpenAI 推出 Daybreak 安全项目,把 3 月发布的 Codex Security AI 智能体用起来,先给组织代码建威胁模型、梳理可能的攻击路径,再自动验证和检测高风险漏洞。这距离 Anthropic 公布 Claude Mythos 安全模型仅一个多月——Anthropic 当时说这模型太危险不能公开,只放在自家 Project Gla...

推荐理由:H/K/R 全中:Daybreak 有明确的竞品对标、具体的 agent 工作流,也戳中代码安全审计的共鸣点。不过这只是 Reddit 单帖,没有独立复现或论文/代码放出来,所以分数压在 82 没往上走。

Computing Life · 鸭哥

我用 AI 治好了 AI 造成的失眠

作者在 2026 年 3 月左右开始严重失眠,每晚只能睡两三个小时。他让 AI 写了个工具,把 Apple Watch 和 iPhone 里的健康数据全导出来,再让 AI 跑多元回归分析,结果发现最影响睡眠的变量是晚饭后使用 AI 的时间——用得越晚,睡得越差。咖啡因、酒精这些反而没表现出明显关联。原因可能是用 AI 时人一直在高强度阅读、思考和并行处...

推荐理由:HKR 三项都成立:个人反转有传播力,HealthKit 加回归分析给了可验证的细节,睡眠损失直接打在 AI 从业者的痛点上。不过这只是单篇 Reddit 帖子,没有独立复现或论文/代码公开,所以保持在 featured 档的 72 分。

The Verge · AI

Mira Murati 的新公司 Thinking Machines 在做什么:让模型边看边听边想,实时跟你协作

Thinking Machines 周一公布了他们的方向——做“交互模型”。按他们的说法,这种模型能同时接收音频、视频和文字,实时理解、回应并行动,而不是像现在的模型那样等你打完字或说完话才开始反应。正文没披露模型规模、发布时间、定价和最终产品形态,所以这东西到底多能打、什么时候能用上,现在都还是未知数。

推荐理由:这篇帖子给出了公司方向,但正文没披露模型参数、发布时间或产品形态,本质上是一次高关注度的创业方向亮相,不是可用的模型发布。HKR 三项都踩中,但信息缺口明显,所以留在 77 分这个位置,没往上拉。

Sinocism · 比尔·毕晓普

中国三部门联合发文,要给 AI 智能体立规矩

网信办、发改委和工信部在 5 月 8 号发了一份《智能体规范应用与创新发展实施意见》,专门盯上了那些权限高、能自己干活的 AI 智能体。文件主要担心三点:隐私泄露、智能体擅自行动,以及行为失控。官方在答记者问里说,现在手机助手、端侧管家这类智能体产品铺得很快,但高自主性也带来了新风险。文件把这项工作跟一个 2027 年的目标绑在了一起——到那时,新出的...

推荐理由:这篇把智能体规范文件拎出来讲,角度抓得准:不是泛泛谈安全,而是直接点出高自主、高权限带来的三类失控风险,并挂上2027年普及率目标,让政策有了落地感。不过目前只是红迪上的一篇帖子,没有论文或代码佐证,所以重要性停在78,属于政策风向标而非产品级事件。

彭博科技

GitLab 宣布裁员,省下的钱要投给 AI agent 业务

GitLab 说会裁掉一部分岗位,把省出来的人力和预算转到 AI agent 方向。具体裁多少人、砍哪些部门、省出多少钱、什么时候开始执行,正文都没披露——因为 Bloomberg 原文被付费墙挡了,只拿到 RSS 摘要。我会先打个折:这更像一个资源重分配的信号,不是财务危机驱动的裁员。

推荐理由:H 和 R 都站得住:Bloomberg 报道 GitLab 把裁员和 agent 投入直接挂钩,对开发者工具圈是个强劳动力信号。K 偏弱,因为人数、预算和执行时间都没披露。维持 78 分,原因是这只是一条 Reddit 帖子,没有独立复现,也没给出论文或代码。

AI HOT 精选

OpenAI 发布 Daybreak,把自家模型和 Codex 打包成网络安全防御工具

OpenAI 宣布推出 Daybreak,一个面向安全团队的 AI 防御系统,整合了他们最强的模型、Codex 以及安全合作伙伴的能力,目标是加快漏洞发现和软件防护的速度。正文没披露具体定价、上线时间,也没给出任何防御效果的实测数据,所以实际能防住什么级别的攻击、误报率多少都还不清楚。

推荐理由:OpenAI 发了个 Daybreak 的安全产品公告,把模型、Codex 和合作伙伴绑在一起做网络防御,听着像个正经产品。但我会先打个折:全文没给一个防御指标,也没说什么时候能用、花多少钱,目前更像一个概念拼盘。它踩中了 AI 攻防和合规的焦虑点,所以值得提一嘴,但缺干货让它只能停在产品更新这个档位。

彭博科技

AI 芯片公司 Cerebras 把 IPO 规模上调三分之一,想融 48 亿美元

Cerebras 把首次公开募股的融资目标从原来的水平提高了三分之一,最高要融 48 亿美元。这条视频还提到了 Circle 的一季度收入和 Google 研究人员首次用 AI 造出的零日攻击,但正文没披露这两件事的具体细节。

推荐理由:Bloomberg 这条快讯说 Cerebras 把 IPO 盘子加大了三分之一,最高要拿 48 亿美元,对 AI 芯片赛道是个不小的资本信号。不过正文没给定价、估值和时间表,所以我会先打个折,不往 85 分以上推。另外标题里还提了 Circle 一季度收入和 Google AI 生成零日攻击,但正文没展开细节,这两点先别太激动。

AI HOT 精选

把大模型命令塞进脚本第一行:用 shebang 直接跑 LLM

Simon Willison 试了一种很野的玩法:把 LLM 命令行工具直接写在脚本的 shebang 行里,让一个纯文本文件变成可执行脚本。最简单的例子是 `#!/usr/bin/env -S llm -f` 下面直接跟一句“画个骑自行车的鹈鹕 SVG”,就能生成图片。复杂一点的可以用 `-T` 参数调用外部工具(比如报时),或者直接在 YAML 模...

推荐理由:Simon Willison 这次没发新模型,也没推平台,就是演示了一个把 LLM 当 shebang 解释器的命令行玩法。我会先打个折:这更像一个巧妙的黑客技巧,不是生产级方案,正文也没披露错误率或延迟数据。但它的价值在于把“用自然语言写脚本”这件事拉到了终端里,fragments 和 -T 这些参数让例子能直接跑通,对经常写胶水脚本的开发者来说,看一眼就会想试试。整体属于低配 featured,因为影响范围还在 CLI 自动化这个圈子里,没往外扩。

AI HOT 精选

Replit 上线并行代理,一次能跑 10 个代理同时干活

Replit 新出的并行代理功能,允许最多 10 个代理同时跑。每个代理拿到的都是你应用的独立副本,在各自的机器上互不干扰,最后通过一个代理工作流把结果合并回来。正文没披露合并冲突怎么处理、任务怎么拆分,也没给出具体提速数据,这点先别太激动。

推荐理由:Replit 这次把并行代理的上限拉到 10 个,每个代理独立跑应用副本再合并,相当于让多个 AI 程序员同时改代码然后合分支。正文没讲合并冲突怎么处理、代理间怎么分工,这点先别太激动。整体是个中等体量的开发者工具更新,还没到 Cursor Agent 模式那种量级,所以放在 featured 档。

AI HOT 精选

Gemini 现在能翻你的 Gmail 和相册,自动拼出一个旅行计划

Gemini App 推出了“个人智能”功能,可以把你的 Gmail、Google Photos、搜索记录和 YouTube 观看历史串起来,直接生成一份定制旅行行程。它省去了你自己翻邮件找酒店、从相册回忆地点的步骤。你随时可以选哪些 App 给它读,也能关掉个性化设置。正文没披露它具体怎么处理隐私数据、会不会把邮件内容喂给模型训练,这点先别太激动。

推荐理由:我会先打个折:正文只说了功能方向,没披露权限粒度、数据范围能不能自己勾选、行程质量怎么评估。亮点是 Google 第一次把四个核心数据源串起来给个人助手用,不再是单点功能。但这点先别太激动——没讲清楚用户能不能关掉某个数据源、数据是本地处理还是上传,也没给任何准确率或用户测试结果。对从业者的刺激在于:如果这套跑通,Google 助手的记忆深度会甩开只能读聊天记录的竞品一截;如果跑不通,就是一次隐私翻车现场。

AI HOT 精选

Anthropic 把 Claude 平台搬上了 AWS,现在能用 AWS 账号直接买单了

Claude 平台在 AWS 上正式上线,AWS 客户可以直接用现有的 AWS 账号登录、走 AWS 的账单付款,还能用已承诺的消费额度来抵扣。这意味着你不用再单独搞一套 Anthropic 的账户和支付,采购流程会简单不少。功能上,这次把完整的 Claude API 套件都带过来了,包括能托管运行 AI 智能体(让模型按流程自动干活)、代码执行、文件...

推荐理由:这事说白了就是 Claude 在 AWS 上开了个官方旗舰店。以前你可能得单独找 Anthropic 申请、单独结账,现在直接用 AWS 的账号体系和承诺消费额度就能买单,对已经绑在 AWS 上的公司来说,采购和合规流程会顺滑很多。功能上没新东西,就是把智能体、跑代码、传文件这些 API 打包进 AWS 的计费管道里。正文没提价格有没有变化,这点先别太激动。

5月11日星期一

AI HOT 精选

Anthropic 在 GitHub 开源了一套金融 AI 模板,直接给投研、投行、风控配好了 10 个智能体和 11 家数据商的连接器

这套模板把金融行业里常见的 AI 用法打包成了开箱即用的工作流,覆盖投研、投行、风控等核心环节。里面塞了 10 个端到端智能体、7 个垂直插件,还接好了 11 家主流金融数据商的 MCP 连接器,等于把模型跟 Bloomberg 这类数据源的通路提前打通了。部署方式从个人插件到企业 API 都支持,也能塞进 Microsoft 365 和私有云。正文没...

推荐理由:我会先打个折:这不是模型发布,所以重要性到不了 85 分,但开源一套能跑的金融 agent 模板,比发篇愿景文章实在得多。Anthropic 把 10 个端到端智能体、7 个插件和 11 家数据商的 MCP 连接器打包扔上 GitHub,等于给金融行业的 AI 落地画了一条参考线,别人想跟进得先过这一关。正文没披露这些 agent 在生产环境跑到什么程度、延迟和准确率怎么样,所以别急着当成熟方案用,但作为起点,信息量和可复现性都够格进 featured。