跳到正文

#MCP/工具调用

今日 5 条

5月27日星期三

AI HOT 精选

Reachy Mini 机器人现在能完全在本地跑语音对话了

Hugging Face 给 Reachy Mini 机器人配了一套纯本地运行的语音对话方案,数据不用上传云端。他们用 speech-to-speech 库搭了一条流水线:先靠 Silero VAD 检测有没有人在说话,再用 Parakeet-TDT 把语音转成文字,接着交给大模型想怎么回,最后让 Qwen3-TTS 把文字念出来。这套东西通过一个兼容...

推荐理由:HKR 三项都成立:有个清晰的本地机器人语音钩子,技术栈细节给得实在,对边缘端语音代理场景有直接吸引力。范围就限定在 Reachy Mini 的语音交互上,所以放在 featured 档。

AI HOT 精选

TRL 新增增量权重同步:只传模型变化的部分,每步传输量从 1.2GB 降到 20-35MB

异步强化学习训练有个很现实的问题:每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB,换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现,在两次优化步骤之间,大约 99% 的 bf16 权重其实完全没变,真正变动的部分很小。他们合入了 TRL 的一个 PR,做法是把变动的权重打包成稀疏...

推荐理由:Hugging Face 在 TRL 里合了一个增量权重同步的 PR,用稀疏 safetensors 只传变化的部分,Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说,这个压缩比很实在,能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据,所以“万亿参数”目前更像一个能力上限的表述,实际效果还得看后续验证。整体是训练基础设施层面的改进,对从业者有用,但还没到必须全员关注的程度。

Computing Life · 鸭哥

用好AI的第二步:先写Skill再执行

作者提出一个反直觉但关键的工作习惯:让AI干活前,先把成功标准、踩过的坑和固定工具写成一个Skill文档。因为AI没有记忆,每次新对话都是白纸一张,不把经验外化落盘,它下次还会犯同样的错。文章解释了为什么程序员反而容易掉进“只有代码才能复用”的陷阱,并给出Skill的三个要素:描述最终想要什么而不是微操步骤、只记录AI真正犯过的错、提供确定性的工具调用...

推荐理由:这篇文章没讲新模型或产品能力,也没给实验数据,但“先写 Skill”这个动作把 agent 工作流从一次性尝试变成了可积累的资产,对日常用 Claude Code 或类似工具的人有直接参考价值。三个 Skill 要素讲得清楚,复用方式也具体,所以放在 featured 档。

Computing Life · 鸭哥

用好 AI 的第二步:先写“技能说明书”,再让 AI 干活

作者王咏刚提出一个反直觉的习惯:别上来就让 AI 直接做事,先把怎么做写成一个可复用的“技能文档”。他用 Outlook 收邮件举例,第一次花半小时把用户名、手机端批准、客户端选择这些坑都记下来,下次 AI 读这个文件就能跳过所有陷阱。核心逻辑是,AI 没有记忆,不把经验外化成文档,它就会反复踩同一个坑。程序员容易觉得只有代码才值得复用,但文章指出,研...

推荐理由:这是一篇工作流教程,不是产品或模型发布。技能文档化的机制和 Outlook 示例够实在,能上 featured;但来源权威性一般,所以定在 72 分。

AI HOT 精选

Anthropic 公开了他们在不同产品里给 Claude 上“紧箍咒”的工程实践

Anthropic 工程师分享了在 claude.ai、Claude Code 和 Claude Cowork 三款产品中限制 AI 智能体(agent)破坏力的实战经验。文章指出,随着模型能力变强,能接触的系统越多,一旦出错的“爆炸半径”就越大。他们主要靠两种思路来兜底:一是让人盯着(人在回路),但数据显示用户会点掉约 93% 的权限请求,容易产生“...

推荐理由:Anthropic 这次公开了一套针对 Claude 智能体的具体隔离控制方案,比普通的更新说明更有料。HKR 三项都满足,但这不是模型发布或重大能力升级,所以分数放在 78-84 这个区间。

5月26日星期二

r/LocalLLaMA

dlmserve 开源:首个为扩散语言模型设计的推理引擎,支持 LLaDA-8B,吞吐量是 HuggingFace 的 2.5 倍

Reddit 上有人放出了一个叫 dlmserve 的开源项目,MIT 协议,专门给扩散语言模型做推理服务。它第一个支持的模型是 LLaDA-8B-Instruct,这种模型生成文本的方式和常见的自回归模型不一样,是一步步“去噪”出完整回答。引擎对外提供兼容 OpenAI 的 /v1/chat/completions 接口,方便直接替换。性能方面,在批...

推荐理由:我会先打个折:目前只有 Reddit 一个信源,生态还很早期,所以分数没往上拉。但这条信息本身对玩本地模型的人挺实用——扩散语言模型一直缺好用的推理引擎,dlmserve 直接说自己是第一个,还给了 batch=4 下 2.5 倍 HF 吞吐、12GB 显存可跑这些具体数字,不是空喊口号。MIT 协议和 OpenAI 兼容接口也让试错成本变低。这点先别太激动,但值得放进雷达让读者知道有这么个东西出现了。

AI HOT 精选

Sundar Pichai 聊 AI 搜索:Google 想把搜索框变成帮你干活的入口

Sundar Pichai 在 Google I/O 后聊了聊公司怎么应对 ChatGPT 的冲击。核心是把 Gemini 模型塞进新的智能搜索框和 Gemini Spark 智能体平台,让搜索从“给你一堆链接”变成“直接帮你启动任务”。他回应了“Google Zero”的担忧——网站从 Google 来的流量可能归零,但没给出具体流量影响数据。另外,...

推荐理由:这篇是 Sundar Pichai 在 I/O 后的访谈,核心就两件事:Gemini 要嵌入搜索框,以及 Spark 这个让模型进业务流程干活的平台。我会先打个折——正文没披露任何模型规模、延迟数据或上线节奏,所以别当产品发布看。但它的价值在于把 Google 对搜索未来的态度摆上台面:AI 直接生成答案会进一步挤压传统网页流量,同时 Spark 又在抢 agent 平台的身位。这点先别太激动,因为没给技术细节,但方向本身对做搜索、做内容和做 agent 的人都有影响。

r/LocalLLaMA

SkillOpt 把 Markdown 技能文件当成可训练参数,用编辑操作来优化

这篇帖子正文被 Reddit 屏蔽了,只能看到标题和摘要。从现有信息看,SkillOpt 的做法是把给模型用的 Markdown 技能说明文件当作可优化的对象,而不是写死就完事。它让一个更强的模型对技能文件提出增、删、改的编辑建议,然后只在留出的验证集上接受那些确实能提升效果的改动。摘要里说,最好的技能文件通常在 1 到 4 次被接受的编辑后就会收敛,...

推荐理由:我会先打个折:目前只看到一个项目源和 Reddit 讨论,没有大规模落地数据,所以分数定在 78、featured 而不是 p1。但 HKR 三项都站得住——把技能文件当可训练参数这个 hook 够新鲜,留出验证集加 1-4 次编辑收敛的机制也讲得清楚,对做 agent 的人来说省手工调 prompt 的钱和时间是实打实的痒点。正文没披露验证集规模和任务多样性,这点先别太激动。

AI HOT 精选

通义千问 Qwen3.7-Max 编程能力排到全球第二,Code Arena 得分 1541,仅次于 Claude

Qwen3.7-Max 在 Code Arena 编程评测上拿了 1541 分,排名第二,只比 Claude 低。官方说它能连续跑 35 小时的任务、单次调用工具超过 1000 次,原本要两周的项目几小时就能搞定。不过正文没披露具体测试环境、任务类型和对比模型的详细分数,实际生产表现还得看后续验证。

推荐理由:这条消息的钩子很清晰,就是“编程第二”这个位置。给出的分数和任务时长是硬指标,虽然都来自阿里云自己的一篇发布,没有第三方交叉验证,但作为产品更新和基准测试的成绩单,信息量够、指向明确。我会先打个折——没有独立评测之前,这个“第二”更多是厂商宣称,但它的确提供了一个可被检验的标靶,值得放进 featured 让从业者自己去盯后续实测。

机器之心 · 公众号

ACL 2026 论文:Spatial-Agent 让大模型不只是调地图 API,而是生成可执行的地理分析流程

这篇 ACL 2026 主会论文提出了 Spatial-Agent,核心思路是在用户用自然语言提问和调用地图工具之间,插入一张“地理流程关系图”(GeoFlow Graph),让大模型先规划出可执行的地理分析步骤,再一步步调用 API。在 MapEval-API 评测集上,搭配 GPT-4o-mini 的 Spatial-Agent 准确率达到 45....

推荐理由:ACL 主会论文,机制和数字都拿得出手,H 和 K 能过。但 GIS 工作流这件事本身圈子小,缺了成本、安全或平台竞争这些能出圈的点,R 就够不着,放在 featured 刚好。

新智元 · 公众号

昆仑万维发布天工 Agent,号称性能逼近 Opus 4.6,还给了 2-4 周免费试用

这篇文章本身被微信环境验证挡住了,正文内容没抓到。从标题和现有英文摘要看,昆仑万维发了两个模型:SkyClaw-v1.0 和 SkyClaw-v1.0-lite,主打 Agent 场景,也就是让模型进业务流程干活。他们宣称 SkyClaw-v1.0 的输入成本是 DeepSeek V4 Pro 的 1/24、Sonnet 4.6 的 1/43,这个数字...

推荐理由:这条消息我会先打个折,因为所有性能对比和成本数字都来自厂商自己,没有第三方验证。但它的传播点很清晰:一个国产 Agent 模型宣称能力接近 Claude Opus 4.6,同时把输入价格压到对手的四十分之一,还白送几周试用。对正在被 Token 账单压得喘不过气的团队来说,哪怕只是“声称”,也足够让人点进去看一眼。正文没披露这些基准测试的具体条件和评测机构,所以“逼近 Opus 4.6”先别太激动,但成本对比如果属实,确实挺省钱。

AI HOT 精选

OpenAI 被曝下月发 GPT-5.6,上下文窗口拉到 150 万 token

开发者在 OpenAI Codex 的后台日志里挖出了一个叫 iris-alpha 的未公开模型,对应 GPT-5.6,可能 6 月发布。最直观的变化是上下文窗口涨到 150 万 token,比现在 GPT-5.5 API 的 105 万多出约 43%。有人在辅助工具 OpenCode 里实测,喂到 90 万 token 还能流畅回话,甚至能处理超过 ...

推荐理由:这条消息来自 Codex 日志泄露,不是官方公告,所以我会先打个折。但 150 万 token 的上下文窗口和 iris-alpha 代号都是实打实的数字,对做 agent 和长文档处理的人有直接参考价值。正文没提发布时间和定价,这点先别太激动。整体属于值得从业者扫一眼的更新,但还没到必须立刻行动的程度。

AI HOT 精选

Grok Build 测试版上线,SuperGrok 用户能直接用它做图、剪视频和跑自动化脚本

xAI 把 Grok Build 的测试版开放给了所有 SuperGrok 和 X Premium+ 用户。这次主要给了三个东西:Plan Mode 可以分步骤拆解任务;Imagine 模块能直接生成图片和视频;还有一个命令行工具(CLI),方便你把 Grok 接进自动化流程或者编排器里干活。想试的话去 x.ai/cli 就能开始。

推荐理由:HKR 三项都踩中了:xAI 放出一个付费测试版,功能名目列得清楚。分数卡在 featured 底线,因为正文没写能力边界、没给定价、也没测试数据,我会先打个折——东西看着热闹,但能跑多稳、花多少钱,现在还不知道。

5月25日星期一

r/LocalLLaMA

NuExtract3 发布:一个 4B 开源视觉模型,能把图片和文字转成 Markdown、做 OCR 和按模板抽信息,自己电脑就能跑

Numind 放出了 NuExtract3,一个基于 Qwen3.5-4B 的开源视觉语言模型,用 Apache-2.0 协议。它主要干三件事:把图片或文字转成 Markdown 格式、从图片里直接识别文字(OCR)、以及按你给的 JSON 模板把非结构化内容抽成结构化数据。模型只有 4B 参数,对硬件要求不高,官方说最低 4GB 显存就能在本地部署。...

推荐理由:NuExtract3 把一个 4B 大小的开源视觉模型打包成了文档抽取工具,支持 OCR、转 Markdown 和按你给的 JSON 模板把内容抽出来。最吸引人的是它最低只要 4GB 显存就能在自己机器上跑,这对在意数据不出本地的团队来说省了不少事。模型基于 Qwen3.5-4B,用 Apache-2.0 协议,没有授权上的坑。不过正文没给出具体的抽取准确率或延迟数据,实际效果得自己测一下才知道。

r/LocalLLaMA

一个让 Codex 在无头 Linux 上安全折腾的沙盒框架

作者 superSmitty9999 放出了一个概念验证工具 ai-sandbox-manager,用 LXC 模板给 Codex 开了 sudo 权限、浏览器操作、Docker 和共享 GPU 访问,同时加了个钩子阻止 git push,让模型在隔离副本里干活,降低把系统搞崩的风险。正文没披露性能开销和具体延迟数据。

推荐理由:这是个 Reddit 上的个人概念验证,作者把 Codex 塞进 LXC 沙箱,给了 sudo、浏览器和 GPU,还加了防 push 的钩子。思路很实用,解决了“让模型干活又怕它闯祸”的矛盾,但正文没给任何性能数据、稳定性测试或实际跑任务的案例,目前只能当个有趣的工程方案看,离生产环境还有距离。

AI HOT 精选

Hugging Face 发了一篇术语辨析,把智能体的模型、脚手架和线束三层结构讲清楚了

这篇博客把智能体拆成了三层:模型(就是大语言模型本身)、脚手架(通过提示词和工具描述来定义模型的行为逻辑)和线束(负责实际跑模型调用、工具调用和控制循环的代码)。作者认为现在行业里这些词被混用得厉害,比如有人把整个智能体叫脚手架,有人把执行层叫线束,这篇就是想给个实用的参照,不是要定死标准。文章还顺带理了上下文工程、策略、技能、子智能体这些常被模糊使用...

推荐理由:Hugging Face 这篇把 agent 拆成三层:模型本身、Scaffolding(定义行为)和 Harness(管工具调用与控制循环)。这个分法解决了一个很实际的痛点——现在聊 agent 的人经常把“怎么调用工具”和“谁在控制循环”搅在一起,文章直接划了条线。我会先打个折:正文没给出具体的实现案例或性能对比,更像概念梳理,所以重要性停在 72 分。对正在搭 agent 架构的从业者来说,这篇能当一张参考图用,但别指望它直接告诉你代码怎么写。

5月24日星期日

r/LocalLLaMA

在 llama-server 网页里用原生工具做联网资料检索的实操分享

一位 Reddit 用户分享了怎么在 llama-server 自带的网页界面里,直接用 llama.cpp 的原生工具实现联网资料检索(也就是 web RAG)。他的做法分七步:先开启 get_datetime 和 exec_shell_command 这两个工具,然后让模型通过 firejail 沙箱、一个独立的 Linux 用户以及一个 Alpi...

推荐理由:这是一篇社区教程,不是模型发布或产品更新,所以权威性和覆盖面有限,但实操价值高。H、K、R 三项都成立:动手门槛低、步骤清晰、切中本地部署的痛点。我会先打个折,因为来源是个人帖子,验证强度弱,但信息量足够放进精选。

新智元 · 公众号

AI 第一次独立跑完芯片设计全流程:219 个英文单词进去,7nm 图纸出来,工程师全程没碰键盘

Verkor 的 Design Conductor 用一段 219 个英文单词的规格说明,在 12 小时内自动生成了 VerCore RISC-V CPU 的 ASAP7 7nm GDSII 版图,中间没有工程师介入。跑分结果是 1.48GHz 下 CoreMark 拿到 3261 分。不过先别太激动:这颗芯片还没实际流片验证,而且正文明确说没做缓存,...

推荐理由:我会先打个折:VerCore没流片、没缓存,现在只是跑分和版图层面的演示,离真能用还差验证和量产。但219词出GDSII这个点太直观了,12小时和1.48GHz也让效率对比有了抓手。正文没披露功耗、面积和设计规则检查结果,这些缺口让“独自跑完”的说法要打问号。不过作为自动化流程的阶段性成果,数字够硬、场景够刺激,给79分合理。

r/LocalLLaMA

llama.cpp 服务器现在自带 8 个原生工具,不用再拼 MCP 就能让本地模型直接读文件、搜代码、跑命令

llama.cpp 的 server 端多了一个实验性的 --tools 参数,一口气给了 8 个内置工具:read_file、file_glob_search、grep_search、exec_shell_command、write_file、edit_file、apply_diff 和 get_datetime。说白了,就是让跑在本地的模型能直接读...

推荐理由:我会先打个折,因为还是实验性功能,而且来源主要是 Reddit 讨论,不是官方安全公告。但这事本身挺炸:llama.cpp 服务端直接塞进 exec_shell 和 edit_file,等于给模型开了系统级后门,正文又明说没有白名单和严格沙箱。对在本地跑 agent 的开发者来说,这不是“未来可能的风险”,是现在就得小心配置的东西。所以给了 featured 里偏低的分数,提醒大家注意,但不过度渲染。

5月23日星期六

AI HOT 精选

Claude Code v2.1.149:用量报告分类展示、企业可开放云端 MCP 连接器,并修了三个安全漏洞

这个版本主要做了三件事。第一,/usage 命令现在会按类别(比如对话轮次、工具调用)分开展示用量,方便你看出成本花在哪。第二,企业管理员可以通过 allowAllClaudeAiMcps 设置,允许团队直接使用 Anthropic 云端的 MCP 连接器,不用自己搭。第三,修了三个安全漏洞:PowerShell 脚本可能绕过权限执行、Git work...

推荐理由:Claude Code 的一次小版本更新,改动不多但都落在实处。/usage 现在能按类别看用量,方便你盯成本;企业管理员多了个 allowAllClaudeAiMcps 开关,可以统一放行 MCP 工具,不用一个个批。安全方面修了 3 个问题,最要紧的是 PowerShell 权限绕过——正文没展开具体利用条件,但光这个就够让运维团队推更新了。整体属于实用型发版,没画饼。

AI HOT 精选

Claude 自动模式向 Pro 用户开放,支持 Sonnet 4.6 和 Opus 4.7

Claude 的自动模式现在 Pro 计划也能用了,不再是最贵那一档的专属。这次更新还接入了 Sonnet 4.6 和 Opus 4.7 两个模型,按 Shift+Tab 就能让 Claude 自己跑任务。正文没提价格有没有变,也没说是不是全量推送,这点先别太激动。

推荐理由:这是一次中等体量的产品更新,不是新模型或重大能力发布。自动模式进 Pro 计划,配上两个模型和快捷键,对日常靠 Claude 干活的开发者有实际影响,但还没到需要全行业关注的程度。

r/LocalLLaMA

Agent 里的调度模型能做多小?有人用 3B 激活参数的 MoE 跑通了本地 ReAct 循环

这篇帖子来自一个叫 HomoAgens1 的本地部署实验,他把 Agent 的调度模型和写代码的大模型拆开看,专门测调度环节能缩到多小。他用的 Qwen3.6-35B-A3B 是个 MoE 模型,实际干活时只激活约 3B 参数,跑在一块 12GB 显存的 GPU 上,关了 30 个专家做 offload,生成速度能到每秒 40 个 token。实验发现...

推荐理由:我会先打个折:这是 Reddit 上的单人实验,不是正式发布,结论别当定论。但它的发现很实在——用 Qwen3.6-35B-A3B 跑 ReAct 编排,3B 激活参数就能在 12GB 显卡上跑到 40 t/s,成本够低。更小的模型不是推理先崩,而是工具调用纪律先坏,这个失败模式对选型很有参考价值。显存、速度和故障点都给了具体数字,对想在家用显卡上折腾 agent 的人是一手好参考。

AI HOT 精选

Kakuna:把原型代码自动加固成生产级项目的 AI 工具

Kakuna 是一个 AI 代理工具,专门把早期快速原型转成可维护的生产级代码库。它内置检查清单和“先定计划再执行”的工作流,模拟人类开发与运维的流程,在不动功能的前提下自动做代码审查、补测试、重构这些“无聊活”。工具强调用多个子代理并行干活来提效,一次大约 16 小时的运行能生成上百次提交,把一个脆弱的 MVP 变成结构清晰、能长期迭代的稳定项目。正...

推荐理由:Kakuna 这个工具让代理按内置检查清单和“计划-目标”流程自动加固代码,一次约16小时能跑出上百次提交。我会先打个折——单条推文来源、非大厂出品,验证强度有限,但信息量够:工作流机制、运行时长、产出规模都给了具体数字,不是画饼。对正在折腾原型转生产的开发者来说,这种“代理帮你擦屁股”的思路有参考价值,所以放在 featured 档。

AI HOT 精选

谷歌在 I/O 大会甩出一整套 AI 代理开发工具,从写代码到上线调试全包了

谷歌这次发布的不是单个模型,而是一条让 AI 代理(能自主干活的程序)落地的工具链。Antigravity 2.0 是个独立桌面应用,配了命令行工具和 SDK,方便开发者直接在本机跑代理。Google AI Studio 新增 Kotlin 支持,号称能一键生成安卓应用并发布,还出了手机版 App。Gemini API 里加了托管代理服务,部署步骤简化...

推荐理由:HKR 三项都成立:谷歌端出了一套有名字、有组件的代理工具栈,覆盖本地开发、云端托管和浏览器协议。不过目前只有社交媒体的摘要,正文没披露定价、API 细节和实际演示,所以分数卡在 78–84 这个区间。我会先打个折,等看到更完整的文档再往上调。

r/LocalLLaMA

llama.cpp 新分支让 MoE 模型在 12GB 显存上跑得更快,RTX 2060 上速度从 19/22 tk/s 提到 26 tk/s

comanderxv 给 llama.cpp 开了个叫“experts first”的分支,专门优化混合专家模型(MoE)的显存调度。做法是把常用的专家模块提前缓存到显存里,实测用 RTX 2060(12GB 显存)跑 Qwen3.6-35B-A3B 模型,专家缓存命中率约 62%,生成速度从原来的 19 或 22 token/秒提升到了 26 tok...

推荐理由:HKR 三项都踩中了:钩子是一块 12GB 的老卡把 35B MoE 速度拉上来一截,有缓存机制和命中率数据撑着,话题又打在本地推理的成本神经上。不过这事目前还局限在本地推理的小圈子,所以放在 featured 档刚好,不用拔到必读。

5月22日星期五

Hacker News 首页

Superset:一个能同时派多个 AI 编程助手干活的开源编辑器

Superset 把自己定位成“AI 代理时代的代码编辑器”,核心卖点是能在一台机器上并行跑 Claude Code、Codex、OpenCode 等多个编程助手,通过 git worktree 让它们互不干扰地改代码。团队还放出了 Remote Workspaces 的测试版,可以在远程机器上跑这些助手,再从桌面应用里统一管理。项目在 GitHub ...

推荐理由:HKR 三项都踩中了,但这是 YC 新项目的首发帖,正文没给用量、定价和性能对比。git-worktree 并行 agent 这个工作流设计够上 featured,但离必写还差实际验证数据。

Mistral AI

Mistral 在 Studio 发布 Connectors,支持内置与自定义 MCP

Mistral 在 Studio 发布 Connectors,所有内置连接器和自定义 MCP 现可通过 API/SDK 用于全部模型与智能体调用。新功能包括直接工具调用、human-in-the-loop 审批流程,以及对连接器的创建、修改、列出和删除等编程访问。

推荐理由:原文给出 Connectors 的 API 用法与代码示例,读者可据此判断企业级 MCP 集成如何落地。

AI HOT 精选

Karpathy 用 65 行规则文件把 AI 编程准确率从 65% 拉到 94%

Karpathy 在 GitHub 上发了一个叫 CLAUDE.md 的规则文件,65 行、4 条规则,让 AI 编程准确率从 65% 跳到 94%。核心思路是逼开发者先想清楚再动手:深度思考、代码越短越好、只改该改的地方、每一步都盯着目标走。文件已经拿了超 22 万星标,但正文没披露 94% 这个数字是在什么任务、什么模型上测出来的,也没说对比基线是...

推荐理由:这篇我会先打个折,因为正文只给了总结性的数字,没披露具体是哪 4 条规则、在什么任务集上测的、评测方法是什么。但 Karpathy 这个名字加上 94% 这个数字,对用 Claude Code 干活的人来说,诱惑力足够大。22 万星标也说明社区在追这个方向。所以虽然信息有缺口,还是值得推给读者看一眼,只是别把 94% 当成普适结论。

AI HOT 精选

阿里千问 App、PC 及网页端上线 Qwen3.7-Max,免费可用

千问 App 更新到 6.9.7 版就能在对话框里切到 Qwen3.7-Max,PC 和网页端也一样,目前免费。官方说这个模型主打“让模型进业务流程干活”,能写代码、自动跑办公流程,还能扛住长任务——他们自己测了一次 35 小时、调用工具超过 1000 次的内核优化实验,全程没断思路。不过这些数据来自官方测试,实际体验会不会打折还得自己试。另外,API...

推荐理由:阿里把 Qwen3.7-Max 铺到千问全线产品,门槛降到免费,还特意强调 35 小时连续工具调用没崩,摆明了在打 agent 可靠性和零成本体验这两张牌。我会先打个折:正文没给基准测试、上下文窗口和 API 定价,所以实际能力上限和商用成本还看不清。但就凭多端同步上线和这个压测结果,对正在选模型做工具链集成的人来说,是个值得立刻上手试的信号。

MIT Technology Review · AI

Google I/O 暴露了 AI 做科研的两条路:专用工具还在用,但资源正流向通用智能体

Google I/O 上,DeepMind 的 Hassabis 一边用“我们正站在奇点的山脚下”这种大词,一边展示的是 WeatherNext 提前预警飓风救了人命。这正好点出了 AI 做科研的两条路线:一条是像 WeatherNext、AlphaFold 这种专为解决某个科学问题训练的专用工具;另一条是让通用大模型像智能体一样自己搞研究。现在资源明...

推荐理由:我会先打个折:这篇是 MIT Technology Review 的评论,不是一手技术报告,所以细节有限。但它的判断站得住——Google 把科学 AI 的牌子从 AlphaFold 那套单独炫技,换成 Gemini for Science 这个统一入口,还塞进了 AI Co-Scientist 和 AlphaEvolve 两个组件,并且开放申请。对做 AI 应用的人来说,这比发一篇论文实在,因为能摸到产品了。不过别太激动,正文没披露这套东西的算力成本、实际科研产出对比,也没说普通团队用不用得起,所以目前更像一个方向牌,不是落地手册。

新智元 · 公众号

微软投了 OpenAI 130 亿,自家工程师用 Claude Code 把账本烧穿了

微软计划在 6 月底前停掉体验与设备团队的 Claude Code 订阅,把近 10 万工程师迁到 GitHub Copilot CLI。文章把原因归结为外部按 token 计费的成本太高,但正文因为需要验证码没加载出来,具体烧了多少钱、内部怎么讨论的都没看到。

推荐理由:我会先打个折:这不是模型发布或官方重大产品更新,更像一次内部成本管控动作。但 HKR 三项都站得住——微软投 OpenAI 又禁 Claude Code 的对比很抓人,时间、人数、计费原因都给了,而且直接踩中编程助手在企业里怎么省钱的痛点。正文没披露具体账单金额,所以别把省钱效果说死。整体适合放在 featured 位置,81 分合理。

新智元 · 公众号

Anthropic 更新了 Agent 架构,但正文被验证页挡住了,没法确认具体改了什么

这篇文章的链接点进去只显示“环境异常,需要验证”,正文内容完全看不到。从已有的英文摘要看,阿里云的 JVS Crew 把 Agent、环境和会话拆成了三层,加了沙盒、快照恢复、权限控制和按量计费;Anthropic 在 5 月 19 号给 Claude 托管 Agent 加了自托管沙盒。文章还提到几个国内客户案例,说部署周期两周,效率提升 5 到 10...

推荐理由:文章把阿里云 JVS Crew 和 Anthropic 的沙箱更新放在一起比,讲的是企业级 agent 基础设施怎么落地。有具体架构细节,也有安全与计费的讨论,对正在选型或关注 agent 生产化的从业者有用。不过 Anthropic 那部分信息偏薄,正文没展开 self-hosted sandboxes 的限制和实际表现,这点先别太激动。整体属于值得一看的产品对比,不是必写的模型发布。

AI HOT 精选

OpenAI Codex 的 /goal 模式转正了,现在可以给 AI 派跨小时甚至跨天的长任务

OpenAI 把 Codex 里的 /goal 模式从实验功能升级成了稳定版。你可以在 Codex 应用、IDE 插件或命令行里用,设定好里程碑后,AI 会自己跑任务,持续几小时甚至几天。中间能随时查看进度、改方向或暂停。用之前要升级应用并打开这个功能(命令行或手动改配置文件都行),开启后在输入框就能管理任务,侧边对话可以看进度,不会打断主任务。正文没...

推荐理由:我会先打个折:文章只说了功能转正和多端支持,但没披露任务失败怎么恢复、资源消耗上限、以及哪些套餐能用。对想试的人,知道它能跑长任务就够了;对想上线用的人,信息缺口还很大。所以放在 featured 低段,等后续补上安全和成本细节再往上调。

Hacker News 首页

sddw:给 Claude Code 加一套分步写规格、清上下文的开发流程

作者开源了一个 Claude Code 插件,把开发任务拆成需求、代码分析、设计三份规格文档,再把实现切成多个子任务逐个做。每完成一个步骤就清一次上下文,目的是让模型每次只盯一小块,减少跑偏,也省 token 钱。规格文件落地到磁盘,方便断点续传,也能在早期发现模型理解错的地方。正文没给出具体省了多少成本或性能提升的量化数据,这点先别太激动。

推荐理由:我会先打个折:正文没给性能对比、没披露实际省了多少 token、也没说在复杂项目上的表现,所以不能给太高。但三层规格加每步清上下文这个组合拳,确实戳中了用 Claude Code 写代码时上下文越跑越偏、账单越来越贵的真实问题。对正在折腾 coding agent 的人来说,这个思路值得看一眼,只是别指望拿来就能用,还得自己踩坑验证。

AI HOT 精选

可塑界面:AI 让软件界面按需变形,不再只有一种固定样子

Salesforce 已经“砍掉”了传统界面,销售不用登录网站就能通过 AI 更新交易记录。作者把这种趋势叫做“可塑界面”——AI 能根据你当下在干嘛,动态生成最适合的交互形式,比如开车时给你念邮件摘要、审文案时弹出网页应用、做预算时直接给个带图表的表格。文章引用了 Airbnb CEO 和 Anthropic 工程师的观点,认为纯文本对话不够用,电商...

推荐理由:我会先打个折:这篇是软件形态的展望,没有上线时间、用户数据或可复现的测试,所以放在评论类里刚好。正文说 Salesforce 已经用无头架构让销售靠 AI 直接改数据,界面不再写死,而是按场景动态生成 HTML、音频甚至网页。这点先别太激动——正文没披露这套动态生成在 Salesforce 里的实际覆盖范围、延迟和出错率,也没说 MCP 具体怎么接。但思路本身对做 B 端产品的人有用,因为它把“界面”从设计稿变成了模型输出,省不省开发成本另说,至少交互逻辑要重想。

AI HOT 精选

Claude Code v2.1.147 新增 Workflow 工具,/simplify 改名 /code-review 并支持生成 PR 行内评论

Claude Code 发了 v2.1.147。这次加了一个叫 Workflow 的新工具,默认是关着的,用来做确定性的多智能体编排——你可以把它理解成让多个 AI 助手按固定流程协作干活,而不是自由发挥。另一个变化是把原来的 /simplify 命令改成了 /code-review,功能也升级了:现在会报告代码正确性,还能直接在 GitHub PR ...

推荐理由:这是 Claude Code 的一个小版本更新,但 Workflow 工具的加入让产品从单智能体往多智能体协作迈了一步。工具默认关闭,说明还在试探阶段,正文没披露性能数据、定价或使用范围,所以先别太激动。把 /simplify 改名为 /code-review 也更直白,知道是拿来审代码的。整体看,对关注编码智能体稳定性的从业者是个值得留意的信号。

Latent Space

给 AI 智能体配台电脑:Daytona 创始人聊 60 毫秒启动、85 万次日均运行的沙箱生意

Daytona 做的不是简单的代码执行盒,而是给 AI 智能体用的“可组合电脑”。他们的沙箱最快 60 毫秒就能启动一个,5 万个沙箱大约 75 秒就能跑起来,最大的客户一天要跑将近 85 万个沙箱。创始人 Ivan Burazin 从十多年前就在喊“干掉本地开发环境”,现在 AI 智能体成了他理想的落地场景:智能体不在乎你的笔记本配置,它只需要一个能...

推荐理由:我会先打个折:这是创业公司的基础设施故事,不是大模型或平台级发布。但 HKR 三项都站得住——标题有钩子,性能数字实在,痛点也踩得准。正文没披露客户名字和具体成本,这点先别太激动。

AI HOT 精选

ChatGPT 开始能在 PowerPoint 里直接做 PPT 了,目前还在测试

ChatGPT 正在测试一项新功能:你可以直接在 PowerPoint 里让它帮你建、改、理解、优化幻灯片,做出来的页面还能继续手动编辑。官方只发了这条推文,没提收费方式、推送范围,也没说什么时候正式上线。如果是真的,以后做 PPT 能省不少事,但正文没披露具体支持哪些功能、会不会出错,这点先别太激动。

推荐理由:OpenAI 让 ChatGPT 在 PowerPoint 里直接建和改可编辑的幻灯片,不是只吐文字或图片。正文没提价格、开放范围和企业管控细节,所以先放 featured 而不是 P1。

AI HOT 精选

Datasette Agent 发布:给数据库配了个能聊能画图的 AI 助手

Simon Willison 把做了三年的 LLM 库和 Datasette 数据库工具终于接上了,发布了 Datasette Agent。你可以直接用对话的方式问数据库里的问题,比如“我最近一次看到鹈鹕是什么时候”,它会自己写 SQL 去查。配合插件还能自动生成图表、用 ChatGPT 画图,或者在沙箱里跑代码。线上演示跑的是 Gemini 3.1 ...

推荐理由:Datasette 给自家工具加了个能聊天的 agent,支持插件画图,还能选 Gemini 3.1 Flash-Lite 或 LM Studio 本地模型。对搞数据的人来说,这比大厂发新模型更实在——它解决的是“我能不能在自己机器上安全地用 AI 查数据”的问题。不过正文没披露本地模型的具体效果和延迟,这点先别太激动。整体看,实用性强但受众偏窄,放在 featured 里合适。

AI HOT 精选

Codex 现在能远程操控锁屏的 Mac,手机就能指挥它干活

OpenAI 开发者账号发帖说,Codex 可以在 Mac 锁屏、屏幕关闭的情况下,通过手机安全地使用 Mac 上的应用。帖子没提权限边界、怎么收费、什么时候上线,我会先打个折——正文只给了一个文档链接,具体怎么实现“安全”也没展开。

推荐理由:HKR 三项全中:OpenAI Devs 给出了 Codex 操控 Mac 的具体条件,但正文没披露权限边界、价格和发布时间,所以重要性停在 82 分,没上 85+。我会先打个折——这个功能听起来很省事,但没讲清楚锁屏下到底能碰哪些文件、会不会被滥用,这点先别太激动。