跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 101–120 条 · 共 760 条

6月1日星期一

新智元 · 公众号

阶跃星辰发布 Step 3.7 Flash,196B 参数的 MoE 模型每次推理只激活 11B,速度冲到 400 tokens/秒,跑 Agent 任务...

阶跃星辰这次放出的 Step 3.7 Flash 是个混合专家模型,总参数量 196B,还挂了一个 1.8B 的视觉编码器,但每次推理实际只动用 11B 参数,所以能跑到每秒 400 个 token。官方说在 Agent 任务上,它的成本只有 Claude 的零头。不过正文因为微信环境验证没抓到具体内容,实际跑分、具体任务对比和定价细节都没披露,这点先...

推荐理由:速度和参数数字都摆出来了,标题里那个成本对比很抓人。但正文没披露具体定价、基准测试的细节和开源条款,所以分数只能停在 82 这个质量更新档位。

量子位 · 公众号

招商局狮子山实验室开源 LiOS 架构,把云端大模型延迟压到 30 毫秒,还送了个叠衣服数据集

招商局狮子山人工智能实验室放出了一个叫 LiOS 的边云架构,专门解决机器人怎么用上云端大模型的问题。他们跨机器测下来,从本地摄像头到云端 GPU 显存,单向延迟大约 30 毫秒,这个数字对很多实时控制场景已经够用了。架构里低延迟视频传输模块直接开源,还附带了一个 LeFold 叠衣服数据集。不过正文因为微信环境异常没加载出来,具体用了什么模型、在哪些...

推荐理由:我会先打个折:招商局狮子山实验室不是头部平台,也没看到多源交叉验证,所以影响力止步中等。但这条消息确实给了干货——30ms相机到云端显存的延迟数字,说明端云协同在物理世界干活有戏,不是纯画饼。开源图传模块和叠衣数据集也算实在,同行能直接拿来测。正文没披露具体模型规模、功耗和复杂场景下的抖动,这点先别太激动。

r/LocalLLaMA

网友在双 DGX Spark 上跑 DeepSeek V4 Flash:预填充 1680 token/s,解码 39.8 token/s

一位 Reddit 用户用两台华硕 GX10(DGX Spark)组了个小集群,通过 vLLM 加载 DeepSeek-V4-Flash 模型。在 256K 上下文窗口、开启多 token 预测(MTP=2)的设置下,测得预填充速度 1680 token/s,解码速度 39.8 token/s。部署用了张量并行(TP=2),两台机器通过 RoCE 网络...

推荐理由:这不是行业大新闻,但胜在是第一手实测,配置细节都给了:TP=2、RoCE 网络、fp8 KV 缓存、256K 上下文,还估出了约 1M tokens 的安全 KV 上限。对想对比自己机器性能的人来说,这些数字比官方宣传实在。HKR 三项都踩中,放在低 featured 位置刚好。

AI HOT 精选

NVIDIA 发布工厂运营蓝图 FOX,让 AI 智能体接管产线管理

NVIDIA 在台北 GTC 上推出了一个叫 FOX 的工厂运营蓝图,相当于给工厂装了一套能自主管产线的“AI 大脑”。富士康已经用它搭了一个叫 MoMClaw 的多智能体系统,把摄像头、传感器和产线数据喂给多个 AI 智能体,让它们协同干活。官方说,这套系统能把查找产线故障根因的时间缩短 80%,但正文没披露这个数字是在什么规模的产线、什么类型的故障...

推荐理由:英伟达在 GTC 台北丢出一套工厂运营蓝图 FOX,让多个 AI 智能体组团进产线干活。富士康已经拿它搭了 MoMClaw 系统,号称能把找问题根因的时间砍掉 80%。我会先打个折——这是厂商博客放出来的预期数字,不是实测报告,正文也没披露具体产线、样本量和对比基准。但方向本身踩中了现在企业最关心的:智能体能不能真进业务流程降本,所以还是值得看一眼。

AI HOT 精选

NVIDIA 发布 RTX Spark 本地 AI 电脑,1 petaflops 算力跑智能体,llama.cpp 优化让 Qwen 27B 吞吐翻倍

NVIDIA 在 Computex 上发了台叫 RTX Spark 的 Windows 电脑,专门在本地跑 AI 智能体。配置给得挺足:1 petaflops AI 算力、128GB 统一内存,意思是大模型不用来回倒腾显存。安全方面,他们和微软合作搞了个 OpenShell 运行时,用 Windows 新的安全接口把智能体锁在设备本地跑,数据不出机。性...

推荐理由:HKR 三项都踩中了:NVIDIA 把 RTX Spark 定位成本地智能体机器,给了 1 petaflops、128GB 统一内存和 llama.cpp 上 Qwen 27B 吞吐最高 2 倍的硬数字。因为是厂商博客发布,我会先打个折,分数落在 78–84 区间合理。

AI HOT 精选

Qwen3.7-Plus:一个能看图、写代码、操作界面的多模态智能体模型

Qwen 发布了 Qwen3.7-Plus,把视觉理解和语言能力塞进同一个模型里,让它能直接看懂屏幕、操作手机 App、根据截图写前端代码,还能在命令行和图形界面之间来回切换干活。在 Terminal Bench 2.0 终端任务上拿了 70.3 分,比 Opus 4.6 Max 和 DeepSeek-V4-Pro Max 都高;在 Deep-Plan...

推荐理由:我会先打个折:正文只给了功能清单,没给任何硬指标。7 类能力听着挺全,聊天、看图、读文档、搜网页、调工具都塞进去了,但没参数、没价格、没上线日期,等于只看了个目录。这点先别太激动。不过 Qwen 这条线每次更新都会牵动国内从业者的注意力,尤其是把多模态和智能体绑在一起推,说明他们想在应用层抢身位。信息虽然薄,但话题本身够热,放在 featured 里提醒大家盯后续是合理的。

r/LocalLLaMA

有人把英伟达 Parakeet 语音转文字模型移植到了 ggml,不再需要 Python,还能量化压缩

开发者 mudler_it 把英伟达的 Parakeet 语音转文字模型用 C++ 和 ggml 重写了一遍,彻底甩掉了 Python 和 PyTorch。他测试下来,在 f32 和 f16 精度下输出结果和原版 NeMo 逐字节一致,但速度更快,大一点的 TDT 和混合模型在 GPU 上能跑到大约 5 倍加速。模型还支持 GGUF 量化,提供了 f1...

推荐理由:我会先打个折:这是个人移植项目,不是 NVIDIA 官方出品,长期维护和后续模型支持还得看社区。但亮点很明确——输出字节级对齐 NeMo,量化后跑得更快,而且不用碰 Python 环境。对想在树莓派、本地服务器或离线场景跑语音转文字的人来说,这是个省事的选择。正文没披露量化后的精度损失有多大,这点先别太激动。整体看,技术验证扎实,痛点打得准,放在 featured 低位合适。

5月31日星期日

AI HOT 精选

苹果 WWDC 要拿 Gemini 蒸馏出的小模型跑在 iPhone 上,复杂问题还是会甩给谷歌云

下个月 WWDC 苹果会展示 Siri 和端侧 AI 的升级,核心思路是把谷歌 Gemini 模型“蒸馏”成一个小号版本,直接在 iPhone 芯片上本地跑,主打隐私和省 token 费。但整个技术栈对外依赖很重:本地模型源自 Gemini 蒸馏,手机处理不了的复杂请求会路由到谷歌云,还用了英伟达的机密计算。苹果之前承诺的 Private Cloud ...

推荐理由:这条消息我会先打个折,因为目前只有单一信源,正文没披露模型参数量、延迟、成本或合同细节。但它的信息量对从业者来说很实在:苹果在 WWDC 前被曝出用 Gemini 蒸馏模型救急,本地跑小模型保隐私,重活还是得走 Google 云和 Nvidia 机密计算,等于承认自研大模型没跟上。这个技术栈组合本身就说明苹果在端侧 AI 上选择了外部依赖,跟它一贯的全栈控制路线反差很大,所以给了 82 分,放在 featured 位置。

r/LocalLLaMA

不用改代码,让 OpenAI Codex 桌面客户端接任意模型和供应商

Reddit 用户 thibautrey 分享了一个三步走的方法:编辑 Codex Desktop 的 config.toml 配置文件,存好 API 密钥,再用一个叫 multicodex 的代理别名把 gpt-5.3-codex 这个模型名映射到 MiniMax-Latest。代理跑在本地 127.0.0.1:1455,会把返回的模型名伪装成 gp...

推荐理由:这是一条可复现的开发者操作流,不是官方发布。我会先打个折:正文没披露 MiniMax-Latest 的具体成本和延迟,也没说 proxy 稳定性如何,所以别急着在生产环境照搬。但 hook 很直接——不改代码就能在 Codex 桌面端用别的模型,配置细节也够落地,对想省钱或换模型的人有实际参考价值。

机器之心 · 公众号

微软开源 SkillOpt:像训练神经网络一样,自动优化给 AI 智能体看的技能说明书

微软放出了一个叫 SkillOpt 的开源框架,一周就在 GitHub 上拿了 3300 多颗星。它的思路挺直接:不改模型本身的参数,而是像做文本版梯度下降一样,自动迭代优化那些写给 AI 智能体看的“技能文档”。论文里的实验覆盖了 7 个目标模型、6 个评测基准和 3 种执行环境,总共 52 种组合,结果要么最好,要么并列最好。不过正文因为访问限制没...

推荐理由:微软开源的 SkillOpt 把 agent 技能文档当成可训练的文本参数,像训神经网络一样去优化技能描述,这个思路挺新鲜。我会先打个折:论文说在 52 个组合里做到最优或并列最优,但正文没披露具体对比基线和误差范围,这点先别太激动。不过一周 3.3k star 说明 agent 工程圈确实被技能维护和评估成本折磨很久了,一个能自动优化技能文档的工具,哪怕只是省掉一部分手工调 prompt 的活,也值得关注。

量子位 · 公众号

复旦和通义搞了个 ToolCUA,专门教 Agent 在屏幕上选对工具

现在给 Agent 塞一堆工具,它经常不知道该点哪个。复旦和通义实验室提出了一套叫 ToolCUA 的训练方法,核心是用约 4000 个合成工具和 18 万步的“屏幕操作+工具调用”交叉轨迹来训练模型。他们训出来的 ToolCUA-8B 在 OSWorld-MCP 基准上跑到了 46.85% 的准确率。不过正文因为微信环境验证没抓到,具体训练细节和对比...

推荐理由:这篇文章抓了一个实际工程里的矛盾:工具越多,Agent 越不会选。我会先打个折,46.85% 的准确率不算高,但考虑到是 4k 工具的环境,这个数字说明问题确实难。18 万步合成轨迹是亮点,意味着训练数据不用全人工标,成本上友好一些。正文没披露推理延迟和实际部署的资源消耗,这点先别太激动。整体是一篇有痛点的研究发布,不是大模型或产品级发布,所以放在 featured 里合适。

AI HOT 精选

Simon Willison 把 Python 网页应用直接跑在了浏览器里,不再需要后端服务器

Simon Willison 用 Pyodide(把 Python 编译成浏览器能跑的 WebAssembly)加上 Service Worker,让 Python 的 ASGI 网页应用完全在浏览器里运行。他让 Claude Opus 4.8 帮忙写了代码,做了两个能用的演示:一个基础 FastAPI 例子,另一个是他自己的 Datasette 1....

推荐理由:Simon Willison 用 Claude Opus 4.8 辅助开发,把 Python ASGI 应用搬进了浏览器,已经跑通了 Datasette 的演示。这件事的钩子在于:浏览器不再只是前端沙箱,可以直接当应用服务器用。技术栈交代得清楚,Pyodide、Service Worker、ASGI FastCGI 每一步都有据可查,不是概念图而是能跑的代码。我会先打个折,这目前还是个开发者实验,离生产环境还有距离,但思路对无服务器和边缘部署的人有启发。

5月30日星期六

TechCrunch · AI

我让谷歌的 24 小时 AI 助手 Gemini Spark 干了一天活,它确实挺有用

TechCrunch 的编辑实测了谷歌新推出的 Gemini Spark,把它当成一个全天候 AI 助手来用,主要干了整理邮件摘要和规划本地活动这两件事。体验下来觉得确实能帮上忙,但文章没搞懂谷歌为什么要把这个功能单独做成一个产品,而不是直接塞进现有的 Gemini 里。正文没披露这东西什么时候正式上线、要不要另外收费。

推荐理由:我会先打个折:正文没披露价格和发布时间,所以不能当产品发布看。但亮点在于,这是一篇上手实测,不是通稿。编辑用“actually pretty useful”收尾,说明 Gemini Spark 在收件箱摘要和本地活动规划这两个场景里跑通了,没翻车。对做 agent 的人来说,这种“替你干活”的体感比跑分重要。信息缺口明显,但反转叙事和具体场景撑住了 featured 的分数。

AI HOT 精选

Google 把两个新图像模型 Nano Banana Pro 和 Nano Banana 2 挂上了 Gemini API

Google AI Developers 发推说 Nano Banana Pro(对应 gemini-3-pro-image)和 Nano Banana 2(对应 gemini-3.1-flash-image)已经正式发布,可以直接通过 Gemini API 调用。推文里贴了一些社区示例展示效果,但正文没披露定价、跑分、单次生成耗时或调用频率上限,想上...

推荐理由:我会先打个折:这就是个产品更新,不是技术突破。Google 把两个图像模型挂上 Gemini API 标成生产可用,对想用的人是个信号,但正文没披露价格、没给跑分、也没说调用限制,所以没法判断性价比。名字叫 Nano Banana,听着像玩梗,但背后就是 gemini-3-pro-image 和 gemini-3.1-flash-image,别被名字带偏。

新智元 · 公众号

Anthropic 内部流出一份 Claude 流畅度评分表,最高 11 分,优秀人类能拿 7.5

这份评分表把用户跟 Claude 的对话拆成 11 个可观察的行为指标来打分,满分 11 分。背后的研究用了 9830 组匿名多轮对话,发现高质量对话里 85.7% 都出现了“反复修改追问”这个动作。正文没披露具体评分细则和实验设计细节,目前只能看到评分框架,所以这个 7.5 分到底怎么算出来的还不清楚,先别太激动。

推荐理由:这篇的切入点是把 AI 和人的关系倒过来,用评分卡的形式讲 Claude 怎么分析用户行为,标题自带传播力。内容有具体的行为列表和样本量,不是空谈。我会先打个折:这不是模型发布或重大能力更新,所以放在 featured 档位刚好,不用拔到 breaking。对从业者来说,能从中看到 Anthropic 对“高质量使用”的定义,也能反推自己用 Claude 的方式在什么水平。

量子位 · 公众号

人大和至知研究院开源了 Claw Agent 的全套训练方案,连数据带模型和评测一起给了

人大和至知研究院放出了一个叫 ClawGym 的 Agent 训练框架,把数据、训练代码和模型权重都开源了。他们合成了 13500 条可执行的任务当训练数据,又做了 200 条任务的基准测试集。用这套东西训出来的 ClawGym-30B-A3B 模型,在他们自己的 ClawGym-Bench 上拿了 56.82 分,比 Qwen3-235B-A23B ...

推荐理由:这条消息对 Agent 开发者很实用。ClawGym 把数据、代码、模型检查点一起打包开源,不是又一个只有排行榜的项目。13.5K 合成任务规模不算大,但 200 个评测任务和 56.82 的得分给了明确的起点。我会先打个折:正文没披露合成任务的质量验证细节,也没说这个分数在实际业务场景里对应什么水平,所以别急着对标生产环境。但作为开源基建,它降低了复现和改造的门槛,值得关注。

AI HOT 精选

Codex 现在能自己管自己的聊天线程和并行任务了

OpenAI 的 Codex 界面新增了对话线程管理能力,可以自己创建、搜索、整理和固定聊天线程,还能为并行任务启动工作树。这条信息来自 X 上的用户分享,正文没披露具体实现方式、准确率或延迟数据,我会先打个折——目前看起来更像一个便利功能,而不是底层模型能力的升级。

推荐理由:HKR 三项都过:Codex 拿到了具体的线程管理和并行工作树机制,对编码 Agent 用户有实际价值。正文没披露适用范围、定价和性能数据,所以我会先打个折,放在 featured 偏低的位置。

AI HOT 精选

Codex 现在能远程操控你的 Windows 电脑了,目前还是早期体验

OpenAI 给 Codex 加上了 Windows 支持,你可以在手机上用 ChatGPT 应用启动、查看和指挥 Codex 在你 Windows 电脑上干活。官方说这是早期体验,正文没披露收费方式和具体开放范围,我会先打个折——稳定性、权限控制和延迟都还没经过大规模验证,别急着把重要任务全交给它。

推荐理由:OpenAI 给 Codex 加了 Windows 计算机使用功能,通过 ChatGPT 手机 App 来操控。正文交代了工作流程和早期体验状态,但没提权限、定价和推送范围,所以先放在 featured 这一档。

AI HOT 精选

OpenRouter 加了个服务器端工具,让模型直接生成文件补丁

OpenRouter 在 Responses API 里上线了 apply_patch 工具,模型可以生成 V4A 格式的 diff 来创建、修改或删除文件。服务器端会先校验 diff 语法,不用客户端自己折腾。正文没披露这个校验具体能拦住哪些错误,也没说支持哪些模型。

推荐理由:HKR 三项都过了:OpenRouter 这次更新给 coding agent 搭了条跨模型的补丁通道,用 V4A diff 加服务端校验,实用性很强。但它属于基础设施层面的改进,不是模型能力本身的突破,所以分数压在 72–77 这个区间。

5月29日星期五

The Verge · AI

Adobe 的对话式 AI 助手像个平庸的设计实习生

The Verge 提前试了 Adobe Firefly AI 助手的测试版。它不像常规 AI 工具那样直接生成图片或视频,而是充当一个中间人,用对话的方式替你操作 Adobe 的设计软件。作者说,助手解释每一步编辑思路时讲得很清楚,但最终做出来的效果并不让人满意。正文没提定价、正式上线时间,也没列出完整支持哪些软件。

推荐理由:我会先打个折:这是 The Verge 编辑亲自上手 Adobe Firefly AI Assistant 测试版的体验文,不是官方通稿。它能在 Adobe 设计软件里听指令改图,解释流程挺清楚,但成品确实一般,所以标题才叫“平庸的设计实习生”。这点先别太激动,正文没披露定价、什么时候正式上线、具体支持哪些应用,信息有缺口。不过它踩中了设计工作自动化的敏感点——能不能用、好不好用、会不会抢活,所以给到 featured 门槛的分数是合理的。