跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 541–560 条 · 共 760 条

4月21日星期二

The Verge · AI

Epic 给《堡垒之夜》创作者发了 AI 角色工具,但明令禁止和 NPC 谈恋爱

Epic 在《堡垒之夜》里上线了一个叫“对话”的工具,让创作者可以把自己岛上的 NPC 变成能自由聊天的 AI 角色。创作者用提示词设定角色的人设、知识范围、行为和声音,玩家就能跟 NPC 进行不按剧本走的对话。标题特意警告“别想和 AI 约会”,但正文没具体说防越狱和内容审核机制到底怎么做的。去年 Epic 在游戏里试水过 AI 版达斯·维达,结果角...

推荐理由:Epic 给 Fortnite 创作者发了个新工具,能让岛上的 NPC 跟玩家自由聊天,用提示词定人设、知识和行为,还能选语音。标题特意警告别拿来搞约会对象,但正文没写具体怎么审核、什么话不能说,也没提成本和用的哪家模型。我会先打个折:可控性才是重点,不是“会聊天”本身。

4月20日星期一

r/LocalLLaMA

用免费 Colab T4 和 Mac 给苹果端侧 3B 模型训练 LoRA 适配器

作者搭了一套 QLoRA 流程来微调苹果那个跑在手机上的 3B 模型,把显存需求从大约 24GB 压到 1GB 内存加 5GB 显存,免费版 Colab T4 或者一台 24GB 内存的 Mac 就能跑。帖子说 A100 跑 LoRA、T4 跑 QLoRA、Mac 跑 QLoRA 训出来的适配器效果差不多,都能把准确率从 40% 左右拉到 75%,如果...

推荐理由:一篇带名字的第一手实验,内存和准确率数字可复现,HKR 三项全中,比普通教程贴强。分数没上 85 是因为来源只是单篇 Reddit 帖子,权威性有限,跑分范围也窄。

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

r/LocalLLaMA

TRELLIS.2 图片转 3D 模型现在能在苹果芯片 Mac 上跑了,不用 NVIDIA 显卡

有开发者把微软的 TRELLIS.2 移植到了 Apple Silicon 上,用一张照片就能生成约 40 万个顶点的 3D 网格。在 24GB 内存的 M4 Pro 上跑一次大概 3 分半钟,其中贴图烘焙只要 18 秒。这次移植把原来五个依赖 CUDA 的扩展换成了 PyTorch MPS 和自定义后端,不再需要 NVIDIA 显卡或云端算力。不过正...

推荐理由:这是社区移植,不是微软官方发布,但三个点都站得住:不用 NVIDIA 就能在 Mac 上做图生 3D,给了 M4 Pro 24GB 的具体跑分,而且重写 5 个 CUDA 扩展这件事本身就说明工作量。来源是 Reddit 帖子,权威性一般,但信息够具体,先按 featured 处理。

机器之心 · 公众号

Anthropic 编程智能体负责人讲 vibe coding 的正确姿势:2 周变 1 天,但别让 AI 碰核心逻辑

Anthropic 研究员 Erik Schluntz 分享了他团队用 Claude 写代码的真实工作流。他们最近合并了一个 2.2 万行的生产环境改动,大部分代码由 Claude 生成,把原本两周的工作压缩到了一天。他的做法是先花 15-20 分钟让 AI 通读代码仓库、做规划,然后只让 AI 改叶子节点(也就是依赖最少、影响范围最小的模块),核心逻...

推荐理由:这是一篇来自 Anthropic 内部的实战经验,不是泛泛而谈。有 22000 行生产合并、两周变一天的硬数字,也有可复用的流程规则,比如先让模型花 15 到 20 分钟探索代码库再动手、改动锁在叶子节点、核心路径必须人审。对正在纠结怎么把 coding agent 放进真实流水线的团队来说,参考价值很高。保持 featured 不升 p1,因为它本质是实践课,不是模型或产品重大发布。

r/LocalLLaMA

用本地 Qwen3.6 给 Claude Code 当副手,每次任务省下 30 倍 Opus token

一位 Reddit 用户把 Qwen3.6 通过 LM Studio 接成 Claude Code 的 subagent,让本地模型干提取和审计的粗活,Claude 只做最后决策。在两个审计任务里,Opus 的边际 token 消耗降了约 30 倍:一个 23 个文件的路由审计从 1.3 万 token 降到 400 token,一个 18 个文件的 ...

推荐理由:一个 Reddit 用户拿自己的两台机器做了两组任务对比,数字很直接:23 个路由文件审计从 13k token 降到 0.4k,18 个 Astro 文件盘点从 89k 降到 3k,省了约 30 倍 Opus token。机制是把提取、盘点、审计这类工作交给本地 LM Studio 跑的 Qwen 子代理,Claude Code 只做调度。正文没藏着掖着,承认 Qwen 和 Opus 各有漏检,不是单方面碾压。我会先打个折:只有两个任务、一个人跑、没大规模验证,但思路和数字对想省 Opus 费用的人有直接参考价值。

Hacker News 首页

TRELLIS.2 图生 3D 模型现在能在 Mac 上跑了,不用 Nvidia 显卡

开发者 shivampkumar 把微软那个 40 亿参数的 TRELLIS.2 模型移植到了苹果芯片上,靠 PyTorch 的 MPS 后端驱动,一张图就能生成 3D 模型。他把原本依赖 Nvidia 硬件的 flash_attn、nvdiffrast 和自定义稀疏卷积算子全换成了纯 PyTorch 实现,包括稀疏 3D 卷积、SDPA 注意力机制和...

推荐理由:这不是微软官方模型发布,而是一个可复现的本地移植,对实际干活的人有参考价值。我会先打个折:3.5 分钟生成一个网格不算快,但考虑到不用联网、不用 Nvidia,这个结果挺实在。正文把替换掉的组件和替代方案都列清楚了,信息量够,所以放在 featured 而不是 p1。

The Verge · AI

Vercel 被黑,攻击入口是一个被黑的第三方 AI 工具

Vercel 确认发生了一起安全事件,影响了一小部分客户。黑客正在兜售窃取的数据,泄露信息包括员工姓名、邮箱和活动时间戳。Vercel 说攻击路径是一个被黑的第三方 AI 工具,但没说是哪家供应商,也没公布具体受影响的范围。

推荐理由:我会先打个折:Vercel 没说是哪家 AI 工具,也没说多少客户被波及,所以别急着下结论。但这事值得上推荐,因为攻击路径从“偷账号”变成了“供应链的 AI 工具被攻破”,对正在接 AI 的团队是个实打实的提醒。泄露字段具体,有姓名、邮箱和时间戳,不是空泛的“数据泄露”。黑客 ShinyHunters 在卖数据,可信度又加一层。唯一缺的是供应商名字和影响面,正文没披露,所以只能给 featured 低位,不能更高。

4月19日星期日

量子位 · 公众号

马斯克在抖音卖老干妈?其实是 OpenAI 新模型生成的假图

这篇文章展示了用 OpenAI GPT Image 2 生成的几张假图,包括“马斯克抖音直播卖老干妈”和“GTA-6 联动海报”,画面里还伪造了 10 万+ 的在线观看人数。文章说 Image 2 现在能画出很逼真的海报、游戏截图,还能在图上写出可读的长文字,背后可能用了类似 Codex 的界面生成流程。但正文没提这个模型的定价、推送范围和具体上线时间...

推荐理由:HKR 三项全中:钩子够抓人,能力展示很具体,信任崩塌这个点从业者都会关心。没给 p1 是因为正文没披露开放范围、价格和正式发布时间,信息有缺口,我会先打个折。

r/LocalLLaMA

实测 8 个模型当桌游主持人:27B 小模型叙事质量干翻了 405B 巨无霸

作者用 6 个固定跑团场景测了 8 个模型,让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分,整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B,但正文被屏蔽了,没披露那个 405B 具体是哪个模型,也没给出完整排名。这点先别太激动...

推荐理由:这篇来自 Reddit 的个人评测,钩子够锋利——小模型在叙事质量上干翻大模型,HKR 三项全中。我把它留在 featured 而不是更高,是因为正文截断了,405B 具体是哪个模型、完整排名都没给出来,信息有缺口,先别太激动。

r/LocalLLaMA

拆解 LangGraph 的 Pregel 执行模型、检查点内部机制和 DeepAgents

这篇帖子把 LangGraph 拆开看,它本质上是对 Pregel 运行时的一层高级封装,核心就三个东西:PregelNode(执行节点)、channel(节点间传数据的通道)和 reducer(定义数据怎么合并)。帖子提到用四张 Postgres 表存检查点,执行流程是 Plan → Execute → Update 的 superstep 循环,c...

推荐理由:这篇文章不是 API 教程,而是把 LangGraph 的并行执行、检查点写放大和子图边界放到同一个 Pregel 运行时模型里看,对做 agent 的人有实操参考价值。正文没给基准测试或生产案例,所以分数没往上拉。

4月18日星期六

量子位 · 公众号

OpenClaw 的坑已经踩进奶茶店了

古茗和银泰百货拿 OpenClaw 做测试,踩了 5 个部署的雷:默认端口 18789 直接暴露、至少 8% 的 Skill 是恶意插件、权限越界、一次跑飞吃掉 20 多分钟 token、旧系统防护太弱。实际出过的事包括 agent 把正常堡垒机端口关了导致运维被锁在外面,还有 agent 申请麦克风这种不相关的权限。真正的问题不是聊天体验,而是 ag...

推荐理由:这篇不是泛泛的 AI 安全评论,而是用古茗和银泰的实际测试,列出了 5 类可验证的落地风险和一个真实运维事故。我会先打个折:目前只是个案级别的测试结果,没有官方修复方案,也没有大规模影响或多家交叉验证,所以到不了 P1。但 H、K、R 三项都站得住——事故有钩子、细节可复现、痛点够深,给 featured 没问题。

机器之心 · 公众号

算力不够用了,OpenAI 把宝押在了两件事上

Greg Brockman 透露,因为算力吃紧,OpenAI 砍掉了 Sora 的部分资源,把重心缩到两个方向:一个是个人助手,另一个是能替用户啃硬骨头的 AI 工人。目前算力没法同时撑起这两件事。正文没披露具体的算力预算、时间表和模型参数,所以“下一代基座模型 Spud”到底多强、什么时候出来,都还是未知数。

推荐理由:我会先打个折:正文没披露千亿算力投入的具体金额、时间表和技术参数,所以别当硬数据看。但这条信息值得关注的点在于,它把 OpenAI 的产品排序逻辑讲清楚了——不是退守 B2B,而是被算力预算强行重排。Sora 资源收缩、优先保推理模型和统一 AI layer,这些信号对做应用层的人比单纯吹参数更有参考价值。如果是真的,说明接下来 OpenAI 的开放节奏会更保守,想蹭他们基座能力的团队得重新算账。

机器之心 · 公众号

Anthropic 给 Claude 加了个设计功能,能直接出线框图、原型和幻灯片

Anthropic 在 Claude Pro、Max、Team 和 Enterprise 账号里上线了 Claude Design 的研究预览版,背后跑的是 Claude Opus 4.7。它能吃代码库、图片、DOCX、PPTX、XLSX 和网页截图,吐出来的东西可以导出到 Canva、PDF、PPTX 和 HTML。标题说 Figma 和 Adobe...

推荐理由:我会先打个折:标题说 Figma、Adobe 股价重挫,但正文没给出具体跌幅,这点先别太激动。真正值得看的是 Anthropic 把设计稿生成、设计系统读取、多人协作编辑和向 Claude Code 交接串成了一条线,这比单出一个画图工具要狠。不过目前还是研究预览版,没有用户测试数据、定价和实际落地案例,能不能真革了设计行业的命还得看后续。

新智元 · 公众号

B站吵翻了:Hermes 首次直播回应抄袭指控,MiniMax 提前卡位 Harness 赛点

MiniMax 说他们的 M2.7 模型现在能接手强化学习团队 30% 到 50% 的日常工作,自己跑通了超过 100 轮自我优化,评测指标提升了 30%。Hermes Agent 的日调用量从 20 亿涨到了近 3000 亿 token,M2.7 在 OpenRouter 上的日调用也超过了 250 亿 token。Hermes 负责人 Tommy ...

推荐理由:这篇不是一手发布或官方技术报告,而是把几条动态串起来的二手解读,所以重要性停在 83 分。我会先打个折:Hermes 直播否认抄袭本身不算大新闻,但配上 MiniMax 提前杀入 Harness 赛点、给出具体工作流占比和沙箱性能数据,就让整篇有了可读性。正文没披露 M2.7 具体在哪些任务上替代了人工、也没说 30% 提升的基线是什么,这点先别太激动。不过沙箱启动 20-40ms 和每分钟 60 万实例的并发能力如果是真的挺省钱,说明执行层的基础设施正在变成新战场。整体适合放进 featured,给做 Agent 的人一个信号:别光盯着模型跑分,...

Latent Space

OpenClaw 的两面:TED 讲的是故事,工程师看到的是 60 倍安全报告和至少 20% 的恶意技能提交

Peter Steinberger 在同一天放出了两个演讲,面向公众的 TED 版本讲了 OpenClaw 的高光时刻,面向工程师的 AIE 版本则交了底:安全报告数量是 curl 的 60 倍,社区提交的技能里至少 20% 是恶意的。OpenClaw 被称作史上增长最快的开源项目,但正文没披露它的架构、上线时间和治理模式。真正的信号是攻击面的膨胀速度...

推荐理由:我会先打个折:正文没披露 OpenClaw 的具体架构、发布时间和治理机制,所以这篇更像一个信号而不是一份完整分析。但它把公众叙事和工程现实撕开来看,用 60 倍安全报告和 20% 恶意 skill 贡献这两个数字,直接点出开源代理栈的安全债已经跑在治理前面了。对正在搭 agent 的团队来说,这个提醒比增长故事值钱。

X · @dotey(宝玉)

Anthropic 设计师一人扛 7 条产品线,分享了 9 条用 Claude 做设计的实操心得

Anthropic 设计师 Ryan Mather 一个人负责公司 7 个产品线,他公开了自己用 Claude Design 的工作流。核心是先花一小时让 Claude 把代码库和设计稿抽成一套 UI Kit,后续生成的设计稿会自动套用风格,省掉重复劳动。协作上,他建议设计师和工程师一起看着画布边聊边改,取代过去“出稿→丢给开发→返工”的接力模式。操作...

推荐理由:这是条扎实的实操笔记。Anthropic 自家设计师现身说法,给的 9 条建议都能直接落地,不是泛泛聊趋势。我会先打个折:正文没披露省了多少时间、任务成功率这些硬指标,所以分数停在 76。但“人做人审”变成“Claude 做、人审”这个流程转向,对从业者来说比很多产品公告更有参考价值。

Hacker News 首页

rtrvr.ai 把浏览器操作录成脚本,重放零 token 成本,还能让 AI 直接调用

rtrvr.ai 做了一个叫 AI Subroutines 的功能,核心思路是把你在浏览器里的一次操作录下来,变成一个可重复调用的工具脚本。重放时脚本直接在当前网页里跑,cookie、CSRF token、签名头这些认证信息全都不用手动处理,浏览器自己就带上了。录制时会从几百个网络请求里自动筛出真正有用的那几条,遇到 GraphQL 那种一更新就失效的...

推荐理由:rtrvr.ai 这个 Show HN 放出了一个叫 AI Subroutines 的功能,核心是把录过一次的浏览器操作存成可重复调用的工具,直接在当前标签页里执行,复用登录态和请求签名,省掉了反复调大模型的成本和延迟。我会先打个折——这是单家公司的产品更新,不是行业级事件,所以放在 featured 中段。但它的技术细节够实在:录制时把约 300 个请求压缩到约 5 个,GraphQL operation ID 不稳定就退回纯 DOM 操作,还支持一次调用批量分发 500 行参数。这些数字说明它在成本和延迟上确实有想法,不是空画饼。正文没披露多标...

X · @dotey(宝玉)

Anthropic 发布 Claude Design,用对话代替拖拽生成设计稿

Anthropic 推出了 Claude Design,一个靠聊天就能出设计稿的工具,背后跑的是新模型 Claude Opus 4.7。你描述需求,它直接生成图片,然后通过对话、批注、直接编辑或拖拽滑块反复改。团队第一次用的时候,它会读你的代码库和设计文件,自动生成一套设计系统(品牌色、字体、组件),后续项目自动套用。支持从文字、图片、文档或网页截取起...

推荐理由:Anthropic 把 Claude 塞进了设计环节,HKR 三项都站得住。文章给了开放节奏、底层模型和导出目标,信息量够上 featured。不过目前还是研究预览,不是模型级大更新,我会先打个折,重要性给 84。

4月17日星期五

Hacker News 首页

实测 Claude 4.7 新分词器:技术文档的 token 消耗涨了 47%

作者用 Anthropic 的免费 token 计数接口,拿同一批内容分别喂给 Claude Opus 4.6 和 4.7,看 token 数涨了多少。7 份真实 Claude Code 用户会发的样本(包括 CLAUDE.md 文件、终端输出、代码 diff 等)加权后从 8254 个 token 涨到 10937 个,整体多了 32.5%。其中技术...

推荐理由:这篇不是官方通稿,是第三方实测,把“同价”背后的 token 膨胀算清楚了。我会先打个折:IFEval 只抽了 20 题,样本量不大,但真实文档 1.47 倍、中文日文几乎不涨这些数字对实际用量有参考价值。对用 Claude Code 的人,窗口烧得快、缓存命中变贵、限流更容易触发,这些比 IFEval 涨 5 个点更值得盯。正文没披露样本的具体内容,但加权方法和对照设置交代得够用。