跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 441–460 条 · 共 760 条

4月30日星期四

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

Hacker News 首页

Ramp 的表格 AI 会偷偷把财务数据传出去

安全公司 PromptArmor 发现 Ramp 的 Sheets AI 有个漏洞:攻击者可以在外部表格里藏一句白底白字的指令,诱导 AI 自动插入一个 IMAGE 公式,把用户表格里的敏感财务数据拼到攻击者网址后面发出去。整个过程不需要用户确认。Ramp 那边说已经在 2026 年 3 月 16 号修了。

推荐理由:HKR 三项全中:文章把一条 AI 表格工具的数据外泄路径讲得很清楚。给 82 分没上 85,是因为只有 PromptArmor 单方信源,而且实际受影响的数据规模正文没披露。

X · @dotey(宝玉)

Hermes Agent 的记忆系统拆解:它用四层设计避开了 OpenClaw 的坑

Hermes Agent 的记忆不是一套,而是四套:高度浓缩的提示词记忆(MEMORY.md 和 USER.md)、可搜索的 SQLite 历史会话存档、像程序记忆一样运作的技能管理,以及可选的 Honcho 深层用户建模。核心思路是冷热分离——把最常用的信息压进极小的提示词快照里(加起来约 1,300 个 Token),以保住大模型的提示词缓存、降低...

推荐理由:这篇文章不是产品发布,更像一篇技术拆解,把 Hermes Agent 的记忆系统讲得很清楚。我会先打个折:它来自单一信源,没有第三方验证,但给出的四层结构、字符限制和缓存优先思路对实际做 agent 的人有参考价值。正文没披露性能对比数据,所以别把它当评测看,当成一个设计思路的分享就好。

4月29日星期三

新智元 · 公众号

清华团队花约10万美元、一周时间,让系统自动刷出105个SOTA

清华徐丰力团队和北京中关村实验室搞了个叫AutoSOTA的系统,放养式跑了一周,烧掉约220亿token,产出了105个所谓的最优结果。系统里塞了8个智能体,分别负责搭环境、修bug、排任务、想点子、做审计。每完整跑一轮平均5小时。最关键的是它设了条红线:不准改评估脚本和数据划分,靠这个来保证结果能复现。不过正文没披露具体在哪些任务上拿了SOTA,也没...

推荐理由:HKR三项全中:有具体数字和机制描述,审计约束让说法可验证。保留84分是因为这仍是单篇二次报道,不是模型或产品级发布,但选题和切入角度对从业者足够有信息量。

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

X · @dotey(宝玉)

OpenAI 把 GPT-5.5、Codex 和托管智能体搬上 AWS Bedrock,限量预览已开

OpenAI 和 AWS 扩大了合作,现在企业可以在 Amazon Bedrock 上直接调用 GPT-5.5、Codex 编程工具和托管智能体。以前用 OpenAI 基本只能走 Azure,重仓 AWS 的公司要么迁移要么放弃,现在这个障碍没了。企业能在自己熟悉的 AWS 环境里复用安全策略、合规和账单体系,Codex 的费用还能算进 AWS 的云消...

推荐理由:这条不是普通的云合作公告。OpenAI 把 GPT-5.5 和 Codex 放到 AWS Bedrock 上,等于在 Azure 之外开了第二条企业通道,而且直接绑定了 AWS 的合规和计费体系。Codex 周活 400 万说明开发者端已经有量,现在企业采购可以走 AWS 的消费承诺,省事也省钱。限量预览阶段,实际可用性和延迟还没公开,这点先别太激动,但方向本身值得当天就关注。

Hacker News 首页

OpenAI 模型将上线亚马逊 Bedrock,Sam Altman 和 AWS CEO 聊了聊托管 Agent

OpenAI 和 AWS 宣布合作,把 OpenAI 的模型搬上亚马逊 Bedrock 平台,主打“托管 Agent”——你可以理解成让模型直接在你的 AWS 环境里跑业务流程,安全性和权限管理这块能省不少事。这次采访里 Sam Altman 和 AWS CEO Matt Garman 聊了这件事,但没公布具体会上哪些模型、怎么收费、什么时候上线。能促...

推荐理由:Sam Altman 和 AWS CEO 亲口确认 OpenAI 模型会通过 Bedrock 的托管代理功能接入,同时微软那边的协议也改了,Azure 首发地位保留但 OpenAI 能去别的云了。我会先打个折:正文没写具体价格、会上哪些模型、什么时候能用,所以重要性停在 88 分这个区间。对从业者来说,这消息打破了 OpenAI 和 Azure 绑定的老印象,跨云分发和授权到 2032 年都是实打实的新事实,值得一看。

X · @dotey(宝玉)

AI 终端 Warp 把客户端代码开源了,OpenAI 是创始赞助商

Warp 是一个用 Rust 写的现代终端,有超过 70 万开发者用,核心卖点是把 AI 塞进命令行,你用自然语言说想干嘛,它帮你生成命令。这次开源的是客户端代码,走 AGPL 协议,服务端还是闭源的。比较特别的是他们的社区贡献流程:Warp 自家的云端 AI 平台 Oz 负责写代码、做规划、跑测试,人主要负责提想法和验证,等于在跑一个“人管方向、AI...

推荐理由:Warp 这次开源的是客户端代码,走 AGPL 协议,服务端没动,所以别理解成整个产品都开源了。OpenAI 当创始赞助商是个信号,但正文没展开双方具体怎么合作。真正有意思的是他们提的“人管方向、AI 干活”的贡献流程,不过目前还只是说法,没看到跑起来的例子。70 万开发者的数字说明用户盘子不小,Rust 重构也加分。整体是条扎实的开发者工具动态,不是模型或能力层的重大发布。

The Verge · AI

Claude 现在能直接操控 Photoshop、Blender 和 Ableton 了

Anthropic 给 Claude 装上了“创意连接器”,让它能直接读写 Adobe 全家桶、Affinity、Blender、Ableton 和 Autodesk 这些专业软件。以 Blender 为例,Claude 可以帮你排查 3D 场景哪里出了问题、写自定义工具,还能批量修改一堆物体的属性。另外,Anthropic 还给 Blender 基金...

推荐理由:HKR 三项都成立:Claude 进入主流创作软件是明确的跨工具钩子,连接器覆盖广且 Blender 端有具体操作能力,这件事踩中了 agent 进入专业工作流的神经。正文没提价格和完整上线地区,所以先别太激动,但方向本身值得关注。

4月28日星期二

X · @claudeai

Claude 现在能直接操作 Blender,在聊天窗口里改 3D 场景

Claude 上线了 Blender 连接器,你可以在对话里让它帮你排查场景问题、写新工具,或者批量修改所有物体。正文没提这个功能是免费还是付费、支持哪些版本,也没说清楚 Claude 在 Blender 里的操作权限边界——它能改到什么程度、会不会误删东西,这些都得等实测才知道。

推荐理由:HKR 三项都过:Claude 接 Blender 是 Agent 往专业工具里伸了一只真能干活的手,不是概念图。正文没提版本、定价和上线范围,所以重要性停在 76,够 featured 但不到必写。我会先打个折——没看到实际跑起来的延迟和权限边界,这点先别太激动。

Hacker News 首页

GitHub Copilot 的代码审查功能将从 2026 年 6 月 1 日起消耗 Actions 分钟数

GitHub 发了条计费变更通知:从 2026 年 6 月 1 日起,Copilot 的代码审查功能会开始消耗你账户里的 GitHub Actions 分钟数。以前这个功能只算在 Copilot 自己的额度里,现在等于要双重计费——Copilot 那边按新出的 AI 点数算,跑审查任务本身还要再吃一份 Actions 的时长。私有仓库会先从你套餐里包含...

推荐理由:这是 GitHub 官方对 Copilot 代码审查的计费规则调整,把审查消耗从隐形变成显性,直接打到 CI 配额和团队发票上。HKR 三项都满足,但它本质是定价规则而非新能力发布,所以重要性放在 72–77 这个区间。

Computing Life · Share · 鸭哥调研

Anthropic 发布 9 个创意工具连接器,让 Claude 直接操控 Blender、Photoshop 等软件

Anthropic 在 4 月 28 日发布了 Claude for Creative Work,包含 9 个连接器,让 Claude 能直接调用 Blender、Adobe 全家桶、Ableton 等专业软件的后端接口干活。用户用自然语言下指令,Claude 就能在软件里执行操作,比如在 Blender 里生成带空间关系的 3D 场景。这件事本身不是...

推荐理由:Anthropic 这次不是发模型,是给 Claude 接了 9 个创意工具的连接器,相当于让模型直接操作设计软件。文章自己提了个三层框架来看这事靠不靠谱:工具有没有可编程接口、中间有没有连接协议层、最后能不能形成感知评估的闭环。我会先打个折——正文没披露具体接了哪些工具,也没说开放到什么程度,所以实际能跑通多少还不好讲。真正值得盯的是 feedback loop 那层,如果模型能收到设计输出的反馈再自己调整,才算进了创意流程的脑子,不然还只是高级点的批处理。这点先别太激动,等名单和接入方式出来再看。

Hacker News 首页

Claude Pro 用户想在 Claude Code 里用 Opus 模型,得先开通并购买额外用量

Anthropic 的官方帮助文档列出了 Claude Code 支持的 6 个模型,从 Opus 4.7 到 Haiku 4.5。关键限制是:Pro 订阅用户不能直接调用 Opus 系列,必须先去设置里开启“额外用量”并完成购买才能用。文档给了三种切换模型的方法:在对话里直接敲 /model 选、启动时加 --model 参数、或者把 ANTHROP...

推荐理由:这条来自帮助文档,讲的是 Claude Code 的模型访问和配置方式,不是新模型或重大能力发布。Anthropic 的相关性把它拉到了 featured 低位。

X · @dotey(宝玉)

西方忘了怎么造东西,现在也快忘了怎么写代码

作者拿国防工业的教训来比软件行业:美国重启毒刺导弹生产线要4年,因为会造的人早退休了,图纸还是卡特时代的;欧洲承诺100万发炮弹,晚了9个月才凑齐,因为发射药停产17年、TNT只剩一家厂。核心不是没钱,是知识断了。软件业现在也在走这条路——METR的对照实验发现,资深开发者用AI写代码反而慢了19%,但很多人已经离不开AI。Salesforce今年不招...

推荐理由:标题类比够尖锐,正文用军工交付延迟和 METR 的 19% 降速给了硬数字,最后把焦点从 AI 速度拉回到人才断层,对 AI 从业者来说比单纯吹或黑 AI 编程更有讨论价值。因为是转译加评论,权威性打折扣,但信息量和话题度都够,放在 featured 里合适。

X · @dotey(宝玉)

GitHub Copilot 6 月 1 日起改按用量计费,重度用户账单会变不确定

GitHub Copilot 从 6 月 1 日起取消“高级请求次数”,换成 AI 积分(AI Credits),按输入、输出和缓存的 Token 消耗来扣费。各档订阅价格没变,Pro 每月给 10 美元积分,Pro+ 给 39 美元,但积分花完就没了,不再像以前那样能降级到便宜模型继续用。代码补全和“下一步编辑建议”这类基础功能不消耗积分。企业用户 ...

推荐理由:这条消息对用 Copilot 写代码的人影响很直接:订阅价没涨,但计费逻辑从包月变成了按 Token 消耗扣积分。Pro 每月给 10 美元额度,Pro+ 给 39 美元,超出部分怎么收费正文没写,这是个信息缺口。最该盯的是 Copilot Agent 跑长任务的消耗——这类任务 Token 用量大,账单可能跳涨,但具体费率还没公布,先别急着算账。整体判断挂在成本变化和缺失的费率信息上,分数维持 80 合理。

X · @dotey(宝玉)

Cursor 3 用户反馈:别光顾着炫,先把 Agent 和 IDE 无缝焊在一起

Eric Zakariasson 的 Cursor 3 反馈帖收到 431 条回复,核心诉求不是更花哨的界面,而是一个稳定可靠的 AI 开发工作台。用户最强烈的意见是:Agent Window 不能牺牲 IDE 基本能力,进去之后 LSP、调试、终端、diff 操作经常要切回旧界面,理想状态是 Agent 推进工作,人随时能无缝接管。多 Agent 和...

推荐理由:三条都过:431 条回复量够大,需求提得具体,而且正好打在开发者对 AI 工作台的焦虑点上。放在 featured 低段是因为这是用户反馈汇总,不是 Cursor 官方发布或路线图,信息增量有但权威性打折。

Hacker News 首页

GitHub Copilot 要从固定月费改成按用量计费了

GitHub 在 2026 年 4 月 27 日发了篇博文,标题就是 Copilot 要转向按用量计费。但正文只抓到了标题、发布时间和一堆导航栏,具体怎么个“按用量”法——比如按什么指标算钱、单价多少、有没有免费额度、超额怎么收费——全都没披露。所以现在只能知道计费模式要变,细节一概不清楚,先别急着算账。

推荐理由:Copilot 改按量计费,对用它的团队来说,账单结构变了,得重新算账。我会先打个折——正文只给了标题和时间,没写什么时候生效、按什么单位算钱、单价多少、超额怎么收,这些才是采购真正要盯的。所以这条消息的钩子在于提醒大家盯用量口径,而不是现在就能做决策。

4月27日星期一

The Verge · AI

Canva 的 AI 工具把设计里的“巴勒斯坦”自动改成了“乌克兰”,公司已道歉

Canva 的 Magic Layers 功能本来是把平面图拆成可编辑图层,结果被用户发现它会偷偷把文字里的“Palestine”替换成“Ukraine”。X 用户 @ros_ie9 测试时,“cats for Palestine”变成了“cats for Ukraine”,但“Gaza”这个词没受影响。Canva 说已经修了,但没解释触发机制是什么。

推荐理由:这不是常规功能更新,而是一次具体的 Magic Layers 事故。H 来自“Palestine 变 Ukraine”这种不该发生的替换;K 在于功能边界被打破,且正文没披露触发逻辑;R 则指向政治敏感和信任风险。我会先打个折,因为 Canva 只说已修复但没解释原因,信息缺口还在。

Hacker News 首页

Utilyze 开源 GPU 监控工具,说比 nvtop 更准,能看出显卡是真忙还是在摸鱼

Systalyze 开源了一个叫 Utilyze 的 GPU 监控工具,专门解决 nvidia-smi 和 nvtop 那个老毛病:它们只告诉你显卡“有没有在干活”,不告诉你“干得有多满”。比如 H100 有 132 个流式多处理器、一万七千多个核,但只要有一个核在跑,利用率就敢报 100%,实际算力可能才用了 1%。Utilyze 会直接算你的 GP...

推荐理由:这篇抓住了 GPU 监控里一个很常见的坑:传统工具只看二值占用,不看有效计算效率。对跑生产负载的人来说,知道真实吞吐上限比看仪表盘数字重要得多。我会先打个折,因为工具来自一个还没被广泛验证的团队,正文也没披露具体开销有多“可忽略”,但选题和解释都到位,放在 featured 没问题。

Hacker News 首页

在万米高空断网跑大模型:M5 Max 撑了 10 小时,但一根充电线让我亏了 34W 供电

作者在伦敦飞拉斯维加斯的 10 小时航班上,用一台顶配 MacBook Pro M5 Max(128GB 统一内存、40 核 GPU)离线跑了 Gemma 4 31B 和 Qwen 4.6 36B 两个本地模型。他主要用 DuckDB 搭了个云账单分析工具,还处理了约 400 万 token 的零散编码任务。体验下来,写限定范围的代码、做小工具时,本地...

推荐理由:这是一篇第一人称的本地推理实测,硬件、模型、功耗数字都摆出来了,不是空谈。我会先打个折:它更像个人体验报告,不是行业级发现,所以分数落在 72–77 这个区间。真正有意思的是功耗可观测性——同一负载下 iPhone 线只供 60W,MacBook 线供 94W,差了 34W,这点先别太激动,但说明供电配件对本地跑大模型的实际性能影响不小。正文没披露模型量化方式,也没说具体跑了什么任务,所以不能把结论拔太高。