跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 461–480 条 · 共 760 条

4月27日星期一

量子位 · 公众号

Meshy 用户破千万后开始做 3D 打印实物,ARR 一年翻了 14 倍

Meshy 的注册用户超过一千万,ARR(年经常性收入)做到 4000 万美元,2025 年收入同比翻了 14 倍。他们新推的 Meshy Creative Lab 能直接生成钥匙扣、冰箱贴、键帽这类小物件的 3D 模型,但正文没披露实物下单功能是否已上线。一个值得留意的数据是:他们测了 75 个模型,在拓竹切片软件里的切片通过率达到 97%,说明模型...

推荐理由:Meshy 这次更新不是画饼,是拿钱和打印通过率说话。我会先打个折:实物订购还没上线,正文只说“进入倒计时”,这点先别太激动。但 97% 的切片通过率对 3D 打印玩家是实打实的省事信号,说明模型不是只能看,真能打。ARR 年翻 14 倍也侧面印证头部厂商已经在买单,不是靠免费用户撑场面。整体是垂直 3D AI 产品的一次公司自曝数据更新,信息量够,但没到行业地震级别,放在 featured 低位合理。

Hacker News 首页

Chrome 内置 Prompt API:在浏览器里直接跑大模型

Chrome 给开发者提供了一个 Prompt API,让网页可以直接调用浏览器内置的 AI 模型来生成文本,不用把数据发到云端。这个 API 还支持会话管理(保持多轮对话上下文)和结构化输出(让模型按固定格式返回结果,方便程序解析)。文档里没写具体用的是什么模型、上下文窗口多大、收费不收费,也没提什么时候能正式上线。目前看起来还在早期试验阶段,适合想...

推荐理由:Chrome 把 AI 塞进浏览器里,网页调个 API 就能用,这个入口变化挺大。会话管理和结构化输出两份配套文档让方案看起来不是空壳,但正文没提模型规格、上下文窗口多大、要不要付费、什么时候正式上线,所以我会先打个折,放在 featured 里偏低的位置。

机器之心 · 公众号

Meshy 6 发布,这家靠 99 行代码复刻冰雪奇缘起家的公司,现在在欧美 3D AI 市场占了六成份额

Meshy AI 发了 Meshy 6,正文没披露具体技术细节。公司说自己在欧美发达市场占有率超过 60%,三年积累了 1000 万用户、年经常性收入超 4000 万美元,用 AI 生成了 1 亿多个 3D 模型。37 互娱用下来,基础雕刻工作量少了 30% 到 40%,说明工具确实能嵌进美术管线里省人力。不过文章因为环境异常没加载出完整内容,产品实际...

推荐理由:我会先打个折:欧美市场份额超60%是公司自己说的,正文没给第三方数据或基准测试,这点先别太激动。但 Meshy 6 的看点不在那个份额,而在三七互娱给出的30%到40%雕刻工作量减少,这是实打实的生产环节反馈。1000万用户和4000万美元 ARR 说明商业化跑起来了,对做 3D AI 工具的人有参考价值。整体信息量够,但缺独立验证,所以放在 featured 低段。

OpenAI News

OpenAI 开源了一套叫 Symphony 的规范,把项目管理看板变成 AI 编程 agent 的指挥中心

OpenAI 放出了 Symphony,一个开源的 agent 编排规范。它的核心思路是把 Linear 这类任务看板当成控制面板,每个待办任务都会自动分配一个编程 agent 去干活,人只负责最后审查结果。OpenAI 内部团队用上后,合并的 PR 数量三周内涨了五倍。工程师不用再同时盯着好几个 agent 会话,避免了频繁切换上下文的痛苦。agen...

推荐理由:H 和 R 都站得住:OpenAI 开源一个 Codex 编排规范,对 agent 工作流有直接关联,issue 变常驻 agent 的设想也够具体。K 这边我会先打个折,因为许可、接口、可复现的机制全都没披露,现在只能当个方向性信号看,别太激动。

4月26日星期日

Hacker News 首页

别把 AI 代理当同事,把它嵌进你的软件里

Feldera 的联合创始人 Gerd Zellweger 认为,现在流行的 AI 代理(比如那些帮你写代码、查问题的机器人)太像人了:爱解释、爱总结、需要来回对话,用起来很累。他提出应该把代理嵌入现有软件,让它安静地在后台干活。文章给了三种已知的集成模式:命令行接口(CLI)、声明式配置(告诉系统要什么结果,别管步骤)、以及像 Kubernetes ...

推荐理由:这篇文章是 Feldera 联合创始人的工程观点,不是产品发布或一手评测,但把 Agent 嵌入软件的三种模式讲得清楚。我会先打个折,因为正文没给出实际部署数据或对比实验,更像架构主张。不过它把“Agent 解释新信息,数据库引擎持续执行逻辑”这个分工点透了,对正在纠结 Agent 交互形态的从业者有参考价值,所以放在 featured 里。

Hacker News 首页

用 Claude Code 把烂尾项目捡起来跑通,这事不丢人

作者拿自己一个搁置已久的项目做实验:写一个中间层,把 YouTube Music 伪装成 OpenSubsonic 服务,让 Feishin、Symfonium 这些播放器能直接播 YouTube 上的歌。他用 Claude Code(Opus 4.6)从零搭,技术栈是 FastAPI、Pydantic、ytmusicapi 和 yt-dlp。做法是先...

推荐理由:这是一篇第一人称的实战记录,不是行业通稿。作者用 Claude Code 加 Opus 4.6 重写 YouTube Music 到 OpenSubsonic 的连接器,技术栈交代清楚,调试过程有具体细节。最值得看的是他的工作方式:先写清楚 spec,再让模型生成,最后人工验收,比一次性全丢给模型靠谱得多。信息量够、有可复用的思路,但影响范围就停在个人开发工作流这个层面,没到行业级更新。

4月25日星期六

Hacker News 首页

Stash 开源了一个 AI 记忆层,让任何智能体都能记住你是谁、聊过什么、踩过哪些坑

Stash 是一个开源的持久化记忆层,用 PostgreSQL 加 pgvector 做存储,给 AI 智能体配了 28 个 MCP 工具和一套 6 步处理流水线。它跟外挂资料库(RAG)不一样:RAG 只会翻文档,Stash 会从对话里自动提炼事实、建知识图谱、跟踪目标和失败记录,还能发现前后矛盾的地方。记忆按层级命名空间分桶,用户、项目、智能体自省...

推荐理由:我会先打个折:这是个独立开发者的开源基础设施项目,不是大厂或平台级发布,所以分数停在 featured 低段。但 HKR 三项都站得住。钩子不是“像 ChatGPT 一样记住你”的标题党,而是把记忆层做成可移植的中间件,任何 agent 都能接。正文给了足够的技术细节,28 个工具、6 个阶段、pgvector 存储和命名空间隔离,架构看得见。对 agent 开发者来说,长期记忆、上下文成本和供应商锁定是实打实的痛点,这个项目直接回应了这些需求。

Computing Life · Share · 鸭哥调研

Anthropic 让自家客户端跑别家模型,反常让步背后在赌什么

Anthropic 在 Claude Cowork 里加了个开关,让你能换成 GPT-5.5、Gemini 3.1 Pro 或 DeepSeek V4 来跑任务。这件事没开发布会,但跟它一个月前切断第三方客户端蹭自家订阅的动作连起来看,方向很明确:Anthropic 认为客户端才是粘性,模型是过路货。更反常的是,走这条路 Anthropic 既收不到订...

推荐理由:我会先打个折:来源非官方,Cowork 用户基数也小,所以没给更高分。但这条消息的钩子很强——让自家产品跑别家模型,还明确不收过路费,数据也不经手,这比单纯发个新功能更值得盯。文章把 AWS、Google、微软在 agent 运行时上的布局串起来,点出了模型层和基础设施层的博弈,对从业者判断生态走向有帮助。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

Hacker News 首页

数据库没为 AI 代理这波操作做过设计

Arpit Bhayani 指出,让 AI 代理直接操作数据库,会同时打破我们过去四十年默认的四条规矩:查询是写死的、写入是有人审核过的、连接是短暂的、出问题有人盯着。他给 PostgreSQL 开了几剂具体药方:给代理用的数据库角色加上 5 秒语句超时和 10 秒事务空闲超时;全面改用软删除,并记录是谁删的、为什么删;对关键数据只追加不修改,靠事件日...

推荐理由:我会先打个折,这篇文章不是模型发布或产品更新,属于工程评论,所以分数放在 72–77 这个区间合理。但它的切入角度很刁,把数据库的老规矩和智能体的新行为直接对撞,而且给了能落地的 Postgres 防护参数,对正在让智能体进业务流程的团队来说,这些坑和补丁比泛泛而谈的安全建议有用得多。正文没给出大规模压测数据,所以别指望它能证明这些配置在生产环境扛不扛得住,但作为一份“把 agent_worker 当不可信调用方”的实操清单,价值够了。

X · @dotey(宝玉)

Cursor 3 加了 /multitask,能让多个子智能体同时干活,不用排队等

Cursor 3 新出的 /multitask 命令,可以同时跑好几个异步子智能体,不用像以前那样一个任务做完才能开始下一个。已经在排队里的任务也能随时切成并行模式。帖子没提同时能跑几个、吃多少资源、一个崩了会不会带崩其他的。

推荐理由:这次更新解决的是 Cursor 里一个挺烦人的瓶颈——以前子任务只能串行,现在能并行跑了,排队中的任务也能随时切模式。我会先打个折:正文没披露并发上限、资源占用和失败回退机制,所以实际能并行多少个、会不会吃满内存、一个子任务崩了怎么收场,都还不知道。但光是把串行改并行这一点,对日常编码吞吐的提升就够实在,所以放在 featured 低位。

TechCrunch · AI

ComfyUI 拿了 3000 万美元,估值冲到 5 亿,卖点是让创作者自己搭 AI 生图/视频的工作流

TechCrunch 消息,ComfyUI 刚融了 3000 万美元,估值 5 亿。它的工具不是又一个模型,而是给创作者一个可视化节点界面,像搭乐高一样把 AI 生图、视频、音频的步骤串起来,精细控制出图效果。正文没披露投资方、融资轮次、具体定价和发布时间,所以这笔钱到底怎么花、商业化节奏如何,现在还不清楚。

推荐理由:TechCrunch 报了 3000 万融资和 5 亿估值,让可控媒体工作流从爱好者圈子变成正经市场信号。我会先打个折——投资方、轮次、定价、发布时间表正文都没披露,所以别急着对标大模型公司。真正值得盯的是它把控制权还给创作者,而不是又一家拼生成效果的模型厂。

Hacker News 首页

我用 Claude Code 定时任务自动盯家庭财务,每天一封邮件汇报资产和异常

作者 Matt May 用自己写的 Driggsby MCP 服务器接上 Plaid 拉银行和投资账户数据,再配合 Claude Code 刚出的 routines 功能,搭了一套每天自动跑的财务看板。他之前用 Codex CLI 写脚本抓数据,经常因为网页渲染变化或二次验证挂掉,后来干脆花了两个月、写了约 7.5 万行 Rust 代码做成 Drigg...

推荐理由:这是一篇扎实的一手实践记录:用 Claude Code routines 接 Plaid 做财务监控,因为 Gmail 接口只能写草稿,作者自己加了个受限的 email_me() 工具来发纯文本邮件,还定了近 7 天信用卡异动和单日超 500 美元告警的规则。HKR 三项都站得住,但本质还是个人产品博客,不是实验室或平台级发布,所以放在 featured 档。

TechCrunch · AI

Google 计划向 Anthropic 投 400 亿美元,现金加算力

Google 打算先投 100 亿美元现金,把 Anthropic 的估值推到 3500 亿美元;后面还有 300 亿美元,但要看 Anthropic 能不能达到约定的业绩目标。这笔钱不全是现金,相当一部分会折算成云计算资源,也就是给 Anthropic 提供跑模型需要的算力。这个时间点刚好在 Anthropic 小范围放出新模型 Mythos 之后—...

推荐理由:这条消息的冲击力主要来自 400 亿美元的上限和现金+算力的组合,不是单纯的融资数字。我会先打个折:正文没写交易结构、时间表和算力配额,所以实际落地规模和节奏还不清楚。对从业者来说,真正值得盯的是算力绑定——Anthropic 对 Google Cloud 的依赖会不会加深,后续模型训练和推理成本能不能压下来,这点先别太激动,得等更多细节。

4月24日星期五

Hacker News 首页

为什么你应该拒绝让医生用 AI 帮你记病历

Emily M. Bender 和 Decca Muldowney 给了 9 个理由,劝患者在诊室里拒绝 AI 自动记录系统。这类工具会录下你和医生的对话,自动生成病历草稿。她们的核心担忧不是技术出错,而是诊所会把省下的时间拿来塞更多病人,而不是让你多聊一会儿。具体风险包括:录音和文字稿交给第三方公司,隐私保护未必靠谱;患者很难在几分钟内真正搞懂数据会...

推荐理由:这篇文章不是技术评测,是一篇立场鲜明的评论。两位作者直接劝患者对诊室里的 AI 录音工具说不,理由集中在录音数据怎么用、谁有权限看、语音识别对带口音的人不公平,以及医生可能过度信任 AI 草稿而漏掉关键信息。我会先打个折:全文没有给出实证数据,更像一份风险清单,所以重要性不会拉太高。但它的传播价值在于把“省时”背后的代价摊开讲——机构可能把省下来的时间变成更多接诊量,而不是让医生更仔细看你。这点对从业者来说是个提醒,别只盯着效率数字。

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

FT · 科技

Cohere 和 Aleph Alpha 谈成一笔 200 亿美元的大西洋两岸 AI 合作

两家公司宣布要联手搞“主权 AI”,也就是不依赖美国或中国的独立系统。但正文被付费墙挡了,没披露这 200 亿是估值、投资额还是营收目标,也没说钱怎么分、具体做什么产品、什么时候落地。这个数字很大,先别太激动,等看到交易结构再说。

推荐理由:FT 的信源分量把这条推到了 featured。200 亿的数字和主权 AI 的提法撑起了 H 和 R,但 K 偏弱——正文没讲怎么出钱、做什么产品、什么时候落地,所以分数停在 76。我会先打个折,真正该盯的是主权部署这个点,而不是标题里的金额。

机器之心 · 公众号

Anthropic 承认 Claude Code 变笨了,是这三个 Bug 搞的鬼

Anthropic 出来解释了,过去一个月大家觉得 Claude Code 质量下滑,不是模型本身变弱,也不是 API 出了问题,纯粹是工程层面的三个 Bug。第一个是 3 月 4 号把默认推理强度从“高”调成了“中”,相当于让模型干活时少动脑子;第二个是 3 月 26 号会话缓存出了错,可能让模型记错上下文;第三个是 4 月 16 号给提示词加了 2...

推荐理由:Anthropic 发了一篇很实在的事后说明,把 Claude Code 近一个月体验下滑归因到三个运行框架和提示词的 Bug,模型本身没退化。我会先打个折:这不是模型能力问题,而是产品配置翻车,但对天天用 Claude Code 写代码的人来说,推理强度被偷偷从 high 降到 medium、输出被限到 25/100 词,体感就是降智。文章把 3 月 4 日、3 月 26 日、4 月 16 日三个时间点的改动和回滚日期都标出来了,信息密度够,也直接点了 Sonnet 4.6、Opus 4.6、Opus 4.7 受影响,还提到 4 月 23 日重置...

Hacker News 首页

一个交互式网页,用可视化的方式拆解大语言模型是怎么造出来的

作者把 Andrej Karpathy 的技术讲座做成了一个可以点着看的网页教程,从爬互联网数据开始,一路讲到模型怎么生成文字。里面给了几个具体数字:训练用了 15 万亿个 token,模型参数 4050 亿,原始文本数据 44TB,词表大小 10 万个。网页把流程拆成了数据收集、分词、训练、推理和基础模型行为这几步,每一步都有动画或可交互的演示,比如...

推荐理由:我会先打个折:这不是新研究,是把 Karpathy 的公开课做成交互教材。但做得扎实——从 Common Crawl 抓数据、BPE 分词、Transformer 训练到温度采样,全流程可视化,还给了 15T tokens、405B 参数这些量级数字,让人对 LLM 的规模有体感。对想补基础的人很友好,正文没披露什么新 benchmark 或成本数据,所以别当行业信号看,就当一份高质量的学习材料。

量子位 · 公众号

Claude 承认三个 bug:推理降级、记忆清空、输出被限,越聊越傻不是错觉

Anthropic 在 4 月 23 号自己抖出了 Claude 近期的三个质量问题。第一个是 Claude Code 的推理强度,3 月 4 号起默认从高被偷偷调成了中,但界面还显示高,等于你花钱买高推理,实际跑的是省流版。第二个是 3 月 26 号出的缓存 bug,每次对话轮次都会清空思考状态,持续了 15 天,模型像失忆一样没法连贯想事。第三个是...

推荐理由:这是 Anthropic 自己发的故障复盘,不是用户单方面抱怨,所以信息可信度比一般吐槽高。HKR 三项都成立:标题自带钩子,三个 bug 都有日期和具体影响数字,而且把讨论从“AI 降智”的模糊叙事拉到了透明度和计费信任上,对从业者来说比单纯的情绪输出更有价值。不过毕竟只是复盘,不是新模型发布或重大安全事件,82 分合理。