跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 661–680 条 · 共 760 条

2月14日星期六

MIT Technology Review · AI

渐冻症夺走了这位音乐人的声音,AI 让他重新站上舞台唱歌

32 岁的 Patrick Darling 在确诊渐冻症两年后,用 AI 克隆了自己的歌声,2 月 11 日在伦敦重新和乐队一起演出。他的声音克隆不是用录音棚素材做的,而是从嘈杂的手机视频和厨房录音里拼出来的,ElevenLabs 的音乐工具花了大约六周调校。这件事的信号不在感人,在于门槛:ElevenLabs 把工具免费开放给因渐冻症等疾病失声的人,...

推荐理由:我会先打个折:这不是模型或产品大更新,而是一个应用案例。但案例本身够硬——ALS 患者用旧录音唱歌,不是概念演示,是真实上台。正文给了两个关键条件:10 分钟清晰语音和 6 周从噪音片段里抠出歌声,说明门槛和代价。ElevenLabs 把这个流程做成免费项目,但正文没披露底层模型细节,这点先别太激动。整体看,故事性强、有可复现信息、踩中声音权利话题,适合放低 featured。

2月12日星期四

Lex Fridman 播客

OpenClaw:那个爆火的 AI 代理,以及它背后的 Peter Steinberger

这期播客里,Lex Fridman 和 OpenClaw 的创建者 Peter Steinberger 聊了聊这个一夜爆红的开源 AI 代理。OpenClaw 在 GitHub 上已经拿到了超过 17.5 万颗星,它能接入 Telegram、WhatsApp、Signal 和 iMessage 这些聊天软件,用 Claude Opus 4.6 或 GP...

推荐理由:我会先打个折:这期播客更像一次现象级开源项目的快速围观,不是技术深潜。OpenClaw 的传播力来自它做了两件让人睡不着觉的事——自己过验证码、自己改代码,而且已经跑在大家日常用的聊天 App 里。18 万星标说明开发者用脚投票了,但正文没披露架构、评测方法和安全约束,所以别急着把它当生产级方案。真正值得盯的是系统级权限和自修改能力带来的攻击面,这点先别太激动,等有白皮书或独立审计再说。

MIT Technology Review · AI

安全的 AI 助手到底能不能做出来?

OpenClaw 这个开源项目把大模型接进了邮箱、浏览器和本地文件,等于给 AI 穿了一身机甲,让它能 24 小时帮你干活。但安全研究员快疯了,因为一旦模型读到恶意网页或邮件,攻击者就能通过“提示注入”直接劫持它,后果比聊天框里胡说八道严重得多。文章说现在网上可能有几十万个 OpenClaw 智能体在跑,连中国政府都发了公开警告。核心问题是:目前还没有...

推荐理由:这不是产品发布稿,但 HKR 三项都站得住:问题本身是个好钩子,文章补了规模和“无银弹”这两个事实,而且直接打在 agent 安全这个从业者神经上。放 featured 而不是 p1,是因为正文截断,没给出可复现的防护方案,我会先打个折。

2月10日星期二

36 氪 · 直链

OpenAI 要把 ChatGPT 装进美国国防部的内部 AI 平台

美国国防部打算跟 OpenAI 合作,把 ChatGPT 接入他们自己的生成式 AI 平台 GenAI.mil,覆盖大约 300 万人员。目前公开的消息只说了要集成、平台名字和用户规模,没提用的是哪个模型版本、权限怎么控制、具体用在什么业务上,也没说什么时候上线。

推荐理由:这条消息的看点不是“ChatGPT 被国防部用了”,而是分发链路:一个面向约 300 万人的内部平台把 ChatGPT 接进去,规模不小。但正文只说了集成关系和平台名,模型版本、谁能用、怎么管、什么时候上线全都没提,所以先别急着下结论。我会打个折,因为信息缺口明显,后续得盯军方实际部署和权限设计。

36 氪 · 直链

穹彻智能拿了数亿元A轮融资,要把机器人“大脑”装进药房和洗衣房

穹彻智能刚完成数亿元A轮融资,领投方是C资本,跟投的还有东南亚互联网平台Sea Limited、普华资本,老股东Prosperity7 Ventures也追加了钱。这家公司2023年11月成立,核心产品叫Noematrix Brain,相当于给机器人装一个能理解指令、自己规划步骤、适应环境变化的“大脑”。目前这个大脑已经用在轮式单臂、轮式双臂和人形双臂...

推荐理由:HKR 三项都踩中了:融资标题本身有海外加注的钩子,正文又补了真机数据量和落地场景,比单纯报一轮钱更有信息量。我会先打个折——估值、收入和客户数都没披露,所以放在 featured 的低位。

2月9日星期一

36 氪 · 直链

小红书把搜索框改成了语音问答,想让你用说话代替打字来搜生活经验

小红书在1月27日全量上线了“语音问一问”,用户在搜索页长按就能用语音提问,最长能说三分钟,也支持外语和方言。它给出的答案不是通用百科,而是把站内用户分享的真人经验总结成结构化回复,比如剪头发怎么跟理发师沟通这种非标问题。正文没披露背后的语音识别和模型技术方案,也没提延迟和准确率数据。这次改动的核心是把搜索从三四个字的关键词匹配,拉长到口语化的长句提问...

推荐理由:小红书把搜索框改成能长按语音提问,这事我会先打个折——正文没披露用的什么语音识别方案、模型延迟和准确率,所以实际体验稳不稳还不好说。但值得盯的是,它把原本短关键词搜索变成了长语音问题入口,等于在抢更细颗粒度的查询需求。对AI从业者来说,这是内容平台用语音+外挂资料库做搜索的落地样本,虽然技术细节缺位,但产品方向和上线节奏本身就有信号意义。

36 氪 · 直链

千问的1000万杯奶茶:阿里大发赛博鸡蛋始末

2月6日,阿里千问App搞了一场“免单喝奶茶”活动,一天涌进超1000万笔订单,直接把系统挤崩了。上午10点到中午12点,点单页面卡死、转圈,甚至弹出提示说自己“没有实体的手脚,无法连接支付系统”。宕机是因为千问的算力没扛住——AI处理下单、比价、支付比普通电商秒杀更吃资源,而初始服务器容量只有预估峰值的1/3,也没做充分的压力测试和扩容预案。线下门店...

推荐理由:我会先打个折:这本质是阿里的一场促销压力测试,不是模型突破。但1000万杯奶茶把服务器打崩的现场感很强,数字也够具体——10点到12点宕机、12点前200万单、算力只备了1/3,这些事实让文章有信息增量。对从业者来说,值得看的是阿里怎么用补贴把AI推到消费场景里,以及基础设施在真实并发下的表现,比单纯刷榜更有烟火气。

2月7日星期六

MIT Technology Review · AI

Moltbook 是一场 AI 表演秀,不是机器觉醒

Moltbook 是一个给 AI 机器人玩的社交网络,上线几小时就火了。官方说现在有 170 万个机器人账号,发了 25 万条帖子,留下 850 万条评论。这些机器人靠一个叫 OpenClaw 的开源工具驱动,它能把 Claude、GPT-5 或 Gemini 这类大模型接上邮箱、浏览器等日常软件,让模型替你干点简单活。但文章指出,这场热闹基本是人在背...

推荐理由:这篇不是市场级事件,但反炒作评论写得干脆。我会先打个折:它没有新数据或新漏洞披露,更多是把已有的怀疑用“AI 剧场”这个说法串起来。HKR 三项都过关——钩子够狠,数字和机制分析补得扎实,安全风险那段让做 agent 的人会心里一紧。整体够 featured,但信息增量有限,所以停在 74 分这个位置。

2月6日星期五

TechCrunch · AI

OpenAI 和 Anthropic 在同一天抢着发布能自己干活的编程模型,前后只差几分钟

OpenAI 推出了 GPT-5.3 Codex,一个专门给自家编程工具 Codex 用的新模型。按 OpenAI 的说法,这个模型让 Codex 从“能写代码、审代码”升级到“几乎能替开发者在电脑上干所有事”,甚至能在几天内从零做出功能复杂的游戏和应用。速度比上一代 GPT-5.2 快了 25%,而且 OpenAI 说这是第一个“自己参与造自己”的模...

推荐理由:这条消息的看点全在时间差——OpenAI 在 Anthropic 发布后几分钟就甩出自己的代理式编码模型,说明两边在让模型进开发流程这件事上咬得很紧。但正文能用的信息太少:没模型名、没跑分、没价格、没上下文窗口、也没说谁能用,只提了一嘴跟 Codex 有关。所以我会先打个折,重要性给到 75、放在 featured 低位,因为话题热度够,但证据太薄,暂时没法判断性能或性价比。

2月4日星期三

硅谷101 播客

E224|Mac mini遭疯抢,为何Clawdbot能成为2026年第一个现象级产品?

这期播客录制于1月30日,但随后几天项目经历了改名、被起诉、安全漏洞曝光和服务器瘫痪等一系列反转。嘉宾们从用户、软件算法和硬件三个角度拆解了Clawdbot(后更名为Moltbot、OpenClaw)爆火的原因。用户侧嘉宾知县认为,核心是“活人感”:它能通过即时通讯软件主动推送提醒、做调研,甚至吐槽,像《钢铁侠》里的贾维斯。算法侧嘉宾祯豪指出,其主动性...

推荐理由:这期不是官方发布,更像一篇行业快评,但信息量够硬:14.6 万 stars 和改名风波都是新事实,机制拆解也到位。我会先打个折——正文没披露 Mac mini 实际销量,标题的“疯抢”更多是话题钩子;Agent 电脑的需求判断来自讨论,不是出货数据。不过对从业者来说,交互层怎么搭比模型本身更值得盯,这期把记忆、心跳、IM 入口这些拼法讲明白了,所以给 featured。

2月3日星期二

Computing Life · 鸭哥

学 AI 的人卡在配置和部署上,这个团队用工程基建代替教程来解决

作者团队两年开了四门课、教了 2500 多人,发现大部分学员不是学不会,而是被绑卡、配环境、部署这些琐事耗光了热情。他们做了一个叫 AI Builder Space 的教学平台,学员注册后直接拿到免绑卡的统一 API,背后接好了 GPT、Claude、Gemini 等主流模型,改个参数就能对比实验;写完代码调个接口就能一键部署到 <名字>.ai-bui...

推荐理由:这篇文章把老生常谈的“教程没用”落到了具体数字和产品设计上:2500多个学员,真正交付产品的很少,卡在配置、实验、部署和上下文整理四件事。团队没再写新教程,而是搭了个平台,把免绑卡API、一键部署、多模型切换和MCP接入打包进去,让Cursor和Claude Code一行命令就能用。思路对,但正文没披露转化率、留存和成本,所以判断先打个折,放在featured低段。

MIT Technology Review · AI

我们一直搞错了 AI 的真相危机:就算知道是假的,人还是会信

MIT Technology Review 的这篇文章直接点出一个反直觉的发现:我们过去对 AI 造假危机的想象,可能全偏了。作者拿自己上周的报道举例——美国国土安全部首次被确认在用 Google 和 Adobe 的 AI 视频工具做面向公众的宣传内容,配合特朗普政府的移民执法造势。文章指出,我们原本指望靠 Adobe 的“内容真实性倡议”这类标签工具...

推荐理由:这篇不是空对空的评论。它先拿国土安全部用 Google 和 Adobe 视频生成器做公开内容这件事当引子,然后拆了两个标签系统的实际漏洞,最后用 Communications Psychology 的论文把问题钉死:受试者明知认罪视频是 deepfake,还是会据此判断有罪。信息链条完整,判断都挂在事实和论文上,没有补设定。我会先打个折,因为它本质还是评论加一篇论文,不是当天能震动行业的硬事件,但对正在搭安全流程的团队来说,这篇值得一看。

1月30日星期五

阮一峰的网络日志

你是第几级 AI 编程

史蒂夫·耶格把 AI 编程分成 8 级,从在 IDE 里装插件、逐条确认建议,到一路无脑点 Yes,再到同时开十几个 AI 窗口并行写代码,最后用编排器让机器自己管机器。他说自己已经到了第 8 级,还让 AI 写了个叫“煤气镇”的编排工具,攒了 22.5 万行 Go 代码,一行都没看过。这个工具已经拿到 6000 颗星,但他也直说用起来很费钱,而且可能...

推荐理由:Steve Yegge 这篇不是产品发布,是他自己的实践总结,但把“黑箱编程”从个人习惯抬到了工具链选择的层面。8 级分级本身有传播力,里面提到的并行跑 Agent 的成本和失控风险也写得很直白,没画饼。我会先打个折:这是二手评论,不是一手模型或产品,所以分数停在 77 合理。

彭博科技

Perplexity 跟微软签了 7.5 亿美元的 Azure 云合同,同时正和长期合作的 AWS 闹纠纷

Perplexity 签下一笔 7.5 亿美元的微软 Azure 云服务大单,而它原来的云供应商一直是亚马逊 AWS,双方目前有法律纠纷。这笔钱具体能买多少算力、合同签了几年,正文没披露。对 Perplexity 来说,换云意味着训练和推理的成本结构会变,但实际省不省钱、迁移顺不顺利,还得看后续落地。

推荐理由:这条消息我会先打个折,因为只给了金额和签约方,没给合同年限、算力体量,也没说从 AWS 迁了多少负载。但签约时机刚好卡在跟 Amazon 的法律纠纷上,等于公开把云供应从单一绑定转向再平衡,这对 Perplexity 的训练和推理成本结构影响很大。正文没披露诉讼细节,所以别急着下结论说谁对谁错,但云账单的议价权确实在变。

彭博科技

亚马逊正谈着要给 OpenAI 投 500 亿美元,顺便把算力生意绑在一起

《华尔街日报》的消息说,亚马逊在跟 OpenAI 谈一笔最高 500 亿美元的投资,双方还想把已有的合作关系再扩大。最核心的一点是,这不止是投钱,亚马逊会向 OpenAI 卖算力。不过正文没披露具体的交易结构、时间表,也没说这轮谈判能不能最终敲定。

推荐理由:我会先打个折:500亿是谈判上限,不是已落地的钱。真正值得盯的是算力绑定——亚马逊卖算力给OpenAI,这比单纯财务投资更能说明OpenAI在分散云供应商、降低对微软的依赖。正文没披露交易结构和时间表,所以目前只能当信号看,不能当事实用。

MIT Technology Review · AI

美国国土安全部用上了 Google Veo 3 和 Adobe Firefly 做视频

一份 DHS 公开的 AI 工具清单显示,他们正在用 Google Veo 3(视频生成)、Google Flow(整合了 Veo 3 的剪辑工具)和 Adobe Firefly 来制作和编辑对外发布的视频内容,估计有 100 到 1000 个使用许可。这算是第一次有书面证据表明,移民执法部门在社交媒体上发的那些看着像 AI 做的视频,背后可能用的就是...

推荐理由:这条消息的冲击力在于,一个联邦机构已经不只是内部试用,而是把生成视频工具写进了对外内容制作的流程里。100 到 1000 份许可的估算说明规模不小,但正文没披露具体项目、发布时间或单条视频归属,所以实际落地到什么程度还看不清。我会先打个折,不把它推到更高等级,因为缺少可验证的产出案例。真正值得盯的是跨平台水印和内容溯源目前没法验证,这点先别太激动,但确实是个持续的风险敞口。

1月28日星期三

Mistral AI

Mistral 发布终端编码智能体 Mistral Vibe 2.0

Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

推荐理由:原文列出 Vibe 2.0 的自定义子智能体、斜杠命令技能等具体能力与订阅入口,可据此判断终端编码智能体的工作流变化。

1月27日星期二

MIT Technology Review · AI

OpenAI 成立科学团队,想让 GPT-5 帮科学家干活

OpenAI 在 2025 年 10 月成立了新团队“OpenAI for Science”,由产品出身、读过粒子物理博士的 Kevin Weil 带队。团队目标是测试 GPT-5 这类模型能不能当科学家的助手,比如帮忙想点子、找研究方向和翻出几十年前冷门期刊里的老论文。Weil 说 GPT-5.2 在 GPQA 这个博士级理化生选择题测试上拿了 92...

推荐理由:这篇不是产品发布,而是战略分析,但信息量够硬。我会先打个折:GPQA 92% 看着漂亮,正文没披露测试条件和题型分布,别直接当科学推理能力暴涨。真正有意思的是 OpenAI 自己承认删过一条夸大解读的帖子,说明内部也在踩刹车。对做 AI 应用的同行来说,这比单纯秀分数更有参考价值——模型进实验室之前,先得管住嘴。

1月23日星期五

MIT Technology Review · AI

ChatGPT Health 上线了,它比“谷歌医生”靠谱多少?

OpenAI 本月推出了 ChatGPT Health,不是新模型,更像一个加了健康指导和外挂工具(比如可选的病历、健身数据)的包装壳。OpenAI 说每周有 2.3 亿人用 ChatGPT 问健康问题。但真正的考验是评估:有研究让 GPT-4o 在看不到选项的情况下答医学执照题,专家打分只有大约一半的回答完全正确;另一项用更贴近真人提问方式的研究里,...

推荐理由:H、K、R 三条都站得住:标题的替代叙事比普通产品发布更有钩子,正文给了具体使用量和两项评估结果,医疗场景天然高风险。分数留在 79 不变,因为这是 OpenAI 在现有模型上加的一层产品包装,不是新模型发布,而且落地细节、监管和法律责任正文都没展开,我会先打个折。

1月21日星期三

NVIDIA 博客

黄仁勋在达沃斯把 AI 分成五层蛋糕,说这是人类史上最大规模基建

黄仁勋在达沃斯论坛上把 AI 产业链拆成五层:能源、芯片与算力基建、云数据中心、模型、应用。他说 2025 年全球风投砸了超过 1000 亿美元,大部分钱流向了 AI 原生公司,重点在应用层和基建层。他举了个具体例子:美国护士缺口大概 500 万,AI 可以先把病历记录和转录这类活接过去。对从业者来说,他传递的信号是瓶颈不只在模型本身,整条基建和人力链...

推荐理由:这篇是黄仁勋在达沃斯的发言,不是产品发布或论文,所以分数不会给到顶。但他说的事够具体:1000 亿美金风投、五层栈结构、500 万护士缺口,而且把 AI 讨论从模型竞赛拽回基础设施和劳动力替代,对从业者有参考价值。我会先打个折,因为终究是高管讲话,不是可复现的结果,但信息量和切入角度都到位,80 分合理。