跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 461–480 条 · 共 1,465 条

7月2日星期四

Latent Space

Paul Bakaus 谈技能工程:为什么让 AI 一次性生成整个设计是条死路

Paul Bakaus 做了一个叫 Impeccable 的开源设计技能包,专门给写代码的 AI 智能体用。他的核心观点是:别让 AI 一次性重做整个网站,而是让人用“再大胆点”、“安静一点”这种设计师常用的话去指挥它。他把这叫做“技能工程”——把专家的词汇压缩成指令,防止 AI 做出来的东西千篇一律。他注意到,现在至少有一半用户是设计师,他们把这当成...

推荐理由:Paul Bakaus 搞了个叫 Impeccable 的开源技能包,核心想法是别让 AI 一口气重做整个网站,而是让人用设计师常用的那套话去指挥它,他把这叫做“技能工程”。这个概念新鲜,有具体产物和用户数据撑着,不是空谈。我会先打个折:正文没披露这个技能包在复杂项目里的翻车率,但至少给了一条可落地的路。

Ben's Bites

Fable 5 重新上线,同时来了个新的 Claude Sonnet 5

Anthropic 把 Fable 5 又放出来了,付费用户能用,但只到 7 月 7 号,而且用量上限砍半。官方说这次加了更强的安全护栏。Scale 的跑分显示它能完成 16% 的远程工作任务,是 Opus 4.8 的两倍。同时发布的 Claude Sonnet 5 跑分接近 Opus 4.8,单 token 价格更低,但实际跑一个任务的总花费差不多,...

推荐理由:Anthropic 同时放出 Fable 5 的限时回归和 Sonnet 5,两条消息叠在一起。Scale 的跑分给了可对比的硬数字,不是纯宣传稿。Fable 5 的 16% 任务完成率虽然翻倍但绝对值还低,所以重要性没推到 90 以上。

AI HOT 精选

Fable 5 在远程劳动基准测试中能搞定 16% 的自由职业项目,八个月前这个数字是 2.5%

远程劳动指数(RLI)用 240 个真实付费项目(总价值 14.4 万美元)来测 AI 智能体能不能干出客户愿意买单的活。最新结果里,Fable 5 的自动化率冲到 16.1%,比第二名 Opus 4.8 的 8.3% 高出一大截,GPT-5.5 只有 6.3%。八个月前最好的成绩才 2.5%,进步确实快。不过 Fable 5 有 22 个项目因为美国...

推荐理由:RLI 是目前少数用真实付费外包项目当考题的基准,不是实验室里自己出题自己答。Fable 5 冲到 16.1%,比第二名高出一大截,八个月进步六倍,这个速度值得上推荐。没给到最高档是因为 Fable 不是一线大厂,正文也没披露模型大小和跑一次要花多少钱——如果成本高到不如直接雇人,那 16% 的含金量就得打个折。另外有 22 个项目因为美国地区限制被筛掉,说明这个分是在筛选后的池子里拿的,实际泛化能力还得再看。

AI HOT 精选

千问朱达聊C端Agent:执行快3倍、Token成本只要海外产品十分之一,但“情商”最难做

千问App今年1月上线了一个通用复杂任务Agent,藏在胶囊入口里。团队负责人朱达把工程思路总结成“多快好省”:能跑信息搜集、研究分析这类活;执行时间砍到了初版的三分之一;靠改进搜索方式和上下文管理把交付质量拉上来;Token消耗只有同类海外产品的十分之一。他们正在搭一套主动服务体系,包含用户记忆、环境、任务系统和助手四个组件,朱达说这里面最难的是让模...

推荐理由:千问团队把C端Agent的工程思路总结成“多快好省”,给了执行时间、Token成本这些具体数字,还拆了主动服务体系的四个组件。对做Agent落地的人有直接对标价值。因为是团队自述,没有外部验证,分数上我留了余地,但信息量和稀缺性都够上featured。

Latent Space

AIEWF 第三天:自动研究站上舞台,但讲者们对全自动泼了冷水

AI 工程师世界博览会第三天,主题是“自动研究”——让 AI 智能体自己维护和改进系统。Introspection 的 Roland Gavrilescu 把它描述成一个“外循环”,让智能体去研究和维护内循环。Anthropic 的 Thariq Shihipar 在 Claude Code 演讲里也呼应了持续发现的想法,说模型是“长出来的,不是开发出...

推荐理由:这是 AIEWF 现场的实况报道,引用了 Introspection 和 Anthropic 的一手发言,不是通稿。但本质是会议综述,不是产品发布,所以放在 featured 这一档刚好。

AI HOT 精选

蚂蚁阿宝在支付宝里开放公测,不用邀请码了

支付宝里的 AI 助手“阿宝”现在直接搜名字就能用,iOS 和安卓都行。右滑进入新版后是一个对话界面加资产页,你可以打字或说话让它办事,比如查公积金,它会自动找到对应的小程序入口,把原来要点好几步的流程缩成一句话。支付宝说所有转账和付款最后那一下还是得你自己确认,阿宝只负责跑流程、摆窗口。正文没提它背后用的是什么模型、接了多少服务,也没说以后会不会收费。

推荐理由:蚂蚁把 AI 助手“阿宝”直接放进支付宝公测,不用邀请码,iOS 和安卓都能搜到。它把原本需要跳转多个小程序的办事流程压成一句对话,比如查公积金,阿宝会自动调对应服务入口,最后付款那一下还是得用户自己确认。对从业者来说,这是 Agent 进超级 App 的一次实战,但正文没提背后模型、接入服务数量和未来是否收费,这些信息缺口让判断得先打个折。

AI HOT 精选

腾讯混元发布 Hy3 模型,参数量只有旗舰模型的 1/5 到 1/2,但效果能打平甚至超过

腾讯正式开源了 Hy3 模型,采用 Apache 2.0 协议。这个模型最狠的地方在于,它的参数量只有其他家旗舰模型的 1/5 到 1/2,但在推理、智能体(让模型进业务流程干活)和长文本任务上的跑分却能打平甚至超过。在内部 270 人的盲测里,Hy3 均分 2.67 分,赢了 GLM5.1 的 2.51 分。产品体验上修了几个硬伤:幻觉率从 12.5...

推荐理由:腾讯混元发Hy3,用更小参数量打平甚至超过更大模型,还直接Apache 2.0开源。我会先打个折,因为内部盲测和跑分不能完全代表真实场景,但参数量小、幻觉率降低、协议友好这三点组合在一起,对想省钱又想用强模型的团队来说,值得立刻关注。

AI HOT 精选

Emil Kowalski 把 UI 动画审美做成了 AI 编程工具的 Skill,让模型学会“什么该动、怎么动”

Emil Kowalski 发了三个给 Codex、Claude Code、Cursor 用的设计工程 Skill,把 UI 动画的硬规矩直接写进 AI 编码流程里。规矩很具体:高频操作(一天点上百次那种)不加动画;UI 动效控制在 300 毫秒以内;只动 transform 和 opacity 两个属性,别碰会触发重排的属性;元素进场统一从 scal...

推荐理由:Emil Kowalski 把 UI 动画的工程经验打包成 AI 可用的 Skill 文件,角度新、内容实,不是空谈审美。但受众局限在前端和设计工程的交叉人群,缺乏跨领域共鸣,刚好卡在 featured 门槛上。

Computing Life · Share · 鸭哥调研

Claude Science 不赌灵光一现,先当科研民工的算力搬运工

Anthropic 6 月 30 日发了桌面应用 Claude Science,没去碰“AI 科学家”那种提新假说的活,而是盯上了占科研人员 80% 时间的脏活累活。它能自动从 UniProt、PDB、Ensembl、ChEMBL 这些数据库拉数据、做清洗对齐,接着写 SLURM 脚本、配 conda 环境、把任务提交到超算集群,跑崩了还会自己读错误日...

推荐理由:Claude Science 是 Anthropic 刚发的桌面应用,文章没把它吹成能提新假说的“AI 科学家”,而是老老实实讲它怎么当科研流水线上的算力搬运工。这个定位抓得准,对从业者有参考价值。不过这是第三方分析,不是官方发布,信息密度够但权威性要打个折。

Computing Life · Share · 鸭哥调研

Fable 5 被禁 18 天,Anthropic 丢掉的份额被 GLM 吃掉了

Anthropic 发布最强编码模型 Fable 5 三天后,被美国出口管制强制下线 18 天。OpenRouter 的逐日 token 数据显示,这期间平台总流量从 24T 涨到 32T,但 Anthropic 的份额从 20.7% 跌到 17.6%,绝对流量也缩水了。最大的赢家是 GLM,份额从 1.8% 飙到 7.4%。一个诡异细节是,GLM-5...

推荐理由:这篇文章用 OpenRouter 的逐日 token 数据,给 Fable 5 被禁 18 天这件事做了个定量归因。Anthropic 丢了 3.1 个百分点的份额,GLM 吃进 6.7 个百分点,还附带一个反常识的细节:GLM-5.2 发布后,老版本 GLM-5.1 的流量反而暴涨了四五倍。结论有数据支撑,而且指向一个很多人没料到的赢家,对从业者判断模型替代关系和供应链稳定性有直接帮助。

7月1日星期三

TechCrunch · AI

Google 的桌面 AI 助手 Gemini Spark 现在能在 Mac 上用了

Google 把 Gemini Spark 带到了 Mac 上,这是一个能帮你整理文件、跨应用干活的 AI 助手,相当于让模型直接进你的电脑里操作。它能读取本地文件,比如把一堆发票自动转成预算表格。目前还是测试版,只对 Google One AI Premium 订阅用户开放。文章提到后续还会支持从手机远程指挥电脑干活,但具体什么时候上线没说。

推荐理由:我会先打个折:这不是新东西发布,而是 Gemini Spark 从预告到落地 Mac 的一步,所以重要性给 72 分,放在 featured 里刚好。亮点在于它把“让模型进电脑干活”这件事讲得比较实在,不是画饼,发票转表格这种例子让人一看就懂能省多少事。但限制也很明显——只对 Google One AI Premium 用户开放测试,正文没提免费开放时间,也没说 Windows 什么时候上,这点先别太激动。整体看,它给桌面 agent 的竞争加了把火,但还没到引爆的程度。

MIT Technology Review · AI

Anthropic 发布 Claude Science,专攻科研;加州牛粪碳补贴的账算不平

Anthropic 昨天在一场面向药企高管和生物技术创始人的活动上发布了 Claude Science。它跟 Claude Code 的工作方式类似,但把战场换到了科研领域:你给它几句简短指令,它能自己跑计算生物学和药物开发的任务。Anthropic 自己也会用它来研究罕见病药物。另外,美国解除了对 Anthropic 旗下 Mythos 和 Fabl...

推荐理由:Anthropic 发布了 Claude Science,把 Agent 的执行模式从编程扩展到了科研,直接向药企推销。这是 Claude 产品线一次有明确用例和内部验证的扩张。没给 90 分以上是因为目前只有发布消息,正文没披露具体性能数据或外部验证结果,实际效果还得等等看。

AI HOT 精选

美团 LongCat-2.0:1.6 万亿参数 MoE 模型,全程跑在国产芯片上

美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理只激活约 480 亿参数的混合专家模型。它从训练到上线全跑在 5 万张国产芯片上,喂了超过 35 万亿个 token,训练过程没翻车,没出现救不回来的 loss 飙升。干活能力上,编程和终端操作追平了 Gemini 3.1 Pro,通用任务跟 Claude Opus 4.6 打了个平...

推荐理由:美团LongCat-2.0是第一个公开的万亿级MoE模型,从训练到上线全用国产芯片,没出现训练崩溃。编程和agent任务追平Gemini 3.1 Pro,通用基准跟Claude Opus 4.6打平。5万张国产卡跑35万亿token不出事,这个稳定性信号比跑分更重要。我会先打个折:正文没披露推理成本和延迟,实际部署的经济账还不清楚,但光是国产算力上长出这个体量的模型,就值得放进featured。

AI 群聊日报

Claude Code 被曝内置中国用户检测,Fable 5 出口管制同日解除

Reddit 有人逆向发现,Claude Code 从 2.1.91 版开始会偷偷检查你的时区是不是北京时间或乌鲁木齐时间,还会看代理域名是否跟中国有关。检测结果不直接上传,而是把系统提示词里一个撇号的 Unicode 字符换成四种长得几乎一样的变体,用这种隐写方式标记用户类型。群里当天又有多人被封,有号商说 Anthropic 在集中清理阿里相关的账...

推荐理由:Reddit 逆向帖确认了 Claude Code 用 Unicode 隐写标记中国用户,同一天多个封号报告,信息密度和时效性都很高。我会先打个折,因为来源是群聊日报而非一手报道,且帖子里的技术细节还没被 Anthropic 官方回应或第三方复现,所以分数卡在 85 以下。

AI HOT 精选

AWS 成立新部门,砸 10 亿美元派工程师驻场帮客户把 AI 跑进业务流程

AWS 新设了一个部门,专门派工程师直接进驻客户公司,每次驻场 45 天,帮他们把 AI 智能体(能自主干活的 AI 应用)真正用在实际业务里。亚马逊先期投了 10 亿美元,计划把团队扩到几千人,但没公布具体人数。首批客户是 NBA 和理光。这种驻场模式 Palantir 已经干了十多年,Salesforce、Anthropic 和谷歌云也都有类似服务...

推荐理由:AWS 这个 10 亿美元驻场计划是企业 AI 落地“最后一公里”的实在动作,有真金白银、有明确模式、有首批客户名字。但正文没披露当前团队规模和扩招时间表,所以重要性停在 72 分 featured 档,没往上提。

Latent Space

Anthropic 发布 Claude Sonnet 5,但大家更关心 Fable 5 去哪了

Anthropic 今天推出了 Claude Sonnet 5,官方说这是他们最能干活的 Sonnet 模型,能自己做计划、用浏览器和终端,上下文窗口给到了 100 万 token。价格没涨,还是输入 3 美元/百万 token、输出 15 美元,8 月底前有促销价 2 美元/10 美元。但社区反应比较冷淡,因为跑分测试发现它消耗的 token 比之前...

推荐理由:Anthropic 发了 Sonnet 5,上下文 100 万 token,标价没涨,但社区实测发现分词器改了之后实际 token 消耗翻了好几倍,跑基准可能比 Fable 还贵。这事有新闻性,数字也够硬,加上用户对 Sonnet 系列有期待,所以 H、K、R 全中。我会先打个折:官方说没涨价,但实际用起来更烧钱,这点先别太激动。

AI HOT 精选

美团开源 LongCat-2.0:1.6 万亿参数,用五万张国产卡训练,月调用量已冲到 OpenRouter 全球前三

LongCat-2.0 是个总参数 1.6 万亿、每次推理只激活约 480 亿参数的大模型,原生支持 100 万 token 上下文。它全程在五万张国产 GPU 集群上训练和跑推理,架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分...

推荐理由:美团不是一线模型厂,突然掏出万亿参数模型,而且全程国产 GPU,这个反差是最大的新闻点。代码评测分数不低,但正文没披露更多推理成本和实际部署细节,所以我会先打个折。分数没给更高,是因为美团在模型圈还没建立起持续交付的信用,真实可用性要看开源后的社区反馈。

AI HOT 精选

库克与欧盟主管视频通话,想为 Siri AI 进欧洲找条路

苹果 CEO 库克和欧盟科技主管维尔库宁开了视频会,聊的是新版 Siri 怎么在欧洲上线又不违反《数字市场法》。新版 Siri 会变成能读用户个人数据的聊天机器人,但欧盟要求苹果把类似的设备数据权限也开放给竞争对手的语音助手,苹果不干。苹果提了个“可信系统代理”方案,相当于在用户数据和第三方 AI 之间加个中间层,但正文没披露这个代理具体怎么工作,而且...

推荐理由:苹果 CEO 和欧盟科技主管直接谈,说明新版 Siri 在欧洲能不能上已经上升到最高层博弈。文章把冲突点讲清楚了:Siri 想读数据,欧盟要公平开放,苹果提了个“可信系统代理”当中间层。但我会先打个折,因为正文没披露这个代理到底怎么工作,也没给时间表,关键细节是空的,所以重要性停在 72 分。

MIT Technology Review · AI

Anthropic 发布 Claude Science,把 AI 代理正式塞进实验室

Anthropic 把 Claude Science 定位成跟 Claude Code 同级别的旗舰产品,专门帮科学家写代码、在计算集群上跑实验,并且强调结果可复现。产品主要瞄准计算生物学和药物发现,现场演示了让它自主寻找苯丙酮尿症的药物候选分子。哈佛物理学家 Matthew Schwartz 之前评价 Opus 4.5 的研究能力相当于一个二年级博士...

推荐理由:Anthropic 发了个新旗舰产品,定位清晰,有现场演示,当天值得写。没给到 90 分以上是因为目前只有 MIT Tech Review 一篇报道,定价、开放时间、多源确认都还缺,我会先打个折。

TechCrunch · AI

Anthropic 发布 Claude Sonnet 5,主打用更低成本跑 AI 智能体

Anthropic 推出了中杯模型 Claude Sonnet 5,核心卖点是让模型自己规划步骤、调用浏览器和终端这类工具去干活,而且比之前的大杯模型便宜。公司说,这种能自主执行任务的智能体能力,几个月前还得靠更大更贵的模型才能跑。这直接对标了 OpenAI 上周预览的 GPT-5.6 Sol 和 Google 5 月发布的 Gemini 3.5 Fl...

推荐理由:Anthropic 发了个中杯模型 Sonnet 5,主打更便宜地跑智能体,直接对标了 OpenAI 和 Google 的同类产品。模型发布本身就是硬新闻,而智能体的运行成本是开发者最头疼的问题之一,所以重要性、知识性和相关性三个维度都踩中了。没给更高分是因为正文没披露具体价格和性能对比数据,实际省多少钱还得等实测。