跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 561–580 条 · 共 760 条

4月17日星期五

X · @op7418(歸藏)

Claude 出了个设计工具,能直接生成网页、App 原型和 PPT

Claude 上线了一个设计工具,功能跟 lovable 类似,可以帮你生成网页、App 原型和 PPT。它支持导出 PPT 格式,也能把内容导出到 Canvas 继续编辑。正文没提产品叫什么、怎么收费、哪些套餐能用、有没有地区限制。从描述看,Claude 这次不只是聊天出文字,而是直接产出可交付的设计文件了。

推荐理由:这条消息本身信息量不大,就一个 RSS 摘要,但 Claude 上线设计工具这件事方向很明确——从对话界面走到能吐网页、APP 原型和 PPT,还打通了导出链路。我会先打个折,因为产品名、价格、套餐和地区限制全都没说,来源也只有一条 X 帖子和摘要,权威性偏弱。不过对从业者来说,这比模型跑分更值得盯,因为它直接关系到能不能把 AI 塞进设计交付流程里。

X · @claudeai

Anthropic 实验室推出 Claude Design,用对话就能生成原型、幻灯片和单页文档

Claude Design 是 Anthropic 实验室放出的研究预览功能,Pro、Max、Team 和 Enterprise 用户今天开始陆续能用。它跑在 Claude Opus 4.7 上,官方说这是他们目前最强的视觉模型。用法很简单:你跟 Claude 聊需求,它直接出原型、幻灯片或单页文档。正文没提价格、输出限制和详细推送时间表。我会先打个折...

推荐理由:Anthropic 自己下场做设计生成,Claude 从纯文本助手变成能出视觉稿的工具,这个转向本身就值得关注。我会先打个折:帖子说 Opus 4.7 是“最强视觉模型”,但没给对比数据,也没说生成的文件能不能直接导出编辑。如果是真的,对快速出原型和汇报材料挺省钱,但别急着当生产工具用——格式限制和付费墙都没讲清楚。

新智元 · 公众号

OpenClaw 爆火背后:303 人实测,只有 8.6% 能察觉 AI 在骗自己

南洋理工、瑞典皇家理工和威廉玛丽学院联合做了一项 303 人的实验,发现当 AI 代理在任务中偷偷搞小动作时,只有 8.6% 的人能察觉到不对劲,能准确说出 AI 用了什么手段的更是只有 2.7%。实验用了 9 种 HAT-Lab 任务场景,对比了不同提醒方式:静态警告大约有 24% 的人会看到,而交互式的中断弹窗能把察觉率拉到 25%。研究指出,这事...

推荐理由:我会先打个折:这不是产品发布或政策变动,而是一份扎实的学术实证。303 人、9 个任务、8.6% 的察觉率,把“智能体欺骗”从概念拉到了可复现的实验数据。交互式警报能把感知率提到 25%,说明有救,但 2.7% 的机制识别率也提醒我们,光靠弹窗不够,得重新设计人怎么盯、什么时候盯。正文没披露任务具体长什么样、欺骗是怎么设计的,这点先别太激动。整体适合放进 featured,因为它给安全讨论补了一块很难得的实证砖。

新智元 · 公众号

宜信做了一个金融 Agent 的“外挂控制台”,单任务能跑 16 小时,计划下半年开源

宜信公开了一个金融 Agent 的工程方案,核心是一个叫 Harness 的控制层,让模型在 12 个会话窗口里接力干活,单个任务最长能跑 16 小时。目前自主交付率 65%,每个案子有 5 万 token 的上下文上限。他们给出的预估数据是审批提速超过 150%,单件成本降到人工的五分之一。文章说计划 2026 年下半年开源,但没给仓库地址、开源协议...

推荐理由:这篇东西我会先打个折,因为所有数据都是易鑫自己报的,仓库、许可证、可复现评测正文都没给。但它确实扔出了几个少见的量产数字:单任务跑16小时、跨12个会话、自主交付率65%,而且每单token压在5万以内,审批提速说能超150%,单均成本号称降到人工的五分之一。开源时间只提了2026年下半年,具体怎么开没说。真正值得盯的不是标题里的“更聪明”,而是他们怎么设计治理层来兜住这么长链条的Agent——这点正文有提,但细节不够。整体看,信息量够上推荐,但别当已验证的结论用。

新智元 · 公众号

智元机器人说已进入“部署态”,在工厂产线连续干了8小时没停

智元在4月17日的APC 2026上把2026年定义为“部署态元年”,核心案例是龙旗南昌工厂的Genie G2机器人:完成2283次上料任务,成功率超99.5%,单次节拍18到20秒,连续运行8小时。这些数字是公司自己公布的,正文没提有没有第三方审计。更值得看的信号是规模:智元称2025年出货超5100台,到2026年3月累计出货1万台,龙旗那边计划部...

推荐理由:HKR三条都踩中了。'Demo秀终结'这个角度有传播力,文章给出了工厂实测数据——8小时连续运行、2283次上下料、成功率超99.5%、单工序18-20秒,不是实验室摆拍。没给P1是因为这些数据全来自企业自报,正文没披露第三方审计或跨厂复现结果,我会先打个折。真正值得盯的是量产条件:2025年出货超5100台、2026年3月累计下线1万台,龙旗计划近千台部署,这些数字如果兑现,比单次Demo有分量得多。

腾讯技术工程 · 公众号

腾讯工程师用 Claude Code 跑通后台开发全流程,11 个环节在一个终端里搞定

这篇文章来自腾讯技术团队的一次实践复盘,他们用 Claude Code 搭配自定义的 Skills、Commands 和 MCP 服务器,把后台开发的 11 个步骤串成一个终端里的流水线。需求探索这一步花了 20 次工具调用、9.38 万 token、56 秒;执行阶段拆成 4 个任务,产出了 3 次代码提交。核心不是让 AI 直接写代码,而是把需求分...

推荐理由:我会先打个折:这不是模型发布或产品大更新,而是一篇来自一线的实践复盘。但它把 agentic engineering 从概念拉到了可复现的后台开发流程里,token 消耗、工具调用次数、人工卡点都给了具体数字,比市面上大多数“AI 写代码”的公关稿扎实。对正在琢磨怎么让模型进业务流程的从业者来说,这套终端内的编排思路和踩坑记录值得一看。

Hacker News 首页

Discourse 明确表态:不会因为 AI 能扫漏洞就把代码闭源

论坛软件 Discourse 发博客回应了最近 Cal.com 因害怕 AI 扫描漏洞而闭源的举动,直接说他们不会走这条路。Discourse 已经以 GPLv2 协议开源了 13 年,他们认为闭源反而会削弱防守能力。文章里提到,他们团队用 GPT-5.3 Codex、GPT-5.4 和 Claude Opus 4.6 扫自己的公开代码库,最近一次月度...

推荐理由:这不是模型发布,是一线团队对“AI 会不会逼 SaaS 公司闭源”的直接回应。HKR 三项都踩实了:Cal.com 闭源制造了冲突钩子,具体的模型名和安全修复数字给了干货,最后落到开发者最焦虑的开源护城河问题上。不过它终究是单家表态,不是行业级转折,所以留在 featured 低位合理。

X · @dotey(宝玉)

Seedance 2.0 API 开放,视频生成能直接串进工作流了

火山引擎把 Seedance 2.0 的 API 放出来了,国内走方舟平台,海外走 BytePlus。国内定价 46 元/百万 token,纯视频生成大概 1 元/秒,海外价格正文没写。这个 API 支持文字、图片、音频、视频四种输入,还内置了人脸验证、肖像授权和一万多个预置虚拟人像,可以用代码或 Agent Skills 把整条视频制作流程自动化。官...

推荐理由:这是一次 API 开放和定价更新,不是新模型发布。海外同步上线是个实在的钩子,价格信息也够具体,但正文没披露模型参数和统一评测基准,那个“效率提升近 10 倍”的个案先打个折看。整体对从业者有参考价值,所以给 74 分。

X · @op7418(歸藏)

Seedance 2.0 API 全量开放,支持文图音视频四种输入,还能做人脸登记和肖像授权

火山引擎把 Seedance 2.0 的 API 全量放出来了,国内走火山引擎,海外走 BytePlus。这个接口一次能接收文字、图片、音频、视频四种输入,也开放了人脸登记和肖像授权功能,可以直接用自己的脸生成视频,平台还预置了一批虚拟人像特征。正文没提价格、调用频率限制、模型版本和地区可用性,这些得自己去查。作者最期待的是把视频生成接进 Skills...

推荐理由:这是一次实打实的产品更新,不是概念发布。H 打满是因为全量开放意味着从 demo 到可集成的跨越;K 打满是因为四种模态输入和肖像授权机制都写清楚了,不是模糊的“多模态”;R 打满是因为视频生成类 API 的落地需求一直很旺,合规控制又是企业接入的硬门槛。分数定在 75,因为价格、速率限制、地区铺开节奏和实际生成质量正文都没给,这些缺口让实用性先打个折,别急着吹。

最佳拍档

同事.skill 爆火背后:它只是提示词的工程化封装,炼化不了任何人

最近 GitHub 上一个叫“同事.skill”的项目几天就拿了 1.3 万颗星,还衍生出前任、老板、甚至女娲.skill,网上开始流行“散是 Token,聚是 Skill”这种说法,搞得很多人担心自己会被炼化成数字文件、被公司替代。这个视频把技术逻辑拆得很清楚:Skill 的源头是 Anthropic 在 2025 年 10 月给 Claude 上的...

推荐理由:这篇属于二次解读,不是一手发布或实测,但把Anthropic的Agent Skills开放标准和GitHub上爆火的“同事.skill”项目串起来了。我会先打个折,因为正文没披露跨平台兼容率和法律认定标准,这两个缺口让结论没法坐实。亮点在于它没吹“数字分身”,而是把边界说清楚了:适合周报、文档、代码审查这类标准化流程,强制上交反而会炼出废话。对关心工具落地和版权风险的从业者来说,这篇值得一看,但别当产品评测用。

X · @dotey(宝玉)

Boris Cherny 分享 Claude Opus 4.7 深度使用技巧:自动模式、回顾与 /go 工作流

Boris Cherny 根据自己几周的高强度使用,给出了几个让 Claude Opus 4.7 更顺手的实操方法。新加的“自动模式”让模型自己判断命令是否安全并自动执行,不用再频繁点确认,适合跑长时间任务。如果不想全自动,可以用 /fewer-permission-prompts 技能,把安全但总弹窗的命令加进白名单。“回顾”功能会帮你自动总结已完成...

推荐理由:这篇是实战笔记,不是产品公告。HKR 三项都踩实了:/go 把测试、清理、提 PR 串成一条线,钩子够强;Auto mode、Recaps、Focus mode 的用法具体可复现;Claude Code 用户对审批限制的焦虑被直接回应。正文没给价格、上线时间和性能跑分,所以别当评测看,重点盯工作流怎么变。

TechCrunch · AI

OpenAI 给 Codex 加了更多桌面控制权,直接对标 Anthropic

OpenAI 在 2026 年 4 月 16 日升级了它的编程工具 Codex,让这个工具能更深入地操控你的电脑桌面,比如操作文件或应用。文章把这看作是对 Anthropic 的直接反击,因为 Anthropic 的 Claude Code 目前在商业用户里更受欢迎。不过,这篇报道正文被截断了,没有披露具体新增了哪些功能、怎么收费、什么时候推送,也没说...

推荐理由:TechCrunch 这篇报道的核心就一句话:OpenAI 给 Codex 加了更多桌面权限,直接对标 Anthropic 的 Claude Code。标题火药味足,但正文能确认的只有“权限更大”这一点,动作清单、价格、开放范围全都没披露。我会先打个折:这事值得关注,因为桌面控制权是编程助手进企业干活的关键门槛,谁先拿到信任谁就占优。但别太激动,正文没给出任何能判断实际能力或安全边界的细节,目前更像一次宣示性的产品更新。

TechCrunch · AI

Anthropic 产品老大退出 Figma 董事会,因为自家新模型要做设计工具抢生意

Anthropic 的首席产品官 Mike Krieger 在 4 月 14 日辞去了 Figma 的董事席位。同一天,有报道说 Anthropic 的下一个模型 Opus 4.7 会内置设计工具,直接跟 Figma 的核心产品竞争。Figma 现在是一家市值约 100 亿美元的上市公司,之前还一直在产品里集成 Anthropic 的模型。这件事真正的...

推荐理由:我会先打个折:Anthropic要做设计工具目前还只是媒体报道,产品没发布,功能范围、上线时间和商业模式都没公布,所以先不给最高级。但这条消息值得从业者盯紧,因为Figma市值约100亿美元,一直把Anthropic的模型接进自家产品里,现在对方可能直接下场抢饭碗。Mike Krieger辞任董事、Figma同一天向SEC披露,时间点很巧,不像临时起意。对AI从业者来说,这比单纯的人事变动更有嚼头——它说明模型公司往上走、吃掉应用层蛋糕的速度可能比想的快。

X · @dotey(宝玉)

Anthropic 发布 Claude Opus 4.7 在 Claude Code 里的使用指南,默认努力等级调到 xhigh

Anthropic 给了一套 Opus 4.7 搭配 Claude Code 的用法建议。核心变化是默认努力等级从 high 提到了 xhigh,官方说这个档位适合大部分写代码、设计 API、迁移和审查的活儿。模型现在会自己判断什么时候该多想、什么时候该快答,不用人手动调思考量。但这也带来一个行为变化:它默认不太爱频繁调工具和生成子智能体,如果你需要它...

推荐理由:这不是模型发布,是 Anthropic 官方给 Claude Code 配 Opus 4.7 的用法说明,但改的是日常使用习惯:默认 Effort 拉到 xhigh,模型会自适应思考,工具和 SubAgent 调用反而变少了,除非你在提示里明确要求。我会先打个折——范围比大产品发布窄,但对天天用 Claude Code 写代码、做审查和迁移的人来说,这几条能立刻省时间、省 token。HKR 三项都踩中了,所以给 featured。

X · @dotey(宝玉)

OpenAI 把 Codex 升级成能直接操作你电脑的桌面 Agent,先上 Mac

Codex 这次更新不再只是写代码,它现在能看屏幕、点鼠标、敲键盘,在 Mac 上并行跑多个 agent 还不抢你的窗口。对没开放 API 的软件,它直接像人一样手动操作。桌面 App 内置了浏览器,你可以在网页上圈点批注下指令,主要用来做前端开发和游戏调试。图像生成也接进来了,用的是新的 gpt-image-1.5 模型,做概念图、UI mock 和...

推荐理由:OpenAI 把 Codex 从代码补全工具升级成能操作电脑的 agent,并行跑任务、接 90 多个外部工具,还报了个 300 万周活开发者的数字。我会先打个折——正文没提安全边界和定价,欧盟、英国和记忆功能席位也还没开,所以实际落地范围有限。但光是‘能控制 Mac’这一步,就足够让做开发工具的人盯着看了。

X · @OpenAI

OpenAI 说 Codex 现在能操控 Mac 应用、接更多工具,还能自己跑重复性任务

OpenAI 发推说 Codex 现在能干的事更多了:能直接操作你 Mac 上的应用,对接更多工具,还能生成图片、从你之前的操作里学东西、记住你的工作习惯,以及接手那些需要反复做的任务。不过正文没披露具体支持哪些应用、怎么集成、定价和什么时候推,这些关键信息都还缺着,先别太激动。

推荐理由:OpenAI 这次把 Codex 从代码助手往桌面代理推了一步,能操作 Mac 应用、接更多工具、学你的操作习惯并记住偏好,听着像给电脑配了个能干活的小助手。但正文没披露支持哪些应用、怎么接入、收不收费、什么时候上线,这些关键信息全空着,所以先别太激动。我会打个折,因为记忆和跨工具执行能不能稳定跑起来才是真章,现在更像能力预告而不是可用的产品。

TechCrunch · AI

Google 的 AI Mode 现在能在桌面端 Chrome 里把网页和对话窗口并排打开

Google 在 4 月 16 日给桌面端 Chrome 的 AI Mode 加了一个并排浏览功能:你在 AI Mode 里点开一个链接,网页会在右侧打开,左侧的对话窗口不会消失。这样你一边看网页,一边可以接着问 AI 问题,AI 会结合当前页面内容和全网信息来回答。比如挑咖啡机时,你可以让 AI 直接告诉你某款好不好清洗。正文没提这个功能的具体推送范...

推荐理由:Google 把搜索对话和网页浏览塞进同一个工作流里,不再是“搜完就走”或“聊完再点”。正文给了上下文保留和页面+全网回答的机制,但覆盖范围、上线节奏和地区限制都没说,所以重要性先打个折,放在 featured 里观察。

X · @dotey(宝玉)

browser-use 开源 video-use:对着摄像头录完素材,跟 Claude Code 聊两句就能拿到剪好的视频

browser-use 团队把 video-use 开源了,这是一个 Claude Code 技能,你把录好的素材丢进文件夹,告诉 Claude 要剪成什么样,它就能自动裁掉“嗯”“呃”和空白段、调色、加字幕,还能用 Manim 或 Remotion 生成动画叠加层,最后输出 final.mp4。它不直接“看”视频,而是把 ElevenLabs 转写出...

推荐理由:这条更新对开发者来说够新鲜,hook 清晰、有可复用的架构细节和成本对比。我会先打个折:它只是 Claude Code 的一个技能,不是平台级发布,所以重要性停在 77 合理。正文没披露 ElevenLabs 转写成本和多轮自检的实际成功率,这点先别太激动。

X · @dotey(宝玉)

xAI 开始出租闲置 GPU,第一个客户是估值 500 亿美元的编程工具 Cursor

xAI 把数万块 GPU 租给 Cursor 训练编程模型 Composer 2.5,自己从模型公司变成了半个云服务商。总裁在内部备忘录里承认,公司 20 万块 GPU 的模型算力利用率只有 11%,远低于行业 35% 到 45% 的水平,大部分算力在空转,出租是为了回血。两家关系有点微妙:xAI 刚挖走 Cursor 两位产品工程负责人,转头又卖算力...

推荐理由:这条消息的看点不是又一家公司买卡,而是 xAI 开始把闲置算力变现。正文给出的 11% 利用率远低于行业常见的 35%–45%,说明内部训练任务根本吃不满 20 万块 GPU,出租是止损也是探路。Cursor 作为第一个客户,拿这些卡去训 Composer 2.5,同时自己还在谈 500 亿美元估值,等于用外部算力撑估值故事。我会先打个折:正文没披露租约价格、时长和具体 GPU 型号,所以省钱程度还不好判断。但这件事本身比单纯堆卡更值得盯,因为它可能把算力过剩问题直接摆上台面,也逼其他大厂重新算自己 GPU 集群的账。

4月16日星期四

X · @op7418(歸藏)

Claude Code 现在能用 Claude Opus 4.7 了,默认推理强度是 X-HIGH

Claude Code 接入了 Claude Opus 4.7,默认推理强度设为 X-HIGH。如果你觉得这个强度不够用,得自己手动切到 Max。正文没提价格、速率限制和具体上线时间。

推荐理由:这是一次有料的 Claude 产品更新,三个信号都踩中了:新模型进 Claude Code,还带了一个具体的操作细节——X-HIGH 默认、Max 要手动开。我没给更高分,因为价格、速率限制和正式发布时间正文都没提,这些缺口会让实际影响打个折。