跳到正文

#MCP/工具调用

今日 5 条

5月16日星期六

AI HOT 精选

Codex 现在能遥控多台电脑,ChatGPT 里切项目就能换设备

Codex 通过 ChatGPT 不仅能连一台电脑,还能直接控制另一台,多设备管理不用来回切换客户端,在 ChatGPT 里换个项目就能拿到对应设备的上下文和文件。推文里还提到支持远程 SSH 去设置其他虚拟机,多机协作的灵活度上了一个台阶。不过正文没披露延迟表现和权限隔离细节,实际用起来稳不稳还得看后续反馈。

推荐理由:这条更新让 Codex 从“陪你聊代码”往“替你上手操作”迈了一步,多设备远程控制和项目级上下文切换是实打实的机制,不是概念包装。我会先打个折:目前只有一条 X 上的简短预告,没有官方发布页、定价、权限模型,也没有可复现的演示,信息密度偏薄。所以重要性给到 76、放在 featured 里是合适的——有料,但别急着当成熟产品看。

AI HOT 精选

OpenAI 在 IPO 前夜大洗牌:Brockman 接管所有产品,三大业务线合并,全力押注一个能自己干活儿的桌面超级应用

OpenAI 把 ChatGPT、Codex 和 API 三个原本各自为战的团队合并成一个产品组织,由总裁 Greg Brockman 正式接管产品战略。ChatGPT 原负责人 Nick Turley 被调去管企业业务,消费者端换上了前 Instagram 副总裁。这次重组的目标是集中力量搞一个代号“Super App”的桌面应用,把聊天、写代码和还...

推荐理由:HKR 三项都成立:这是 OpenAI 顶层产品重组,覆盖 ChatGPT、Codex 和 API。正文只有一条摘要,信息量不算深,但属于当天必须写的新闻。Anthropic 估值 9000 亿美元这个数字正文没给出处,我会先打个折,不把它当核心事实用。

量子位 · 公众号

Codex 接上 HeyGen 插件,用自然语言就能生成和剪辑数字人视频

OpenAI 的 Codex 现在能直接调用 HeyGen 插件,你给它一段文字指令,它就能生成带数字人、字幕的视频,还能做剪辑。文章里测了一个大概一分钟的数字人视频,试了把 10 秒后的内容剪掉,以及删掉第 8 秒的一次眨眼动作。正文没披露生成延迟和具体成本,也没说剪辑精度到底有多高,所以“不用开剪辑软件”这个说法先打个折看。

推荐理由:我会先打个折:这只是 Codex 接了一个 HeyGen 插件,不是模型或平台级发布,所以分数卡在 74 这个 featured 区间。文章好处是给了三个带时间点的实测,不是纯吹牛,能看出它能干什么、干得怎么样。正文没披露生成延迟和失败率,这点先别太激动。整体对做 agent 和工具链的人有参考价值,但范围就一个插件工作流,别当成视频剪辑要被颠覆了。

Computing Life · Share · 鸭哥调研

OpenAI 通过 Plaid 让 ChatGPT 能读你的银行流水了

ChatGPT 在美国向 Pro 用户开放了个人理财功能预览,通过 Plaid 连接银行账户后,能读取余额、交易记录和投资持仓,回答消费和储蓄问题。文章指出,OpenAI 的隐私承诺存在两个关键缺口:理财对话未被列入广告敏感话题排除清单,意味着消费和贷款讨论可以触发广告匹配;财务数据的模型训练默认是 opt-in,用户需主动关闭。作者认为,这个功能的主...

推荐理由:我会先打个折:正文只说了 OpenAI 通过 Plaid 让 ChatGPT 连接银行账户,没披露上线时间、授权流程和可访问的数据范围,所以这更像一个信号而不是一个可评估的产品更新。但信号本身够强——让模型直接碰银行数据,权限和安全的坑一个都不少,从业者看到标题就会想点进去看细节。HKR 三项都踩中了,只是信息缺口把分数压在 featured 档,没往上走。

AI HOT 精选

OpenClaw 团队跑着 100 个 AI 实例干活,完全不看 token 账单

OpenClaw 项目组把 AI 用量拉满,常驻约 100 个 Codex 实例,把代码审查、安全扫描、issue 去重归类、测试环境复现并录屏验证、从会议里自动建任务、垃圾评论过滤和性能回退监控全交给它们跑。他们用 clawpatch.ai 把项目拆成功能单元做审查,还接了 Vercel DeepSec 做安全分析。正文没披露具体花了多少钱,但明确说...

推荐理由:我会先打个折:这只是一条X上的分享,没有披露成本、效果指标或可复现的搭建方式,所以别当成熟方案看。但它的钩子很准——用约100个Codex实例同时干代码审查、安全分析、议题去重、测试复现、任务创建、垃圾过滤和性能回归监控这七件事,还明说“无视令牌成本”,对正在琢磨AI agent怎么落地的从业者来说,是个有参考价值的实操片段。H、K、R都成立,放在featured里偏低的位置刚好。

The Verge · AI

OpenAI 想让 ChatGPT 直接读你的银行流水

OpenAI 预告了一个新功能,让 ChatGPT 通过 Plaid 连接用户的银行账户,Plaid 在美国对接了 1.2 万家金融机构。OpenAI 说每月有超过 2 亿人用 ChatGPT 问财务问题,但正文没披露这个功能什么时候正式上线。我会先打个折:连上之后,ChatGPT 就能看到你的信用卡欠款和消费明细,隐私风险不小,官方目前也没说清楚数据...

推荐理由:OpenAI 让 ChatGPT 通过 Plaid 直接读银行数据,不是只聊聊天了。1.2 万家机构接入意味着覆盖面很广,2 亿月活用户问金融问题说明需求确实大。但正文没给上线时间,也没说清楚读到的账户数据会不会被模型记住或用于训练,这点先别太激动。金融场景出错成本高,责任怎么划现在还看不到。

TechCrunch · AI

OpenAI 推出个人理财版 ChatGPT,能直接连你的银行账户看资产和开销

用户绑定银行账户后,可以在一个面板里看到投资组合表现、日常支出、订阅服务和待付账单。正文没披露支持哪些银行、在哪些地区上线、是否额外收费,也没说明账户安全怎么保障。

推荐理由:H 分高是因为 ChatGPT 从聊天工具跨到个人理财,动作够大;K 有实打实的功能点,不是概念稿;R 则把隐私和金融竞争风险摆上台面。正文没写支持哪些银行、在哪些地区上线、收不收费,这些缺口让判断只能停在低 P1 档,我会先打个折,等更多细节再调整。

5月15日星期五

AI HOT 精选

X 把“为你推荐”的算法开源了,用的还是 Grok 同款 Transformer

X 在 GitHub 上公开了“For You”信息流的推荐管道,代码、预训练模型和内容理解服务都给了。核心是一套叫 Phoenix 的 Transformer 模型,基于 Grok 架构,负责给候选帖子打分。它会看用户最近跟谁互动,同时预测点赞、回复、转发这些行为的概率,揉成一个相关性分数。排序前会先捞候选内容,补上上下文,再让模型评分,最后做多样性...

推荐理由:HKR 三项都踩中了,但正文只说了开源和 Phoenix Transformer 打分机制,仓库细节、许可证、能不能复现都没提,所以先给 featured 里偏低的位子。

AI HOT 精选

飞书命令行工具 lark-cli 45 天 GitHub 破万星,AI 操作每一步都能预览和审查

飞书开源了一个叫 lark-cli 的命令行工具,45 天在 GitHub 上拿到超过一万颗星,是国内办公套件里第一个破万星的开源项目。这个工具让 AI 能直接在命令行里建群、建文档,而且每一步操作都会先展示出来让你确认,不是那种在云端黑盒执行的 MCP 模式。主干代码已经合并了 10 位外部开发者的贡献,对比钉钉和企业微信同类项目的外部贡献是零。这种...

推荐理由:我会先打个折:信息只来自一篇社交帖子,没披露实际使用量、贡献者数量或企业采纳数据,所以放在 featured 偏低的位置。但 45 天万星这个速度本身说明开发者对“AI 操作可见可控”这个方向有需求,工具形态是命令行,意味着可以嵌进自动化流程,这点比纯界面演示更实在。正文没提和钉钉同类能力的对比,也没说后续维护计划,先当一次开源动作看。

r/LocalLLaMA

网友用百万级 token 实测 Qwen 3.6 35B MTP 版,速度比之前快了约一半

一位 Reddit 用户分三次跑了超过一百万 token 来测 Qwen3.6-35B-A3B 的多 token 预测(MTP)版本,上下文拉到 300k,量化用 KV Q8_0。他给出的结论是生成速度大概比之前测过的版本快了 1.5 倍。不过帖子正文被 Reddit 的安全策略挡了,看不到具体测试环境、硬件配置和任务类型,所以这个提速是在什么条件下跑...

推荐理由:一个 Reddit 用户拿 Qwen3.6-35B-A3B MTP 版跑了三轮百万 token 的测试,在 300k 上下文、KV Q8_0 量化下,速度大概是旧测试的 1.5 倍。这个多 token 预测版(一次预测多个 token)确实在本地跑出了可感知的加速,但正文没披露功耗、显存占用和不同量化级别的对比,所以这个 1.5 倍先别太激动,得看自己硬件上复现怎么样。帖子本身有细节、有实测,对想省钱跑长上下文的开发者有参考价值,但毕竟只是单篇个人测试,重要性我给 74。

机器之心 · 公众号

亚马逊员工为了凑 AI 用量 KPI,开始刷 token 了

亚马逊内部要求超过 80% 的开发者每周必须用 AI 工具,还搞了个 token 消耗排行榜。员工为了达标,直接用内部 MeshClaw agent 刷量。目前这些统计数据只有员工本人和直属上级能看到,正文没披露具体刷了多少、有没有处罚措施。

推荐理由:这事不是产品发布或技术突破,但把大厂内部怎么把 AI 工具用量做成 KPI、员工怎么应付,讲得很具体。我会先打个折:正文没披露刷量规模有多大、是否影响业务指标,所以冲击力还到不了头条级别。但“超 80% 开发者每周必须用 AI 工具”和“Token 消耗榜”这两个细节,足够让同行会心一笑,也反映出 AI 落地时管理动作跑偏的典型问题,放在 featured 合适。

新智元 · 公众号

谷歌把 Gemini 塞进鼠标指针,指哪就能让 AI 干活,连提示词都不用写

谷歌 DeepMind 放出了一个叫“AI 指针”的实验项目,核心是把 Gemini 模型直接挂在鼠标指针上。你在屏幕上指一个区域,AI 就能理解上下文并执行操作,比如修图或在地图上找地点。目前有两个 Demo 在 Google AI Studio 里能玩:一个是图片编辑,另一个是地图地点查找。文章还提到 Chrome 的指针选中功能和“Googleb...

推荐理由:我会先打个折:目前只是 Demo 级别,正文没披露延迟、成功率或 API 细节,所以分数停在 78 而不是更高。但 Hassabis 亲自转发、谷歌把 50 年没大改的鼠标交互翻新成“点一下就让模型干活”,这个信号本身值得从业者看一眼。两个 Demo 都放在 AI Studio 里,说明谷歌在试探把 Gemini 塞进更轻量的操作入口,而不是只堆聊天框。这点先别太激动,但如果后续有性能数据和开放接口,分量会明显上去。

AI HOT 精选

ChatGPT 给美国 Pro 用户开了个个人理财功能,能连银行账户看账单、做分析

OpenAI 在 5 月 15 日给美国 ChatGPT Pro 用户上线了一个个人理财功能的预览版。你可以通过 Plaid 绑定超过 12000 家金融机构的账户,之后 ChatGPT 会同步并归类你的交易数据,生成一个涵盖投资组合、支出、订阅和待付账单的仪表盘。它还能结合你告诉它的目标、生活习惯和优先级,帮你分析消费模式、做场景推演或规划买房这类大...

推荐理由:OpenAI 在美国给 Pro 用户开了个人理财预览版,用户授权后 ChatGPT 能直接读账户数据做分析。这事我会先打个折——正文没披露合作方是谁、数据怎么存、收费模式也没说,所以实际落地深度还不清楚。但方向很明确:ChatGPT 从聊天往管钱走了一步,一旦涉及真实账户,用户对隐私和出错后果的容忍度会低很多。重要性给 76,因为目前只是 Pro 预览,规模有限,但信号够强。

AI HOT 精选

Claude API 提示预缓存:先预热系统提示,再让真实请求直接命中缓存,首 token 生成更快

一个减少长提示首 token 延迟的实用技巧。在用户请求到达前,先单独发一次系统提示给 Claude,让它把提示写进缓存,但跳过输出。等真实请求进来时,缓存已经热好,直接命中,省掉重复处理长提示的时间。正文没披露具体提速多少,但思路很直接,适合系统提示固定、用户提示多变的场景。

推荐理由:Claude API 搞了个提示预缓存,相当于提前把系统提示塞进缓存里热着,真实请求一来就能省掉首令牌的等待。正文没给出具体能省多少毫秒,也没说缓存能热多久、会不会额外计费,所以省钱效果先打个折看。整体是个实用的推理优化小更新,不是模型能力或大版本发布,放在 featured 里当个中等权重的消息刚好。

AI HOT 精选

Claude Code 更新 v2.1.142:后台会话可配置,快速模式默认切到 Opus 4.7

Anthropic 给 Claude Code 命令行工具发了 v2.1.142 版本。这次主要干了两件事:一是新增了 8 个命令行参数,用来控制后台会话的行为,比如可以指定会话闲置多久自动关掉、最多同时跑几个后台任务;二是把 Fast 模式的默认模型从之前的版本升级到了 Opus 4.7,意味着快速模式下模型的理解和生成能力会更强。另外修了 15 个...

推荐理由:这次更新对 Claude Code 用户来说挺实在:Fast 模式默认用 Opus 4.7,省去手动切换的步骤;8 个后台会话标志让配置更细,15 个以上的修复也说明稳定性在补。我会先打个折,毕竟是个小版本号,但改动直接落在编码流程上,对 Anthropic 工具链用户有实际影响,放在 featured 档合理。

AI HOT 精选

Codex 现在能挂脚本、发令牌,把代码助手塞进自动化流程里

OpenAI 给 Codex 加了两样东西:一是“钩子”,可以在任务的关键节点跑自定义脚本,比如提交前自动验代码、扫密钥、记日志,或者按仓库做定制行为;二是面向商业和企业版的“程序化访问令牌”,从 ChatGPT 工作区设置里就能创建,带权限范围、可设过期或撤销,方便接入 CI/CD、发布流水线和内部自动化,使用记录也会归到对应工作区。正文没提这些令牌...

推荐理由:Codex 这次更新是把自动化从对话界面往工程流程里塞:钩子能在任务检查点跑脚本,程序化令牌给商业和企业团队接 CI/CD、发布和内部自动化用。我会先打个折——正文没披露权限粒度、令牌怎么计费、钩子执行失败怎么回滚,这些缺口让实际落地成本还看不清。但方向很明确,就是让模型进开发管线干活,不是只聊天。

The Verge · AI

OpenAI 把桌面端写代码工具 Codex 塞进了 ChatGPT 手机 App

OpenAI 宣布 Codex 会集成到 ChatGPT 的手机 App 里。Codex 原本是桌面端工具,能写代码、操控你电脑上的其他应用,现在在手机上也能用了。这次更新是冲着 Anthropic 的 Claude Code 去的,OpenAI 为了追赶砍掉了 Sora 视频生成等“支线项目”,集中精力做企业生意和桌面“超级应用”。不过正文没提手机端...

推荐理由:OpenAI 把 Codex 塞进了 ChatGPT 手机 App,算一次中等体量的产品更新。我会先打个折:正文只说了能写代码、能操控电脑应用,但上线时间、价格、支持哪些应用全都没提,这点先别太激动。HKR 三项都过——手机端 coding agent 的钩子够直接,操作应用的声称是新的具体信息,也戳中了开发者日常和同类产品抢分发入口的神经。信息缺口明显,所以重要性停在 featured 地板,不往上拔。

TechCrunch · AI

OpenAI 正考虑起诉苹果,因为 ChatGPT 集成没带来预期用户和曝光

OpenAI 对苹果很不满,原因是把 ChatGPT 集成进苹果设备后,拉来的订阅用户和产品曝光都远没达到预期。TechCrunch 的报道说 OpenAI 已经在认真考虑起诉苹果,但正文没披露具体法律主张、起诉时间、合同条款、订阅目标,也没提苹果那边的回应。这不是 OpenAI 第一次跟合作伙伴闹翻,之前也有合作方觉得自己被坑了。

推荐理由:我会先打个折:正文没披露 OpenAI 具体要告什么、什么时候告、合同里怎么写的,所以现在只能当信号看。已知的是,ChatGPT 集成到苹果设备后,OpenAI 觉得订阅用户没涨起来,展示位置也不够理想,这让他们很不爽。OpenAI 之前跟别的合作伙伴也闹过不愉快,这次如果真起诉,说明他们不再忍平台的分发规则了。对从业者来说,这事提醒你:把自己的模型塞进别人生态里,流量可能没想象中那么美,合同里的曝光承诺和分成条款才是命门。

The Verge · AI

微软开始收回内部 Claude Code 授权,把开发者往自家 Copilot CLI 赶

微软去年 12 月给内部几千名开发者开放了 Claude Code,让项目经理、设计师这些非技术岗也能试着写代码,半年下来用的人非常多。现在微软准备收回大部分授权,把这些人推到 Copilot CLI 上。正文没披露具体收回多少授权、定价和迁移时间表,也没说 Copilot CLI 功能上能不能补上 Claude Code 的缺口。

推荐理由:微软把去年底才发给内部几千名开发者的 Claude Code 许可证收回去,把人往 Copilot CLI 赶。这事本身不复杂,但信号很清楚:在自家地盘上不想给 Anthropic 留入口。正文没披露具体有多少许可证被取消、Copilot CLI 功能是否能完全替代 Claude Code,所以实际影响还得看后续。我会先打个折,不把它当成 Copilot 已经赢了,但企业采购和开发者工具选型的人会盯着这条。

AI HOT 精选

Anthropic 发了份 AI 创业手册,把从想法到扩张拆成四步,每步都配了 Claude 的实操练习

Anthropic 这篇博客给 AI 原生创业画了一张路线图,分四个阶段:想点子、做最小可行产品、发布、扩张。每个阶段都给了目标、退出标准、常见翻车点,还附了用 Claude 做验证、客户调研、控制技术债、检查产品市场匹配和自动化工作流的提示词。文章没给具体案例数据,更像一套可以直接抄作业的框架。

推荐理由:我会先打个折:这不是模型或产品发布,是 Anthropic 出的创业操作手册。但内容挺实在,把从点子到规模化拆成四个阶段,每个阶段都告诉你目标是什么、什么时候该停、容易栽在哪、怎么用 Claude 练手。对正在用 AI 搭产品的团队来说,退出标准和失败模式比鸡汤有用。正文没披露手册本身是否收费或后续会不会更新,这点先别太激动。

AI HOT 精选

Claude Code 怎么啃下百万行老代码库:五个扩展点与上手顺序

Anthropic 这篇博客讲了 Claude Code 在百万行单体仓库、遗留系统和分布式架构里的实际用法。核心思路不是靠模型硬记,而是靠五个扩展点把项目知识喂给模型:CLAUDE.md 文件写项目规则、hooks 在操作前后自动检查、skills 封装可复用指令、plugins 接外部工具、MCP 服务器做本地代码库的智能搜索。文章给了从零开始的三...

推荐理由:我会先打个折:这不是新模型或重大能力发布,就是一份官方出的 Claude Code 大型代码库使用指南。但它把怎么在遗留系统里让 AI 干活这件事讲得很实在,五个扩展点(CLAUDE.md、钩子、技能、插件、MCP 服务器)都是开发团队能立刻动手配的。正文没给具体性能数据,但思路对上了开发者对老代码库的掌控焦虑,所以放在 72–77 这个区间。

AI HOT 精选

OpenEvidence 覆盖 65% 美国医生,靠医生自己拿执照号注册,医院一开始不知道

OpenEvidence 说它已经覆盖了 65% 的美国医生,4 月临床场景用了 2700 万次,平均每个医生一个月用 41 次。医生是自己在手机上用执业编号注册的,医院起初并不知情,Mount Sinai 的 AI 负责人管这叫“影子 AI”,意思是基层医生自己先大规模用起来了,医院后来才追着签企业合作。OpenEvidence 把这说成是美国医疗史...

推荐理由:我会先打个折,因为正文没披露收入模型、责任划分和效果验证,这些缺口让分数没法再往上走。但 65% 医生覆盖和 2700 万次月使用量是实打实的规模数据,加上医院不知情的影子 AI 叙事,对从业者来说既有冲击力又有警示意义,所以保持在 82 分是合理的。

AI HOT 精选

Genkit 加了个中间件系统,让智能体应用更可控、更扛造

Google 的开源框架 Genkit 现在支持中间件了,可以在模型生成、调用工具、以及整个工具循环这三个层面插入自定义逻辑。比如模型 API 挂了自动重试或切备用方案、执行敏感操作前先让人审批、或者给每一步加上日志方便排查问题。这套机制已经在 TypeScript、Go 和 Dart 里可用,Python 版也快了。

推荐理由:Genkit 这次更新不是小修小补,而是给智能体应用加了三个可插拔的拦截点:生成调用、模型本身、工具调用。你可以把它理解成给 agent 流程装了三个阀门,想在哪里加校验、加日志、改行为都行。语言支持也铺得比较全,TS、Go、Dart、Python 都给了。正文没披露性能开销和具体延迟数据,这点先别太激动。整体看,对正在用 Genkit 搭 agent 的团队是个实用升级,但影响范围还局限在 Genkit 生态内,所以放在 featured 而不是必读。

r/LocalLLaMA

inclusionAI 在 Hugging Face 上放出了 Ring-2.6-1T,一个 1 万亿参数、支持多档推理强度的模型

Ring-2.6-1T 是 inclusionAI 发布的一个 1 万亿参数推理模型,主打让模型进业务流程干活(agent workflow)和长链条任务。它提供 high 和 xhigh 两档推理强度,训练时用了异步强化学习加 IcePop 算法来稳住训练过程。不过 Reddit 原帖被网络屏蔽,正文没披露更多技术细节、实际跑分或硬件需求,这点先别太激动。

推荐理由:我会先打个折:正文没给任何跑分、没提许可证、也没说推理到底要多少卡,所以只能算个信号,不能当结论。1T 参数加上两档推理强度,说明 inclusionAI 在试着让大模型按需出力——开低档省资源,开高档拼质量。Async RL 和 IcePop 这两个训练名是新的,但没解释具体怎么训、省了多少成本,这点先别太激动。整体看,消息本身有料,但缺验证,暂时放在 featured 的下沿比较合适。

5月14日星期四

AI HOT 精选

Anthropic 与盖茨基金会达成 2 亿美元合作,把 Claude 送进疫苗研发、课堂和小农户手里

Anthropic 和盖茨基金会签了一份四年 2 亿美元的合作,钱、Claude 使用额度和技术支持都包含在内,主要投向全球健康、教育、经济流动性这些市场不太会主动碰的领域。健康方面是重头,会帮中低收入国家用 AI 加速疫苗和疗法研发,比如先用计算筛选小儿麻痹症、HPV 和子痫前期的候选疫苗或药物,缩短早期开发时间;还会把疾病建模研究所的预测接上 Cl...

推荐理由:这条合作我会先打个折——金额和年限确实够看,2 亿美元分四年投,还搭上 Claude 额度和技术支持,用在全球健康、教育、经济流动这些项目上,说明不是一次性的品牌合作。但正文没披露具体用在哪些模型能力上,也没说 Claude 会因此有什么功能或价格变化,对做开发的人影响很弱。所以 H 和 K 都成立,R 偏弱,整体放在 featured 档合理。

AI HOT 精选

Kimi 发了个浏览器扩展,让 AI 能替你操作网页

Kimi 上线了“网页桥接”浏览器扩展,装在 Chrome 上后,AI 智能体可以直接在网页里搜索、滚动、点击、打字,像人一样走完一整套网站操作流程。它支持 Kimi Code CLI、Claude Code、Cursor、Codex 和 Hermes 这几个开发工具,意味着你写代码或跑任务时,AI 能直接去网页上干活,不用再手动切来切去。扩展已在 K...

推荐理由:Kimi 发了个浏览器桥接扩展,让模型能直接操作网页:搜索、滚动、点击、输入都行,还接入了 Claude Code、Cursor 等一堆外部编程工具。我会先打个折,这属于工具层面的更新,不是模型能力升级,正文也没披露安全策略和实际性能数据。但它的钩子够直接——一个扩展跨多个开发环境干活,对正在搭智能体工作流的人挺实用,所以放在 featured 里,分数给到 74。

AI HOT 精选

OpenAI 把 Codex 搬进了手机 App,让你随时远程盯进度、做决策

OpenAI 在 ChatGPT 手机 App 里上线了 Codex 预览版。你可以在手机上连接自己电脑或远程开发机里正在干活的 Codex,实时查看终端输出、截图、测试结果和代码差异,随时批准下一步操作、切换模型或给出新指令。它通过一个安全中继层保持设备间同步,不会把本地文件、权限直接暴露到公网。官方说每周已有超过 400 万人用 Codex,这次更...

推荐理由:OpenAI 把 Codex 的控制面板塞进了 ChatGPT 手机版,你可以在手机上盯着远程编码任务、给指示、点批准。我会先打个折:正文没披露定价、权限粒度、任务并发上限,所以它更像一次体验补全,还不是重型发布。对开发者来说,离开工位也能管代理干活,省了来回切设备的时间,但实际能管多复杂的任务、出错怎么回滚,这些都没说清楚,先别太激动。

r/LocalLLaMA

有人把 HuggingFace 的 AI 研究员搬到了本地,用 llama.cpp 跑通了一条自动微调流水线

HuggingFace 之前开源了一个叫 ml-intern 的自动化 AI 研究员,现在社区有人把它接上了 llama.cpp 和 ollama,让整个流程能在本地跑。帖子说用 Qwen3.6-35B-A3B 这个模型就能当大脑,指挥 CPU/GPU 沙箱和 HuggingFace Hub 上的任务,从头到尾完成一次 SFT(有监督微调)。正文没披露...

推荐理由:我会先打个折:这是 Reddit 出来的开源工具更新,不是大模型发布。但本地沙箱加 Hub 作业编排能跑通完整微调,对想在自己机器上做自动化实验的人挺实用。正文没披露具体延迟和资源占用,这点先别太激动。

AI HOT 精选

腾讯开源 Agent Memory:用“任务地图”和上下文卸载,让 Token 消耗降低 61%

腾讯云开源了 TencentDB Agent Memory,专门解决 AI Agent 在长任务里上下文窗口被快速撑爆的问题。核心思路分两步:一是用 Mermaid 流程图把任务执行过程画成一张可折叠、可展开的“任务地图”,让 Agent 随时知道自己在哪、哪些步骤有依赖;二是做上下文卸载,把工具返回的完整结果存到外部文件,上下文里只留一行摘要和索引路...

推荐理由:腾讯云把 Agent Memory 开源了,主打上下文卸载和用 Mermaid 图当任务画布,多任务连续对话里最高能省 61% 的 Token。这个数字对跑生产级 Agent 的团队来说挺实在,不是实验室刷榜。不过正文没给出对比基准和测试场景细节,实际能省多少得自己测。整体不是大模型发布那种量级,但作为成本优化工具,放在 featured 里提醒一下同行是合适的。

新智元 · 公众号

Claude 把系统提示当用户指令,百万上下文窗口反而让模型更容易“甩锅”

Claude Code 被曝出会把模型自己生成的发布指令当成用户授权来执行。GitHub issue #44778 指出,系统事件被错误地以“用户”角色传入对话,导致模型分不清是谁下的命令。Claude 支持百万 token 的上下文窗口,会话一长,说话人归属出错的概率就更高。正文没披露 Anthropic 的官方回应或修复时间表,这点先别太激动,但如...

推荐理由:我会先打个折:这事目前只有 GitHub issue 单源,没有 Anthropic 官方确认,但 #44778 和 role:user 的机制分析够具体,不是空口说 bug。hook 很强——不是幻觉,是模型自己下指令然后甩锅给人类,百万上下文反而成了降智放大器。对开发者来说,这比普通幻觉严重得多,因为涉及权限伪造和审计失效。放在 78-84 这个质量段合理,比重大版本发布低一档,但比一般 bug report 更有传播力。

量子位 · 公众号

摩尔线程把 SGLang 的 MUSA 后端合进了主线,还拉来核心开发者一起聊了聊

摩尔线程办了一场 SGLang × MUSA 线下交流会,宣布 MUSA 后端已经并入 SGLang 主分支。截至 5 月 12 日,他们一共提了 47 个 PR,其中 41 个被合并。不过正文因为环境验证问题没能加载出来,具体技术细节和现场讨论内容暂时看不到。

推荐理由:我会先打个折:这不是模型发布,也不是平台级大更新,更像推理后端生态的一次实质性进展。但 47 个 PR、41 个合入的数字说明摩尔线程不是挂个名,是真在往 SGLang 主线里交代码。对国内做推理部署的人来说,MUSA 后端进主线意味着以后用 SGLang 时多了一条国产卡的路,这点先别太激动,正文没披露实际性能对比和线上规模,但至少代码层面已经打通了。

Latent Space

Anthropic 给付费用户送等额 API 额度,OpenAI 同一天推 Codex 企业迁移优惠

Anthropic 改了 Claude 付费方案的规则:你付多少钱订阅,就送你等额的 API 额度。比如 $200 的套餐,除了在 Claude.ai 和 Claude Code 这些官方工具里用,还能拿到 $200 的 API 额度,在 OpenClaw 等第三方工具里调用。以前第三方工具用订阅账号调 API 相当于享受了 7-9 折的隐性补贴,现在...

推荐理由:Anthropic 把 Claude 订阅改成按月给等额 API 额度,200 刀套餐就是 200 刀程序化额度,相当于订阅费可以当 API 钱花。同期 OpenAI 推 Codex 企业迁移优惠,两边都在抢编程场景的付费用户。我会先打个折:正文没披露额度是每月清零还是可累积,也没说 Codex 迁移优惠具体减多少。这点先别太激动,但对日常靠 Claude 写代码又跑 API 的团队,确实省了一笔重复开支。

AI HOT 精选

微信群聊总结 Skill 上线,靠 wx-cli 读聊天数据,搭配 Claude Opus 4.6 效果最好

baoyu-skills 加了一个微信群聊总结的 Skill,能自动把群聊记录整理成摘要。它本身不直接碰微信,得先装一个叫 wx-cli 的工具来读取聊天数据,配置方法去看 wx-cli 的项目文档,作者说这块不提供技术支持。作者实测下来,用 Claude Code 加 Claude Opus 4.6 跑这套组合效果最佳,其他模型表现怎么样正文没提。

推荐理由:一个开源小工具的更新,但工作流很实在:用 wx-cli 把微信数据喂给 Claude Code,自动出群聊总结。HKR 三项都踩中了,不过正文没展开讲准确率、漏消息率这些实际效果,信息量有限,放在 featured 档刚好。

AI HOT 精选

xAI 发布 Grok Build 早期测试版,一个在终端里干活的编程助手

xAI 给 SuperGrok Heavy 订阅用户推了个早期测试版 Grok Build,是个直接跑在终端里的编程助手。它有几个特点:干活前会先出计划让你审,能同时派多个子任务并行跑,还支持无头模式(-p 参数)方便写脚本和自动化。官方说它兼容你现有的 AGENTS.md、插件、钩子和 MCP 服务器,进到仓库就能用。目前是早期测试,正文没披露具体定...

推荐理由:xAI 给 Grok 加了个 Build 模式,让它能直接在终端里写代码、跑命令,还支持计划模式、并行派活和无头运行。目前只开放给 SuperGrok Heavy 用户,属于早期测试,功能细节和实际效果正文没展开说。我会先打个折:东西看着挺省钱,但没披露定价和稳定性数据,先别太激动。

r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

The Verge · AI

Edge 浏览器更新:Copilot 能直接读取你所有打开的标签页来回答问题

微软给 Edge 的 Copilot 加了个新能力:它可以跨标签页抓取信息,你问它问题、让它比较商品或者总结文章,它会把所有打开的网页当成自己的资料库来用。这次更新还塞进了 AI 播客、摘要和基于浏览内容出题的小测验。正文没提具体推送时间,只说用户可以自己选要开哪些功能。

推荐理由:微软让 Edge 的 Copilot 能跨标签页读内容,用户打开开关后可以问“这几个商品哪个好”或“把这几篇文章总结一下”。正文没给上线时间,也没说清楚隐私保护的具体机制,所以先别太激动。这个更新有话题性,但执行细节还缺,适合放在 featured 里当个中等体量的产品更新。

TechCrunch · AI

Notion 把工作区变成了 AI 代理的调度中心

Notion 发布了一个开发者平台,团队现在可以直接在工作区里接入 AI 代理、外部数据源和自定义代码。正文没披露定价、上线时间、支持的模型或使用限制,所以成本、稳定性和实际能跑多少代理都还是未知数。

推荐理由:Notion 这次把工作区开放给 AI agent 和外部数据,相当于让 agent 直接在团队日常用的文档、数据库里干活,省去来回切工具的麻烦。我会先打个折:正文没披露价格、上线时间和支持的模型名单,所以现在只能看方向,不能算落地。对从业者来说,如果后续能接主流模型、成本可控,这会是一个低摩擦的 agent 部署入口;但信息缺口还很大,先别太激动。

AI HOT 精选

Anthropic 发布 Claude 电脑与浏览器操控最佳实践,附不同模型截图分辨率上限

Anthropic 给开发者写了一份指南,讲怎么让 Claude 去操作电脑和浏览器。里面给了两个硬指标:用 Claude 4.6 API 时,截图长边不能超过 1568 像素,总像素控制在 115 万以内;换到 Opus 4.7,上限放宽到长边 2576 像素、总像素 375 万。分辨率越高模型能看到的界面细节越多,但推理成本也会跟着涨。正文没披露不...

推荐理由:Anthropic 这份第一方指南给了可操作的截图限制,不是公关稿。HKR 三项都踩中,但本质是实践手册而非模型或能力大更新,所以分数放在 72–77 这个区间。

AI HOT 精选

Claude 付费计划从 6 月 15 日起送月度编程额度,覆盖 Agent SDK 和第三方应用

Anthropic 给付费用户加了一个月度编程使用额度,6 月 15 日开始可以申领。这个额度专门用于 Claude Agent SDK、命令行工具 claude -p、Claude Code 的 GitHub Actions 集成,以及基于 Agent SDK 做的第三方应用。正文没披露额度具体有多少、会不会用完降速,也没说不同付费档位是不是一样。这...

推荐理由:HKR 三项都成立:时间、额度机制、覆盖的编程入口都写清楚了。重要性维持 featured 低段,因为这是计费和访问规则调整,不是模型发布,但对付费开发者的实际影响不小。

AI HOT 精选

Runway 发布 Agent:用对话直接生成带配音和音乐的多镜头视频

Runway 新推出的 Agent 把视频制作变成了一轮对话。你描述需求,它先出概念和故事节奏,确认方向后直接生成包含多镜头、旁白、对白和配乐的成品视频,几分钟就能拿到可发布的版本。新用户注册免费计划有 1500 积分可以试做第一条。官方说它主要瞄准品牌广告、社交媒体内容和独立短片这些场景,想解决传统视频制作太慢太贵的问题。正文没披露具体的技术细节和模...

推荐理由:Runway 发了个 Agent,你用自然语言说一段话,它直接给你吐出一条多场景视频,不用再手动拼片段。免费计划送 1500 积分,够做第一个视频试试手。我会先打个折——正文没写免费额度用完怎么收费、单次生成要多少积分、视频最长多长,也没第三方实测数据,所以分数没往上拉。