跳到正文

#产品更新

今日 25 条

5月15日星期五

The Verge · AI

微软开始收回内部 Claude Code 授权,把开发者往自家 Copilot CLI 赶

微软去年 12 月给内部几千名开发者开放了 Claude Code,让项目经理、设计师这些非技术岗也能试着写代码,半年下来用的人非常多。现在微软准备收回大部分授权,把这些人推到 Copilot CLI 上。正文没披露具体收回多少授权、定价和迁移时间表,也没说 Copilot CLI 功能上能不能补上 Claude Code 的缺口。

推荐理由:微软把去年底才发给内部几千名开发者的 Claude Code 许可证收回去,把人往 Copilot CLI 赶。这事本身不复杂,但信号很清楚:在自家地盘上不想给 Anthropic 留入口。正文没披露具体有多少许可证被取消、Copilot CLI 功能是否能完全替代 Claude Code,所以实际影响还得看后续。我会先打个折,不把它当成 Copilot 已经赢了,但企业采购和开发者工具选型的人会盯着这条。

AI HOT 精选

Anthropic 发了份 AI 创业手册,把从想法到扩张拆成四步,每步都配了 Claude 的实操练习

Anthropic 这篇博客给 AI 原生创业画了一张路线图,分四个阶段:想点子、做最小可行产品、发布、扩张。每个阶段都给了目标、退出标准、常见翻车点,还附了用 Claude 做验证、客户调研、控制技术债、检查产品市场匹配和自动化工作流的提示词。文章没给具体案例数据,更像一套可以直接抄作业的框架。

推荐理由:我会先打个折:这不是模型或产品发布,是 Anthropic 出的创业操作手册。但内容挺实在,把从点子到规模化拆成四个阶段,每个阶段都告诉你目标是什么、什么时候该停、容易栽在哪、怎么用 Claude 练手。对正在用 AI 搭产品的团队来说,退出标准和失败模式比鸡汤有用。正文没披露手册本身是否收费或后续会不会更新,这点先别太激动。

AI HOT 精选

Claude Code 怎么啃下百万行老代码库:五个扩展点与上手顺序

Anthropic 这篇博客讲了 Claude Code 在百万行单体仓库、遗留系统和分布式架构里的实际用法。核心思路不是靠模型硬记,而是靠五个扩展点把项目知识喂给模型:CLAUDE.md 文件写项目规则、hooks 在操作前后自动检查、skills 封装可复用指令、plugins 接外部工具、MCP 服务器做本地代码库的智能搜索。文章给了从零开始的三...

推荐理由:我会先打个折:这不是新模型或重大能力发布,就是一份官方出的 Claude Code 大型代码库使用指南。但它把怎么在遗留系统里让 AI 干活这件事讲得很实在,五个扩展点(CLAUDE.md、钩子、技能、插件、MCP 服务器)都是开发团队能立刻动手配的。正文没给具体性能数据,但思路对上了开发者对老代码库的掌控焦虑,所以放在 72–77 这个区间。

AI HOT 精选

OpenEvidence 覆盖 65% 美国医生,靠医生自己拿执照号注册,医院一开始不知道

OpenEvidence 说它已经覆盖了 65% 的美国医生,4 月临床场景用了 2700 万次,平均每个医生一个月用 41 次。医生是自己在手机上用执业编号注册的,医院起初并不知情,Mount Sinai 的 AI 负责人管这叫“影子 AI”,意思是基层医生自己先大规模用起来了,医院后来才追着签企业合作。OpenEvidence 把这说成是美国医疗史...

推荐理由:我会先打个折,因为正文没披露收入模型、责任划分和效果验证,这些缺口让分数没法再往上走。但 65% 医生覆盖和 2700 万次月使用量是实打实的规模数据,加上医院不知情的影子 AI 叙事,对从业者来说既有冲击力又有警示意义,所以保持在 82 分是合理的。

AI HOT 精选

Genkit 加了个中间件系统,让智能体应用更可控、更扛造

Google 的开源框架 Genkit 现在支持中间件了,可以在模型生成、调用工具、以及整个工具循环这三个层面插入自定义逻辑。比如模型 API 挂了自动重试或切备用方案、执行敏感操作前先让人审批、或者给每一步加上日志方便排查问题。这套机制已经在 TypeScript、Go 和 Dart 里可用,Python 版也快了。

推荐理由:Genkit 这次更新不是小修小补,而是给智能体应用加了三个可插拔的拦截点:生成调用、模型本身、工具调用。你可以把它理解成给 agent 流程装了三个阀门,想在哪里加校验、加日志、改行为都行。语言支持也铺得比较全,TS、Go、Dart、Python 都给了。正文没披露性能开销和具体延迟数据,这点先别太激动。整体看,对正在用 Genkit 搭 agent 的团队是个实用升级,但影响范围还局限在 Genkit 生态内,所以放在 featured 而不是必读。

AI HOT 精选

Arm 和 Google 联手,让手机本地跑音频模型快了 2 倍多

Arm 的新指令集 SME2 把矩阵计算单元直接塞进了 CPU,不用再纠结是忍受 CPU 慢还是外挂专用加速器。Google AI Edge 的 LiteRT 和 XNNPACK 能自动调用这套指令,拿 Stability AI 的音频生成模型 stable-audio-open-small 在 Arm 手机上测试,生成速度提升超过 2 倍,内存占用降...

推荐理由:我会先打个折:这篇只针对一款音频模型在 Arm 设备上的优化,覆盖面不宽。但 2 倍加速和 4 倍内存缩减这两个数字很实在,不是实验室跑分,是直接落到移动端和笔记本上的效果。文章把 SME2 指令集怎么跟 Google AI Edge 的推理管线配合讲得比较清楚,没有堆术语吓人。对正在头疼边缘端延迟和内存成本的团队来说,这是一条能直接抄作业的参考。信息量够上 featured,但别指望它能推广到所有生成式模型。

5月14日星期四

AI HOT 精选

Kimi 发了个浏览器扩展,让 AI 能替你操作网页

Kimi 上线了“网页桥接”浏览器扩展,装在 Chrome 上后,AI 智能体可以直接在网页里搜索、滚动、点击、打字,像人一样走完一整套网站操作流程。它支持 Kimi Code CLI、Claude Code、Cursor、Codex 和 Hermes 这几个开发工具,意味着你写代码或跑任务时,AI 能直接去网页上干活,不用再手动切来切去。扩展已在 K...

推荐理由:Kimi 发了个浏览器桥接扩展,让模型能直接操作网页:搜索、滚动、点击、输入都行,还接入了 Claude Code、Cursor 等一堆外部编程工具。我会先打个折,这属于工具层面的更新,不是模型能力升级,正文也没披露安全策略和实际性能数据。但它的钩子够直接——一个扩展跨多个开发环境干活,对正在搭智能体工作流的人挺实用,所以放在 featured 里,分数给到 74。

AI HOT 精选

OpenAI 把 Codex 搬进了手机 App,让你随时远程盯进度、做决策

OpenAI 在 ChatGPT 手机 App 里上线了 Codex 预览版。你可以在手机上连接自己电脑或远程开发机里正在干活的 Codex,实时查看终端输出、截图、测试结果和代码差异,随时批准下一步操作、切换模型或给出新指令。它通过一个安全中继层保持设备间同步,不会把本地文件、权限直接暴露到公网。官方说每周已有超过 400 万人用 Codex,这次更...

推荐理由:OpenAI 把 Codex 的控制面板塞进了 ChatGPT 手机版,你可以在手机上盯着远程编码任务、给指示、点批准。我会先打个折:正文没披露定价、权限粒度、任务并发上限,所以它更像一次体验补全,还不是重型发布。对开发者来说,离开工位也能管代理干活,省了来回切设备的时间,但实际能管多复杂的任务、出错怎么回滚,这些都没说清楚,先别太激动。

r/LocalLLaMA

有人把 HuggingFace 的 AI 研究员搬到了本地,用 llama.cpp 跑通了一条自动微调流水线

HuggingFace 之前开源了一个叫 ml-intern 的自动化 AI 研究员,现在社区有人把它接上了 llama.cpp 和 ollama,让整个流程能在本地跑。帖子说用 Qwen3.6-35B-A3B 这个模型就能当大脑,指挥 CPU/GPU 沙箱和 HuggingFace Hub 上的任务,从头到尾完成一次 SFT(有监督微调)。正文没披露...

推荐理由:我会先打个折:这是 Reddit 出来的开源工具更新,不是大模型发布。但本地沙箱加 Hub 作业编排能跑通完整微调,对想在自己机器上做自动化实验的人挺实用。正文没披露具体延迟和资源占用,这点先别太激动。

量子位 · 公众号

Scale AI 创始人 Alexandr Wang 回应 LeCun、Manus 争议,并透露 Meta 用九个月重写了预训练、强化学习和数据管线

Alexandr Wang 在访谈里回应了几个近期争议。关于 LeCun 对 Scale AI 的批评,他直接说对方“没搞清楚我们在做什么”。谈到 Manus 时,他评价产品体验不错,但技术上没有看到根本性突破。他还确认 Meta 在过去九个月里把预训练、强化学习和数据处理三套系统全部重写了一遍,这个速度在业内算很快。另外他提到自家产品 Muse Sp...

推荐理由:这篇是 Alexandr Wang 的访谈,不是模型发布,所以分数不会拉满。我会先打个折,因为信息密度不算特别高,但 LeCun 的批评、Manus 的争议和他自曝“父母都是中国人”确实有话题性。Meta 9 个月重建训练栈这件事正文给了细节,说明大厂也在推倒重来,不是小修小补。Muse Spark 因为触发生化、网络、失控等安全检查暂不开源,这点先别太激动,正文没披露具体触发场景和通过标准,只能知道他们加了安全卡口。整体看,有冲突、有事实更新、有从业者关心的开源与安全矛盾,放在 featured 档合理。

Latent Space

Anthropic 给付费用户送等额 API 额度,OpenAI 同一天推 Codex 企业迁移优惠

Anthropic 改了 Claude 付费方案的规则:你付多少钱订阅,就送你等额的 API 额度。比如 $200 的套餐,除了在 Claude.ai 和 Claude Code 这些官方工具里用,还能拿到 $200 的 API 额度,在 OpenClaw 等第三方工具里调用。以前第三方工具用订阅账号调 API 相当于享受了 7-9 折的隐性补贴,现在...

推荐理由:Anthropic 把 Claude 订阅改成按月给等额 API 额度,200 刀套餐就是 200 刀程序化额度,相当于订阅费可以当 API 钱花。同期 OpenAI 推 Codex 企业迁移优惠,两边都在抢编程场景的付费用户。我会先打个折:正文没披露额度是每月清零还是可累积,也没说 Codex 迁移优惠具体减多少。这点先别太激动,但对日常靠 Claude 写代码又跑 API 的团队,确实省了一笔重复开支。

AI HOT 精选

微信群聊总结 Skill 上线,靠 wx-cli 读聊天数据,搭配 Claude Opus 4.6 效果最好

baoyu-skills 加了一个微信群聊总结的 Skill,能自动把群聊记录整理成摘要。它本身不直接碰微信,得先装一个叫 wx-cli 的工具来读取聊天数据,配置方法去看 wx-cli 的项目文档,作者说这块不提供技术支持。作者实测下来,用 Claude Code 加 Claude Opus 4.6 跑这套组合效果最佳,其他模型表现怎么样正文没提。

推荐理由:一个开源小工具的更新,但工作流很实在:用 wx-cli 把微信数据喂给 Claude Code,自动出群聊总结。HKR 三项都踩中了,不过正文没展开讲准确率、漏消息率这些实际效果,信息量有限,放在 featured 档刚好。

AI HOT 精选

Unsloth 放出 Qwen3.6 MTP GGUF 模型,推理速度提升超 1.4 倍

Unsloth 创始人 Daniel Han 发了几个实验版 Qwen3.6 MTP GGUF 模型,用了一种叫“投机解码”的技术来加速推理。具体做法是让模型一次猜两个草稿 token(draft tokens=2),在速度和猜对率之间找了个平衡点。效果上,27B 模型在单张 GPU 上能跑到每秒 140 个 token,35B-A3B 版本能到每秒 ...

推荐理由:我会先打个折:正文只给了一条 X 动态,没披露用的什么 GPU、量化到几比特、怎么复现。所以分数停在低 featured 是合理的。但亮点很实在——用 MTP 投机解码把 27B 和 35B-A3B 的推理速度拉到一个单卡就能爽用的水平,对本地部署和低成本推理场景是个直接利好。这点先别太激动,等补上硬件和量化细节再往上调。

AI HOT 精选

xAI 发布 Grok Build 早期测试版,一个在终端里干活的编程助手

xAI 给 SuperGrok Heavy 订阅用户推了个早期测试版 Grok Build,是个直接跑在终端里的编程助手。它有几个特点:干活前会先出计划让你审,能同时派多个子任务并行跑,还支持无头模式(-p 参数)方便写脚本和自动化。官方说它兼容你现有的 AGENTS.md、插件、钩子和 MCP 服务器,进到仓库就能用。目前是早期测试,正文没披露具体定...

推荐理由:xAI 给 Grok 加了个 Build 模式,让它能直接在终端里写代码、跑命令,还支持计划模式、并行派活和无头运行。目前只开放给 SuperGrok Heavy 用户,属于早期测试,功能细节和实际效果正文没展开说。我会先打个折:东西看着挺省钱,但没披露定价和稳定性数据,先别太激动。

AI HOT 精选

让 GPU 别闲着:用异步批处理榨干推理性能

Hugging Face 发现,一个 80 亿参数的模型在生成 8000 个 token 时,GPU 有 24% 的时间在空转。原因出在同步批处理上:CPU 准备下一批数据时,GPU 只能干等,反之亦然。这篇文章讲的是怎么用 CUDA 流把这两件事拆开并行,让 CPU 准备第 N+1 批的同时,GPU 已经在算第 N 批,把空闲缝隙填满。

推荐理由:我会先打个折:这不是新模型发布,是推理系统的工程优化。Hugging Face 给了一个具体的 24% GPU 空闲率,并解释了用 CUDA 流重叠 CPU 与 GPU 工作的机制,对跑线上服务的团队有参考价值,但属于底层技巧而非行业大新闻,所以放在低 featured 档。

The Verge · AI

Edge 浏览器更新:Copilot 能直接读取你所有打开的标签页来回答问题

微软给 Edge 的 Copilot 加了个新能力:它可以跨标签页抓取信息,你问它问题、让它比较商品或者总结文章,它会把所有打开的网页当成自己的资料库来用。这次更新还塞进了 AI 播客、摘要和基于浏览内容出题的小测验。正文没提具体推送时间,只说用户可以自己选要开哪些功能。

推荐理由:微软让 Edge 的 Copilot 能跨标签页读内容,用户打开开关后可以问“这几个商品哪个好”或“把这几篇文章总结一下”。正文没给上线时间,也没说清楚隐私保护的具体机制,所以先别太激动。这个更新有话题性,但执行细节还缺,适合放在 featured 里当个中等体量的产品更新。

TechCrunch · AI

Notion 把工作区变成了 AI 代理的调度中心

Notion 发布了一个开发者平台,团队现在可以直接在工作区里接入 AI 代理、外部数据源和自定义代码。正文没披露定价、上线时间、支持的模型或使用限制,所以成本、稳定性和实际能跑多少代理都还是未知数。

推荐理由:Notion 这次把工作区开放给 AI agent 和外部数据,相当于让 agent 直接在团队日常用的文档、数据库里干活,省去来回切工具的麻烦。我会先打个折:正文没披露价格、上线时间和支持的模型名单,所以现在只能看方向,不能算落地。对从业者来说,如果后续能接主流模型、成本可控,这会是一个低摩擦的 agent 部署入口;但信息缺口还很大,先别太激动。

r/LocalLLaMA

老显卡 GTX 1080 跑 30B 混合专家模型,每秒能出 24 个 token

用户 mdda 在一台老机器(i7-6700、GTX 1080 8GB 显存、32GB 内存)上跑 Qwen 3.6 35B-A3B 这类约 300 亿参数的混合专家模型,推理速度到了每秒 24 个 token 左右,上下文窗口开到 128k。他的做法是把模型里的一部分专家层卸载到显卡上跑,其余放内存,同时用 TurboQuant 和 RotorQua...

推荐理由:单条 Reddit 帖子权威性不高,但配置和数字很具体,对想用老硬件跑大模型的从业者有参考价值。我会先打个折,这不算正式产品发布或模型更新,但实操信息够硬,适合放进 featured。

AI HOT 精选

Anthropic 发布 Claude 电脑与浏览器操控最佳实践,附不同模型截图分辨率上限

Anthropic 给开发者写了一份指南,讲怎么让 Claude 去操作电脑和浏览器。里面给了两个硬指标:用 Claude 4.6 API 时,截图长边不能超过 1568 像素,总像素控制在 115 万以内;换到 Opus 4.7,上限放宽到长边 2576 像素、总像素 375 万。分辨率越高模型能看到的界面细节越多,但推理成本也会跟着涨。正文没披露不...

推荐理由:Anthropic 这份第一方指南给了可操作的截图限制,不是公关稿。HKR 三项都踩中,但本质是实践手册而非模型或能力大更新,所以分数放在 72–77 这个区间。

AI HOT 精选

Meta 在 WhatsApp 里上线隐身聊天,推理跑在手机安全区、不留服务器日志

Meta 首席 AI 官宣布 WhatsApp 和 Meta AI 上线 Incognito Chat。和 ChatGPT 那种只不存历史记录的临时聊天不一样,这次对话推理完全在手机硬件安全飞地内完成,Meta 工程师拿不到明文,也不产生服务器日志,会话结束后数据永久删除。等于把 WhatsApp 的端到端加密标准搬到了 AI 对话上,想让你敢聊健康、...

推荐理由:我会先打个折:正文只给了官方公告,没第三方实测,也没说安全飞地具体怎么隔离、性能损耗多少。但亮点很直白——隐身聊天把推理塞进手机硬件安全区,服务器不记日志,聊完数据就没了。这对端侧推理和隐私合规是个信号,只是目前信息量撑不起更高权重,排在模型发布和重大能力更新后面比较合适。

AI HOT 精选

Claude 付费计划从 6 月 15 日起送月度编程额度,覆盖 Agent SDK 和第三方应用

Anthropic 给付费用户加了一个月度编程使用额度,6 月 15 日开始可以申领。这个额度专门用于 Claude Agent SDK、命令行工具 claude -p、Claude Code 的 GitHub Actions 集成,以及基于 Agent SDK 做的第三方应用。正文没披露额度具体有多少、会不会用完降速,也没说不同付费档位是不是一样。这...

推荐理由:HKR 三项都成立:时间、额度机制、覆盖的编程入口都写清楚了。重要性维持 featured 低段,因为这是计费和访问规则调整,不是模型发布,但对付费开发者的实际影响不小。

AI HOT 精选

Runway 发布 Agent:用对话直接生成带配音和音乐的多镜头视频

Runway 新推出的 Agent 把视频制作变成了一轮对话。你描述需求,它先出概念和故事节奏,确认方向后直接生成包含多镜头、旁白、对白和配乐的成品视频,几分钟就能拿到可发布的版本。新用户注册免费计划有 1500 积分可以试做第一条。官方说它主要瞄准品牌广告、社交媒体内容和独立短片这些场景,想解决传统视频制作太慢太贵的问题。正文没披露具体的技术细节和模...

推荐理由:Runway 发了个 Agent,你用自然语言说一段话,它直接给你吐出一条多场景视频,不用再手动拼片段。免费计划送 1500 积分,够做第一个视频试试手。我会先打个折——正文没写免费额度用完怎么收费、单次生成要多少积分、视频最长多长,也没第三方实测数据,所以分数没往上拉。

The Verge · AI

扎克伯格宣布 Meta AI 推出端到端加密的“无痕聊天”,声称服务器不留记录

Meta 老板扎克伯格亲自发帖,给 Meta AI 加了一个“无痕聊天”模式。按他的说法,这种对话用上了端到端加密,聊完退出会话后消息就没了,服务器上不存对话记录。Meta 强调这跟其他聊天机器人不一样。不过,这篇报道没写这个功能什么时候上线、覆盖哪些地区,也没提 Meta 有没有找第三方来做安全审计,或者密钥到底是怎么管的。所以“完全私密”这个说法,...

推荐理由:我会先打个折:Meta 说“完全私密”的 AI 聊天,服务器不存日志还端到端加密,听着挺省钱省心。但正文没披露上线范围、保留策略审计和密钥管理机制,这点先别太激动。它更像一个产品更新,隐私承诺的验证链条还没给全,所以放在 featured 里当个信号看就行。

AI HOT 精选

Anthropic 给小型企业做了个 Claude 服务包,直接连 QuickBooks、PayPal 等工具跑自动化流程

Anthropic 推出 Claude for Small Business,一个在 Claude Cowork 里一键开启的服务包。它把 Claude 接进了小企业常用的工具:Intuit QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspace 和 Microsoft 365。自带 15 个...

推荐理由:Anthropic 这次把 Claude 做成小企业套餐,给了 15 个现成工作流和几个常用工具的连接器,还加了手动审批环节,产品更新挺实在。不过正文没提价格、具体铺开范围和实际用量数据,所以先别太激动,重要性到不了必写级别。

5月13日星期三

TechCrunch · AI

WhatsApp 给 Meta AI 聊天加了隐身模式,关掉对话记录就没了

Meta 在 WhatsApp 里给 AI 聊天加了个隐身模式。开了之后,你和 AI 的对话不会被保存,关掉聊天窗口消息就自动消失。正文没提这个模式是默认开启还是需要手动打开,也没说端到端加密的情况。

推荐理由:我会先打个折:这只是 WhatsApp 里 Meta AI 的一个功能开关,不是模型或平台级变动,所以放在 featured 档。但它的隐私钩子很清晰——AI 聊天不保存、关掉就消失,对普通用户来说比一堆权限说明好理解得多。正文没披露这个“不保存”是客户端不存还是服务端也不留日志,这点先别太激动。即便如此,WhatsApp 的用户规模摆在那,这种设计一旦铺开,对 AI 产品的数据留存习惯会有示范效应。

Hacker News 首页

Rotunda:一个专为 AI 智能体设计的浏览器,能模拟人类打字节奏

Pierce 发布了 Rotunda,一个基于 Firefox 150 的浏览器,专门给 Claude、Codex 这类 AI 智能体用。它最大的不同是能模拟人类的鼠标移动和键盘输入节奏——作者用自己一周的操作数据训练了一个 RNN 模型来生成这些时序,让智能体操作网页时看起来更像真人。控制方式有两种:命令行或者 Playwright API,方便接入...

推荐理由:Rotunda 把 Firefox 150 改成了给 Claude、Codex 这类工具用的浏览器,核心卖点是拿 RNN 模拟人类敲键盘、动鼠标的时序,让网站不容易识别出是机器在操作。接入方式走 CLI 或 Playwright API,对已经在用 Playwright 的人上手成本低。不过目前只是一个 Show HN 的开源仓库,正文没披露实际跑在哪些业务里、也没给延迟或成功率数据,所以效果到底怎么样还得看后续验证。

r/LocalLLaMA

阿里达摩院放出 Ovis2.6-80B-A3B:总参数 800 亿,推理时只激活约 30 亿的多模态 MoE 模型

Ovis2.6 把语言模型底座换成了混合专家架构,总参数量堆到 800 亿,但推理时只叫醒大概 30 亿个参数,跑起来比较省算力。上下文窗口拉到 64K token,能处理的图片分辨率最高到 2880×2880,适合啃长文档、高信息密度的图表和扫描件。这次加了一个“边想边看图”的能力,推理过程中模型可以主动裁剪、旋转图片区域,在思维链里反复检查视觉细节...

推荐理由:我会先打个折:正文没给任何跑分、授权条款和实测结果,所以别急着下结论。亮点是 80B 总参数里只激活约 3B,推理成本可能压得很低,同时支持 64K 上下文和 2880×2880 大图输入,适合拿来做文档理解、高分辨率视觉问答这类吃上下文和细节的任务。MoE 结构意味着你可以用消费级硬件试试,但实际吞吐和显存占用还得自己测。这点先别太激动,等补上基准测试和开源协议再说。

AI HOT 精选

Cursor 给云端 AI 编程助手配上了开发环境,支持多仓库和 Dockerfile 配置

Cursor 发布了一套给云端 agent 用的开发环境工具。现在一个环境里能挂多个代码仓库,让 agent 跨仓库改代码、跑测试。环境配置改用 Dockerfile 来管,支持构建密钥,缓存命中时构建速度能快 70%。不想手写 Dockerfile 的话,Cursor 可以自动检查你的仓库并生成一份可编辑的配置,这个功能还在内测。环境还加了版本历史、...

推荐理由:Cursor 给智能体配了个云端开发环境,不是简单加个按钮,而是把多仓库、Dockerfile、审计日志和环境权限都塞进去了。缓存命中后构建能快 70%,这个数字挺实在,说明他们不是只做了个壳。我会先打个折:正文没提安全隔离做到什么程度,也没说缓存命中率在真实项目里能到多少,所以别急着当万能方案。但整体看,它解决的是让模型进业务流程干活时环境乱、权限杂、构建慢这几个真问题,对从业者来说值得关注。

OpenAI News

OpenAI 给 Windows 版 Codex 造了个沙箱,让编程助手能干活又不乱碰文件

Codex 是 OpenAI 的编程助手,能在开发者电脑上直接跑命令。Windows 版之前没有沙箱,用户要么得每条命令都点同意,要么就得开“完全访问”把安全交给运气。OpenAI 工程师 David Wiesen 写了篇文章讲他们怎么从零给 Windows 造沙箱。他们先看了 Windows 自带的几个方案:AppContainer 管得太死,编程助...

推荐理由:OpenAI 给 Windows 版 Codex 搭了个安全沙箱,主要管两件事:文件访问和网络连接。我会先打个折——正文没披露沙箱的技术方案,比如是容器还是虚拟化、权限粒度到哪一层,所以没法判断它到底有多硬。但这条消息对做 coding agent 的人很实际,因为文件系统和网络就是最容易出事的两个面。

AI HOT 精选

百度上线妙答应用与企业版,称应用自身 90% 代码由妙答自己生成

百度发布了妙答应用和妙答企业版,把编程助手开放给更多开发者和公司。官方说妙答应用里 90% 的代码是妙答自己写的,这个数字说明代码生成能力已经能撑起一个完整产品的大部分开发量。截至目前,妙答生成的应用累计服务超过 1000 万用户,应用总价值标称 50 亿元人民币。不过正文没披露这 50 亿是怎么算出来的,也没给出企业版的具体定价或与现有竞品的对比,这...

推荐理由:我会先打个折:90% 自生成代码这个数,正文没披露是怎么统计的,是行数占比还是模块占比,也没说剩下 10% 是人写的还是用别的工具生成的。1000 万用户和 50 亿总价值同样缺口径说明,是累计还是年化、是 GMV 还是合同额都不清楚。但即便有这些信息缺口,一个代码工具敢说自己大部分代码是自产的,本身就是一个很强的信号,比单纯宣布“上线了”要有意思得多。对做 AI coding 和 agent 的团队来说,这个案例可以直接拿来当参考,所以值得放进 featured 但分数不往上拉。

量子位 · 公众号

百度发布秒哒3.0,8岁小孩也能把想法变成手机App

百度在2026 Create大会上推出了秒哒3.0,一个无代码开发平台。这次更新直接支持生成iOS和安卓App,还能打包成安卓安装包、在线热更新。企业版加了三级权限、环境隔离和服务等级协议。现场演示里,一个8岁小学生用语音说了几个想法,平台就自动生成了一个完整应用。不过正文没披露这个演示App的实际复杂度和后续维护成本,也没说生成代码的质量和可维护性怎么样。

推荐理由:秒哒3.0这次主要把应用生成从网页端扩展到了iOS和Android,还加了安卓打包和热更新,等于让不会写代码的人也能直接出手机应用。企业版给了三级权限和SLA,明显在往团队和公司场景推。我会先打个折:标题里“8岁小学生”的案例正文没给出具体细节,不知道是完整可用应用还是简单页面,这点先别太激动。整体是产品功能更新,不是底层模型换代,但移动端生成和打包能力对低代码赛道有实际推进。

纽约时报中文网

DeepSeek 新模型首次用华为芯片跑推理,训练还得靠英伟达

DeepSeek 上个月发新模型,头一回说推理环节跑在了华为芯片上,但两位半导体业人士透露,训练阶段仍然依赖英伟达芯片,具体怎么拿到的没细说。华为计划今年出训练芯片,同时承认性能追上英伟达现有水平还要再等一年。这件事让中国在 AI 硬件上跟美国进一步脱钩,也印证了黄仁勋之前的警告:出口管制反而逼着中国自建一套技术栈。不过中芯国际量产华为芯片良率低、功耗...

推荐理由:这篇不是模型发布,也没有跑分,所以分数不会冲太高。但信息量够硬——DeepSeek 推理侧开始用华为芯片,训练侧还离不开英伟达,华为自己的训练芯片今年才出来、性能追平还要一年。我会先打个折:正文没给推理优化的具体性能对比或延迟数据,也没说 DeepSeek 在华为芯片上跑了多大并发。不过它把芯片管制这条线拉得很清楚,对关注算力成本和国产替代的人有直接参考价值,84 分放在 featured 里是合适的。

AI HOT 精选

Google 出了第一款围绕 Gemini 做的笔记本 Googlebook,不再是 Chromebook 那种云优先的路子

Google 发了台叫 Googlebook 的笔记本,系统层面把 Gemini 塞了进去。这次说了三个功能:Magic Pointer 把光标变成一个 AI 入口,点哪都能弹出上下文建议和任务;Create Your Widget 让你用大白话描述需求,自动生成一个能聚合不同信息的桌面小组件;还打通了安卓生态,在电脑上直接调用手机 App 和文件。正...

推荐理由:我会先打个折:正文没披露具体配置、价格、上市时间和实际演示,所以没法往更高分打。但“Googlebook”这个命名和围绕 Gemini Intelligence 的设计,说明 Google 想把 AI 做成笔记本的原生能力,而不是外挂一个助手。三项机制里,Magic Pointer 听起来像用意图预测代替传统光标操作,自然语言生成小组件是把“说人话就能搭界面”搬到桌面,Android 跨设备访问则打通了手机和笔记本的协同。这些点加起来,让这条消息在 AI 从业者眼里有讨论价值,但缺细节也意味着落地效果还得观望。

AI HOT 精选

Claude Code 加了个 /goal 指令,让模型自己跑到任务做完

Claude Code 新上线了 /goal 功能,你下完指令后 Claude 会持续干活直到任务完成,不用人在旁边盯着。帖子没写这个功能怎么触发、哪些版本能用、要不要额外付费,也没提任务卡住或跑偏时怎么处理。

推荐理由:HKR 三项都过,因为 /goal 解决的是 Claude Code 用户常遇到的 agent 中途停摆问题。这只是 Anthropic 单功能更新,细节披露不多,所以放在 featured 低位,不算当天重磅消息。

彭博科技

CME 要把 AI 算力做成期货,以后可以像炒原油一样炒 GPU 时间

CME 集团和 Silicon Data 联手,打算推出一个 AI 算力期货市场。简单说,就是让 GPU 计算时间像大豆、原油一样在交易所公开报价、买卖合约。这等于给支撑 AI 基础设施的算力定出一个市场价。不过,正文没披露合约的具体规格、什么时候上线、预计交易量有多大。如果真跑起来,意味着云厂商和 AI 公司可以提前锁定算力成本,但流动性够不够、用什...

推荐理由:CME 要把 AI 算力当大宗商品来炒,这事本身挺新鲜。正文没给合约规格、上线时间和交易规模,所以现在只能当个信号看——说明有人想把算力价格做成可对冲的风险。对囤 GPU 的团队来说,如果真跑起来,可能多一个锁成本的工具,但没细节之前别太激动。

AI HOT 精选

OpenAI 演示 Codex 在 Mac 上跨应用后台干活,不用占着你的电脑

OpenAI 开发者账号发了一段演示,Codex 能跨 Mac 应用点击、输入、在后台持续执行任务,不会锁住你的鼠标键盘。视频里 @AriX 和 @romainhuet 聊了这种代理能干的事,但正文没披露发布时间、权限怎么设计、以及这次开放给哪些用户。

推荐理由:我会先打个折:正文只有一段演示描述,没给发布时间、权限模型、可用范围,所以重要性停在 76 分。钩子很直接——Codex 能在 Mac 后台帮你跨应用点按钮、填文字,听着像本地 RPA 但由模型驱动。这点先别太激动,因为没交代它怎么拿系统权限、会不会误操作、有没有沙箱。对开发者来说,这要么是桌面 agent 的一大步,要么是个安全坑,得等更多细节。

AI HOT 精选

阶跃星辰发了 Step Image Edit 2,35 亿参数在指令修图榜 KRIS-Bench 上拿了综合、事实、概念三项第一

这个 35 亿参数的图像模型在 KRIS-Bench 指令修图评测里,综合、事实和概念三个类别都排第一,跑赢了参数大它五六倍的模型。能干的事包括文生图、按指令改图、中英文文字渲染,以及保持主体一致的风格迁移。官方说生成快、单次编辑成本低,但没给出具体延迟和价格数字。模型已经上线阶跃开放平台,可以直接用。

推荐理由:我会先打个折:目前只有厂商自报成绩,没有第三方复现或定价信息,所以别急着全信。但35亿参数能在KRIS-Bench三个子项都排第一,说明小模型做图像编辑这条路走得通,对在意推理成本的人是个好消息。正文没披露训练数据规模和具体推理延迟,这两点会直接影响实际能用在哪。

AI HOT 精选

Anthropic 安全团队用自家 Claude Code 搭了个威胁检测平台,一天出原型、一周上线

Anthropic 的检测平台工程团队用 Claude Code 开发了 CLUE 威胁检测与响应平台。他们一天就做出了概念验证,一周完成交付。这个平台把安全分析员查日志的时间从几小时压缩到了几分钟。文章是团队技术负责人 Jackie Bow 写的,主要讲他们怎么用 Claude Code 自动处理告警、加速调查,但没披露具体用了哪些模型、实际误报率多...

推荐理由:这是 Anthropic 安全团队自己吃狗粮的案例,不是 Claude Code 功能发布。CLUE 平台和一天 PoC、一周交付的时间线让它刚好够上 featured 门槛,但我会先打个折——内部案例的通用性还没验证,正文也没披露误报率、处理量这些硬指标。

彭博科技

CME 打算推出算力期货,把 GPU 租赁变成可交易合约

芝加哥商品交易所(CME)和 Silicon Data 正在筹划一个算力期货市场,让计算资源像原油或玉米一样在交易所买卖。视频里讨论了这么做的逻辑和运作方式,但没公布合约的具体规格、上线时间,也没说价格怎么定。对 AI 公司来说,这相当于提前锁定 GPU 租用成本,不用再担心突然涨价或抢不到卡。不过现在信息还太少,正文没披露流动性由谁提供、用什么基准指...

推荐理由:我会先打个折:正文没披露合约怎么设计、什么时候上线、价格怎么定,所以现在只能当信号看。但信号本身挺有意思——CME 下场做算力期货,等于把 GPU 供应变成可交易的金融资产。对 AI 从业者来说,如果真能对冲算力价格波动,采购和预算会好做很多。这点先别太激动,等具体规格出来再判断。

AI HOT 精选

Claude Opus 4.7 快速模式开放研究预览,API 和 Claude Code 都能用

Anthropic 把 Claude Opus 4.7 的快速模式放出来了,现在可以在 API 和 Claude Code 里用,但还挂着研究预览的标签。正文没提模型参数量、具体定价、调用频率限制,也没说什么时候转正式版。如果是真的快又便宜,对日常开发场景会挺实用,不过这些关键信息都缺着,先别急着切生产环境。

推荐理由:我会先打个折:正文只说了开放研究预览,没披露模型大小、定价、速率限制和正式上线时间,所以别当成品看。但这条消息对用 Claude Code 干活的人很实在——快速模式意味着写代码、调工具的等待时间可能明显缩短,工作流会顺很多。信息缺口主要在成本和规模上,没这些数字就没法算账,这点先别太激动。整体判断挂在延迟改善和开发者体验上,信息不够的部分也标清楚了。