跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 401–420 条 · 共 842 条

5月15日星期五

Latent Space

AI 原生医疗:1 亿次问诊、每周省 10–20 小时、几分钟搞定预授权

Abridge 这家公司 2018 年就起步了,比 ChatGPT 火起来早了四年多。他们一开始做的事很实在:把医生和病人的对话录下来,自动生成病历草稿,帮医生省掉下班后补病历的“睡衣时间”,每周能省出 10 到 20 小时。现在他们铺得更开了,今年预计要覆盖超过 8000 万次医患对话,进了 250 家美国大型医疗系统,支持 28 种以上语言和 50...

推荐理由:Abridge 的 CEO 和 CTO 出来聊了聊,说今年要支持超过 8000 万次医患对话,覆盖 250 个美国大型医疗系统,医生每周能省下 10 到 20 小时的文书时间,预授权从几天缩到几分钟。这些数字是公司自己报的,不是第三方审计或独立基准测试,所以我会先打个折来看。但 1 亿次就诊这个量级确实少见,说明医疗 AI 不再只是试点项目,已经在规模化跑流程了。文章没披露准确率、漏诊率或患者满意度数据,也没说省钱具体怎么算的,这点先别太激动。整体看,它更像一次公司访谈放出的运营数据更新,不是重大产品发布或独立验证,所以放在低 featured 档。

AI HOT 精选

Codex 现在能挂脚本、发令牌,把代码助手塞进自动化流程里

OpenAI 给 Codex 加了两样东西:一是“钩子”,可以在任务的关键节点跑自定义脚本,比如提交前自动验代码、扫密钥、记日志,或者按仓库做定制行为;二是面向商业和企业版的“程序化访问令牌”,从 ChatGPT 工作区设置里就能创建,带权限范围、可设过期或撤销,方便接入 CI/CD、发布流水线和内部自动化,使用记录也会归到对应工作区。正文没提这些令牌...

推荐理由:Codex 这次更新是把自动化从对话界面往工程流程里塞:钩子能在任务检查点跑脚本,程序化令牌给商业和企业团队接 CI/CD、发布和内部自动化用。我会先打个折——正文没披露权限粒度、令牌怎么计费、钩子执行失败怎么回滚,这些缺口让实际落地成本还看不清。但方向很明确,就是让模型进开发管线干活,不是只聊天。

彭博科技

马斯克的 xAI 发布首个编程助手 Grok Build,直接对标 Anthropic

xAI 推出了 Grok Build,一个能直接参与软件开发流程的 AI 编程助手,目标直指 Anthropic 的 Claude。目前公开信息很少,正文没披露定价、能用哪些代码编辑器、性能跑分,也没说什么时候正式开放。

推荐理由:H 和 R 都成立:xAI 跳进编程 Agent 这个坑,还点名 Anthropic,对开发者来说是个明确的竞争信号,话题够。但 K 不成立,因为正文除了说有个叫 Grok Build 的东西能写代码,别的什么都没给——价格、开放范围、跑分全缺,信息量撑不起一篇硬核更新。整体只能算中等偏轻的产品消息,我会先打个折,别太激动。

The Verge · AI

OpenAI 把桌面端写代码工具 Codex 塞进了 ChatGPT 手机 App

OpenAI 宣布 Codex 会集成到 ChatGPT 的手机 App 里。Codex 原本是桌面端工具,能写代码、操控你电脑上的其他应用,现在在手机上也能用了。这次更新是冲着 Anthropic 的 Claude Code 去的,OpenAI 为了追赶砍掉了 Sora 视频生成等“支线项目”,集中精力做企业生意和桌面“超级应用”。不过正文没提手机端...

推荐理由:OpenAI 把 Codex 塞进了 ChatGPT 手机 App,算一次中等体量的产品更新。我会先打个折:正文只说了能写代码、能操控电脑应用,但上线时间、价格、支持哪些应用全都没提,这点先别太激动。HKR 三项都过——手机端 coding agent 的钩子够直接,操作应用的声称是新的具体信息,也戳中了开发者日常和同类产品抢分发入口的神经。信息缺口明显,所以重要性停在 featured 地板,不往上拔。

The Verge · AI

微软开始收回内部 Claude Code 授权,把开发者往自家 Copilot CLI 赶

微软去年 12 月给内部几千名开发者开放了 Claude Code,让项目经理、设计师这些非技术岗也能试着写代码,半年下来用的人非常多。现在微软准备收回大部分授权,把这些人推到 Copilot CLI 上。正文没披露具体收回多少授权、定价和迁移时间表,也没说 Copilot CLI 功能上能不能补上 Claude Code 的缺口。

推荐理由:微软把去年底才发给内部几千名开发者的 Claude Code 许可证收回去,把人往 Copilot CLI 赶。这事本身不复杂,但信号很清楚:在自家地盘上不想给 Anthropic 留入口。正文没披露具体有多少许可证被取消、Copilot CLI 功能是否能完全替代 Claude Code,所以实际影响还得看后续。我会先打个折,不把它当成 Copilot 已经赢了,但企业采购和开发者工具选型的人会盯着这条。

AI HOT 精选

Anthropic 发了份 AI 创业手册,把从想法到扩张拆成四步,每步都配了 Claude 的实操练习

Anthropic 这篇博客给 AI 原生创业画了一张路线图,分四个阶段:想点子、做最小可行产品、发布、扩张。每个阶段都给了目标、退出标准、常见翻车点,还附了用 Claude 做验证、客户调研、控制技术债、检查产品市场匹配和自动化工作流的提示词。文章没给具体案例数据,更像一套可以直接抄作业的框架。

推荐理由:我会先打个折:这不是模型或产品发布,是 Anthropic 出的创业操作手册。但内容挺实在,把从点子到规模化拆成四个阶段,每个阶段都告诉你目标是什么、什么时候该停、容易栽在哪、怎么用 Claude 练手。对正在用 AI 搭产品的团队来说,退出标准和失败模式比鸡汤有用。正文没披露手册本身是否收费或后续会不会更新,这点先别太激动。

AI HOT 精选

Claude Code 怎么啃下百万行老代码库:五个扩展点与上手顺序

Anthropic 这篇博客讲了 Claude Code 在百万行单体仓库、遗留系统和分布式架构里的实际用法。核心思路不是靠模型硬记,而是靠五个扩展点把项目知识喂给模型:CLAUDE.md 文件写项目规则、hooks 在操作前后自动检查、skills 封装可复用指令、plugins 接外部工具、MCP 服务器做本地代码库的智能搜索。文章给了从零开始的三...

推荐理由:我会先打个折:这不是新模型或重大能力发布,就是一份官方出的 Claude Code 大型代码库使用指南。但它把怎么在遗留系统里让 AI 干活这件事讲得很实在,五个扩展点(CLAUDE.md、钩子、技能、插件、MCP 服务器)都是开发团队能立刻动手配的。正文没给具体性能数据,但思路对上了开发者对老代码库的掌控焦虑,所以放在 72–77 这个区间。

AI HOT 精选

OpenEvidence 覆盖 65% 美国医生,靠医生自己拿执照号注册,医院一开始不知道

OpenEvidence 说它已经覆盖了 65% 的美国医生,4 月临床场景用了 2700 万次,平均每个医生一个月用 41 次。医生是自己在手机上用执业编号注册的,医院起初并不知情,Mount Sinai 的 AI 负责人管这叫“影子 AI”,意思是基层医生自己先大规模用起来了,医院后来才追着签企业合作。OpenEvidence 把这说成是美国医疗史...

推荐理由:我会先打个折,因为正文没披露收入模型、责任划分和效果验证,这些缺口让分数没法再往上走。但 65% 医生覆盖和 2700 万次月使用量是实打实的规模数据,加上医院不知情的影子 AI 叙事,对从业者来说既有冲击力又有警示意义,所以保持在 82 分是合理的。

AI HOT 精选

Genkit 加了个中间件系统,让智能体应用更可控、更扛造

Google 的开源框架 Genkit 现在支持中间件了,可以在模型生成、调用工具、以及整个工具循环这三个层面插入自定义逻辑。比如模型 API 挂了自动重试或切备用方案、执行敏感操作前先让人审批、或者给每一步加上日志方便排查问题。这套机制已经在 TypeScript、Go 和 Dart 里可用,Python 版也快了。

推荐理由:Genkit 这次更新不是小修小补,而是给智能体应用加了三个可插拔的拦截点:生成调用、模型本身、工具调用。你可以把它理解成给 agent 流程装了三个阀门,想在哪里加校验、加日志、改行为都行。语言支持也铺得比较全,TS、Go、Dart、Python 都给了。正文没披露性能开销和具体延迟数据,这点先别太激动。整体看,对正在用 Genkit 搭 agent 的团队是个实用升级,但影响范围还局限在 Genkit 生态内,所以放在 featured 而不是必读。

AI HOT 精选

Arm 和 Google 联手,让手机本地跑音频模型快了 2 倍多

Arm 的新指令集 SME2 把矩阵计算单元直接塞进了 CPU,不用再纠结是忍受 CPU 慢还是外挂专用加速器。Google AI Edge 的 LiteRT 和 XNNPACK 能自动调用这套指令,拿 Stability AI 的音频生成模型 stable-audio-open-small 在 Arm 手机上测试,生成速度提升超过 2 倍,内存占用降...

推荐理由:我会先打个折:这篇只针对一款音频模型在 Arm 设备上的优化,覆盖面不宽。但 2 倍加速和 4 倍内存缩减这两个数字很实在,不是实验室跑分,是直接落到移动端和笔记本上的效果。文章把 SME2 指令集怎么跟 Google AI Edge 的推理管线配合讲得比较清楚,没有堆术语吓人。对正在头疼边缘端延迟和内存成本的团队来说,这是一条能直接抄作业的参考。信息量够上 featured,但别指望它能推广到所有生成式模型。

5月14日星期四

AI HOT 精选

Kimi 发了个浏览器扩展,让 AI 能替你操作网页

Kimi 上线了“网页桥接”浏览器扩展,装在 Chrome 上后,AI 智能体可以直接在网页里搜索、滚动、点击、打字,像人一样走完一整套网站操作流程。它支持 Kimi Code CLI、Claude Code、Cursor、Codex 和 Hermes 这几个开发工具,意味着你写代码或跑任务时,AI 能直接去网页上干活,不用再手动切来切去。扩展已在 K...

推荐理由:Kimi 发了个浏览器桥接扩展,让模型能直接操作网页:搜索、滚动、点击、输入都行,还接入了 Claude Code、Cursor 等一堆外部编程工具。我会先打个折,这属于工具层面的更新,不是模型能力升级,正文也没披露安全策略和实际性能数据。但它的钩子够直接——一个扩展跨多个开发环境干活,对正在搭智能体工作流的人挺实用,所以放在 featured 里,分数给到 74。

AI HOT 精选

OpenAI 把 Codex 搬进了手机 App,让你随时远程盯进度、做决策

OpenAI 在 ChatGPT 手机 App 里上线了 Codex 预览版。你可以在手机上连接自己电脑或远程开发机里正在干活的 Codex,实时查看终端输出、截图、测试结果和代码差异,随时批准下一步操作、切换模型或给出新指令。它通过一个安全中继层保持设备间同步,不会把本地文件、权限直接暴露到公网。官方说每周已有超过 400 万人用 Codex,这次更...

推荐理由:OpenAI 把 Codex 的控制面板塞进了 ChatGPT 手机版,你可以在手机上盯着远程编码任务、给指示、点批准。我会先打个折:正文没披露定价、权限粒度、任务并发上限,所以它更像一次体验补全,还不是重型发布。对开发者来说,离开工位也能管代理干活,省了来回切设备的时间,但实际能管多复杂的任务、出错怎么回滚,这些都没说清楚,先别太激动。

r/LocalLLaMA

有人把 HuggingFace 的 AI 研究员搬到了本地,用 llama.cpp 跑通了一条自动微调流水线

HuggingFace 之前开源了一个叫 ml-intern 的自动化 AI 研究员,现在社区有人把它接上了 llama.cpp 和 ollama,让整个流程能在本地跑。帖子说用 Qwen3.6-35B-A3B 这个模型就能当大脑,指挥 CPU/GPU 沙箱和 HuggingFace Hub 上的任务,从头到尾完成一次 SFT(有监督微调)。正文没披露...

推荐理由:我会先打个折:这是 Reddit 出来的开源工具更新,不是大模型发布。但本地沙箱加 Hub 作业编排能跑通完整微调,对想在自己机器上做自动化实验的人挺实用。正文没披露具体延迟和资源占用,这点先别太激动。

量子位 · 公众号

Scale AI 创始人 Alexandr Wang 回应 LeCun、Manus 争议,并透露 Meta 用九个月重写了预训练、强化学习和数据管线

Alexandr Wang 在访谈里回应了几个近期争议。关于 LeCun 对 Scale AI 的批评,他直接说对方“没搞清楚我们在做什么”。谈到 Manus 时,他评价产品体验不错,但技术上没有看到根本性突破。他还确认 Meta 在过去九个月里把预训练、强化学习和数据处理三套系统全部重写了一遍,这个速度在业内算很快。另外他提到自家产品 Muse Sp...

推荐理由:这篇是 Alexandr Wang 的访谈,不是模型发布,所以分数不会拉满。我会先打个折,因为信息密度不算特别高,但 LeCun 的批评、Manus 的争议和他自曝“父母都是中国人”确实有话题性。Meta 9 个月重建训练栈这件事正文给了细节,说明大厂也在推倒重来,不是小修小补。Muse Spark 因为触发生化、网络、失控等安全检查暂不开源,这点先别太激动,正文没披露具体触发场景和通过标准,只能知道他们加了安全卡口。整体看,有冲突、有事实更新、有从业者关心的开源与安全矛盾,放在 featured 档合理。

Latent Space

Anthropic 给付费用户送等额 API 额度,OpenAI 同一天推 Codex 企业迁移优惠

Anthropic 改了 Claude 付费方案的规则:你付多少钱订阅,就送你等额的 API 额度。比如 $200 的套餐,除了在 Claude.ai 和 Claude Code 这些官方工具里用,还能拿到 $200 的 API 额度,在 OpenClaw 等第三方工具里调用。以前第三方工具用订阅账号调 API 相当于享受了 7-9 折的隐性补贴,现在...

推荐理由:Anthropic 把 Claude 订阅改成按月给等额 API 额度,200 刀套餐就是 200 刀程序化额度,相当于订阅费可以当 API 钱花。同期 OpenAI 推 Codex 企业迁移优惠,两边都在抢编程场景的付费用户。我会先打个折:正文没披露额度是每月清零还是可累积,也没说 Codex 迁移优惠具体减多少。这点先别太激动,但对日常靠 Claude 写代码又跑 API 的团队,确实省了一笔重复开支。

AI HOT 精选

微信群聊总结 Skill 上线,靠 wx-cli 读聊天数据,搭配 Claude Opus 4.6 效果最好

baoyu-skills 加了一个微信群聊总结的 Skill,能自动把群聊记录整理成摘要。它本身不直接碰微信,得先装一个叫 wx-cli 的工具来读取聊天数据,配置方法去看 wx-cli 的项目文档,作者说这块不提供技术支持。作者实测下来,用 Claude Code 加 Claude Opus 4.6 跑这套组合效果最佳,其他模型表现怎么样正文没提。

推荐理由:一个开源小工具的更新,但工作流很实在:用 wx-cli 把微信数据喂给 Claude Code,自动出群聊总结。HKR 三项都踩中了,不过正文没展开讲准确率、漏消息率这些实际效果,信息量有限,放在 featured 档刚好。

AI HOT 精选

Unsloth 放出 Qwen3.6 MTP GGUF 模型,推理速度提升超 1.4 倍

Unsloth 创始人 Daniel Han 发了几个实验版 Qwen3.6 MTP GGUF 模型,用了一种叫“投机解码”的技术来加速推理。具体做法是让模型一次猜两个草稿 token(draft tokens=2),在速度和猜对率之间找了个平衡点。效果上,27B 模型在单张 GPU 上能跑到每秒 140 个 token,35B-A3B 版本能到每秒 ...

推荐理由:我会先打个折:正文只给了一条 X 动态,没披露用的什么 GPU、量化到几比特、怎么复现。所以分数停在低 featured 是合理的。但亮点很实在——用 MTP 投机解码把 27B 和 35B-A3B 的推理速度拉到一个单卡就能爽用的水平,对本地部署和低成本推理场景是个直接利好。这点先别太激动,等补上硬件和量化细节再往上调。

AI HOT 精选

xAI 发布 Grok Build 早期测试版,一个在终端里干活的编程助手

xAI 给 SuperGrok Heavy 订阅用户推了个早期测试版 Grok Build,是个直接跑在终端里的编程助手。它有几个特点:干活前会先出计划让你审,能同时派多个子任务并行跑,还支持无头模式(-p 参数)方便写脚本和自动化。官方说它兼容你现有的 AGENTS.md、插件、钩子和 MCP 服务器,进到仓库就能用。目前是早期测试,正文没披露具体定...

推荐理由:xAI 给 Grok 加了个 Build 模式,让它能直接在终端里写代码、跑命令,还支持计划模式、并行派活和无头运行。目前只开放给 SuperGrok Heavy 用户,属于早期测试,功能细节和实际效果正文没展开说。我会先打个折:东西看着挺省钱,但没披露定价和稳定性数据,先别太激动。

AI HOT 精选

让 GPU 别闲着:用异步批处理榨干推理性能

Hugging Face 发现,一个 80 亿参数的模型在生成 8000 个 token 时,GPU 有 24% 的时间在空转。原因出在同步批处理上:CPU 准备下一批数据时,GPU 只能干等,反之亦然。这篇文章讲的是怎么用 CUDA 流把这两件事拆开并行,让 CPU 准备第 N+1 批的同时,GPU 已经在算第 N 批,把空闲缝隙填满。

推荐理由:我会先打个折:这不是新模型发布,是推理系统的工程优化。Hugging Face 给了一个具体的 24% GPU 空闲率,并解释了用 CUDA 流重叠 CPU 与 GPU 工作的机制,对跑线上服务的团队有参考价值,但属于底层技巧而非行业大新闻,所以放在低 featured 档。

The Verge · AI

Edge 浏览器更新:Copilot 能直接读取你所有打开的标签页来回答问题

微软给 Edge 的 Copilot 加了个新能力:它可以跨标签页抓取信息,你问它问题、让它比较商品或者总结文章,它会把所有打开的网页当成自己的资料库来用。这次更新还塞进了 AI 播客、摘要和基于浏览内容出题的小测验。正文没提具体推送时间,只说用户可以自己选要开哪些功能。

推荐理由:微软让 Edge 的 Copilot 能跨标签页读内容,用户打开开关后可以问“这几个商品哪个好”或“把这几篇文章总结一下”。正文没给上线时间,也没说清楚隐私保护的具体机制,所以先别太激动。这个更新有话题性,但执行细节还缺,适合放在 featured 里当个中等体量的产品更新。