跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 701–720 条 · 共 842 条

4月10日星期五

X · @OpenAI

OpenAI 给 ChatGPT 加了个 100 美元/月的 Pro 档,主要给 Codex 重度用户用

OpenAI 新设了一个每月 100 美元的 Pro 订阅档,Codex 用量是 Plus 档的 5 倍,适合长时间、高强度的编程任务。这个档位保留了原 Pro 的全部功能,包括专属 Pro 模型以及 Instant 和 Thinking 模型不限次使用。到 5 月 31 日前有个限时活动,Codex 用量临时提到 Plus 的 10 倍。正文没解释为...

推荐理由:OpenAI 给 Pro 加了个每月 100 美元的新档位,核心是把 Codex 用量提到 Plus 的 5 倍,其他 Pro 功能不变。5 月底前有个临时福利,Codex 额度再翻倍到 10 倍,但我会先打个折,这只是限时促销。真正值得盯的是,他们开始把代码代理这种重度用法单独拿出来计费,说明以后高强度用 AI 写代码可能要多掏钱。正文没提新模型或技术突破,所以重要性主要落在定价信号上,对团队预算和工具选型有直接参考价值。

X · @claudeai

Claude Cowork 向所有付费用户开放,企业版加了权限和花费管控

Anthropic 把 Claude Cowork 从测试转成了正式功能,Pro、Team、Enterprise 都能用。企业版这次主要给管理员加了几个控制项:按角色设访问权限、给团队设花费上限、看用量报表,还接入了 OpenTelemetry 方便监控。正文没提具体定价、调用次数上限和推送时间。如果是真的,对想在全公司铺开用的团队来说,管钱管权限会方...

推荐理由:Anthropic 把 Claude Cowork 推给所有付费用户,企业版多了角色权限、分组花钱上限、用量统计和更全的遥测接入。我会先打个折:正文没写价格、配额和具体上线时间,所以别急着算账。真正值得看的是治理那几条腿终于补齐了,但组织级部署的细粒度参数还没亮出来。

4月9日星期四

量子位 · 公众号

Claude 推出托管 Agent 服务,按小时收费,转头就被开源方案 Multica 平替了

Anthropic 上线了 Claude 的托管 Agent 服务,让模型能长时间跑任务、多 Agent 协作,还带沙盒和断点恢复。收费分两块:会话时长每小时 0.08 美元,外加按量计费的 token 消耗;联网搜索每千次 10 美元。部分记忆和编排功能还在研究预览阶段。标题里提到的“封杀龙虾”正文没解释,实际重点是 Anthropic 开始向企业卖...

推荐理由:这是一次有实质内容的 Anthropic 产品更新:托管 Agent 服务带了明确定价、沙箱、检查点恢复和搜索费用,信息密度够,所以 HKR-K 很强。HKR-R 对 Claude 重度团队有真实参考价值,但影响面比模型发布小,因此重要性定在 84、featured 合理。标题提到的“封杀龙虾”正文没展开,这点先别太激动,真正该盯的是 Anthropic 开始把 Agent 基础设施当商品卖。

X · @dotey(宝玉)

Anthropic 发布 Claude Managed Agents,把 Agent 开发的基础设施全托管到云端,现已公测

Anthropic 推出了一套托管 API,让开发者不用自己搭沙箱、管状态、做权限和链路追踪,直接定义任务和工具就能上线生产级 Agent。官方说从原型到上线能从几个月缩到几天。它支持长时间运行的会话(断线不丢进度)和多 Agent 协调(一个 Agent 能拉起其他 Agent 并行干活,后者还在研究预览阶段)。内部测试里,在结构化文件生成任务上,这...

推荐理由:Anthropic 把 Agent 的沙箱环境、长时运行会话和多 Agent 协调打包成一个公测 API,对开发者来说是个实打实的工作流更新。我会先打个折,内部测试的 10 个百分点提升要看具体场景,但 0.08 美元一小时的定价和标准 token 费分开算,成本结构很清晰。正文没披露多 Agent 协调的具体机制和失败案例,这点先别太激动。整体看,这不是一个模型更新,而是一个平台级动作,值得从业者盯一下。

X · @claudeai

Claude 推出托管 Agent 服务公测版,把原型到上线压缩到几天

Claude 平台上线了 Claude Managed Agents 公测版,核心卖点是给了一套调过性能的 agent 运行框架加上生产环境基础设施,号称能把 agent 从原型做到上线的时间压到几天。正文没披露具体怎么收费、支持哪些工具链、能跑什么模型、有没有调用额度限制,这些关键信息都得等后续公布。

推荐理由:Anthropic 这次放出的 Managed Agents 是个公开测试,核心卖点是把 agent 从想法到上线的时间压到几天,对用 Claude 搭业务的人是个直接利好,所以重要性和相关性都过关。但我会先打个折——文章只说了有“性能调优的 agent harness”和配套生产设施,具体怎么收费、支持哪些工具、能跑什么模型、有没有调用上限,一概没写。这点先别太激动,缺的信息恰恰是决定能不能真省钱、真省事的关键。整体看,它解决的是 agent 规模化落地的运维和速度问题,对从业者来说是个实在信号,但落地效果还得等更多细节。

X · @Yuchenj_UW

Meta 放出 Avocado 模型,内部叫 Muse Spark,训练成本比 Llama 4 Maverick 省了十倍以上

Meta 的 TBD 实验室用 9 个月重写了整套预训练流程,做出了 Avocado(对外叫 Muse Spark)。正文说它的能力跟 Llama 4 Maverick 差不多,但训练用的算力不到后者的十分之一。模型没开源,也没公布参数量、跑分成绩和发布时间。这件事真正的看点是训练基础设施的效率,不是改个名字。

推荐理由:我会先打个折:正文没披露参数量、评测集和发布时间,目前只是一条帖文,别当正式发布看。但信息量够硬——TBD lab 用 9 个月重建预训练栈,把训练算力压到 Llama 4 Maverick 的十分之一以下,能力还接近,这对算力成本敏感的人是个信号。Meta 把它叫 Muse Spark,不是开源模型,所以重点不在命名,而在基础设施效率。HKR 全过,给 74 分,因为缺关键参数,验证还弱,但省钱的故事本身够吸引从业者盯后续。

4月8日星期三

量子位 · 公众号

小米放出两个语音生成框架,想让普通人也能当“声音导演”

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音,Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化...

推荐理由:小米放出两套语音框架,核心看点是可控长音频和场景统一建模,一句提示词出混合音频、单次推理能跑10分钟,这两个点确实抓人。技术细节也给了,不是纯画饼。但我会先打个折:基准跑分没给,训练数据多大不知道,开不开源、能不能商用也没说,这些信息缺口让实际价值不好判断。整体有亮点但缺关键验证,放在 featured 低段比较合适。

量子位 · 公众号

DeepSeek 深夜更新网页版,新增快速和专家模式,灰度测试视觉模型

DeepSeek 网页版悄悄加了两个模式:快速模式主打日常对话,专家模式则专攻代码、网页搜索和更难的生成任务。有用户通过对话套话,模型自己说专家模式就是 V4,但官方没发公告,正文也没披露模型 ID、上下文规格、定价和发布时间,这点先别太激动。目前专家模式限量供应,不支持多模态和文件上传,有用户测出上下文上限大约 13.3 万 token。另外,视觉模...

推荐理由:我会先打个折:V4 这个说法目前只有网友实测和模型自述,官方没确认模型名、价格和上下文窗口,这点先别太激动。但文章把能复现的行为讲清楚了——专家模式偏代码和复杂生成、限量、不能传文件,还给了约 133K token 的长度上限,对实际用的人有参考价值。真正该盯的是官方后续会不会补参数和上下文说明,现在信息缺口不小。

X · @dotey(宝玉)

Anthropic 发了 Claude Mythos Preview,跑分断崖式领先,但不公开用,只借给 12 家大厂找漏洞

Anthropic 的新模型 Claude Mythos Preview 在 SWE-bench Verified 上拿到 93.9%,USAMO 数学证明冲到 97.6%,比自家上一代旗舰 Opus 4.6 提升巨大,对比 GPT-5.4 和 Gemini 3.1 Pro 也是全面领先。但 Anthropic 不开放 API 和公开访问,理由是模型自...

推荐理由:这条帖子抓人的点不在跑分第一,而在 Anthropic 把 Mythos Preview 锁死给苹果、微软等 12 家合作伙伴做漏洞挖掘,普通用户和 API 都用不上。我会先打个折:帖子本身是 X 上的二手总结,没贴官方公告链接,也没列全 12 家名单,所以重要性停在 84 不往上提。但 SWE-bench 93.9%、USAMO 97.6% 和 244 页系统卡这些数字够具体,1 亿美元额度和 400 万美元捐赠也说明 Anthropic 在安全分发上下了本钱。对从业者来说,真正该盯的是高危能力被封闭分发这件事,而不是又一个 benchmark 冠军。

X · @AnthropicAI

Anthropic 启动 Glasswing 项目,用新模型 Claude Mythos Preview 找关键软件漏洞

Anthropic 发了个新项目叫 Project Glasswing,专门盯着最关键的软件做安全加固。背后用的是他们最新的前沿模型 Claude Mythos Preview,官方说它找漏洞的能力仅次于最顶尖的人类专家。不过正文没给出具体跑分、测试范围、怎么申请试用,也没说什么时候正式开放,所以实际效果还得等可复现的评测出来再看。

推荐理由:这篇 Anthropic 一手公告,标题和摘要确认了 Project Glasswing 和 Claude Mythos Preview 两个名字,说能力仅次于顶尖人类专家,但正文没披露任何可复现的评测数据、软件范围或接入细节。我会先打个折:真正该盯的是他们后续会不会放出基准分数和第三方验证,现在只能当个方向性信号看。

4月4日星期六

X · @dotey(宝玉)

Anthropic 正式封堵订阅漏洞:Claude Pro/Max 不再给 OpenClaw 等第三方工具买单

Claude Code 负责人 Boris Cherny 发公告,太平洋时间 4 月 4 日中午起,Claude Pro 和 Max 订阅的额度不再覆盖通过 OpenClaw 这类第三方工具产生的用量。想继续在这些工具里用 Claude,要么买打折的用量包,要么用 API Key 按量付费。现有订阅用户会拿到一笔等于月费的一次性补偿,觉得不够的明天邮件...

推荐理由:这不是常规价格调整,是 Anthropic 在收紧第三方 Claude 套壳工具的账单和访问权限。HKR 三项都成立:冲突钩子够硬,截止时间和补偿方案具体,开发者圈子里反响会很大。不过影响范围比发新模型或改产品定位要窄,所以重要性没给更高。

X · @dotey(宝玉)

DeepSeek V4 推迟发布,重写底层代码,就为了跑在华为昇腾 950PR 上

V4 跳票了几个月,原因是 DeepSeek 把模型底层模块重写了一遍,专门适配华为和寒武纪的硬件。现在 V4 能直接跑在华为昇腾 950PR 芯片上,预计几周内发布。这颗芯片单卡算力号称是英伟达 H20 的 2.87 倍,有 112GB 显存,带宽 1.4TB/s,还是国内唯一支持 FP4 低精度推理的芯片。FP4 的好处是大幅压缩显存占用,一个原本...

推荐理由:这条消息 H、K、R 都站得住:华为芯片部署是强钩子,底层重写和芯片规格有料,国产算力替代的话题自带传播。没给更高分是因为这还属于发布前报道,模型规模、价格和实测性能都没披露,我会先打个折。

X · @dotey(宝玉)

Mintlify 给 AI 文档助手造了个假文件系统,启动从 46 秒降到 100 毫秒

Mintlify 把 AI 文档助手的检索方式从向量 RAG 换成了 ChromaFs——一套用数据库查询模拟 grep、cat、ls 的假文件系统。AI 以为自己在一个真实的文件系统里翻文档,实际上每个命令都被拦截翻译成 Chroma 查询。效果是会话启动时间从沙箱方案的 46 秒压到 100 毫秒,每次对话的边际计算成本几乎为零。按他们月均 85 ...

推荐理由:Mintlify 这篇工程博客写得很实在,没有吹概念,而是把方案和取舍摊开来讲。核心思路是把文档页映射成“文件”、章节映射成“目录”,让模型用熟悉的命令行工具去探索,背后实际是数据库查询。效果很直观:启动时间从 46 秒砍到 100 毫秒,边际计算成本接近零。我会先打个折——这个方案强依赖文档本身有清晰的层级结构,正文也承认不适合无层级知识库,所以别把它当成万能 RAG 替代品。但它的真正价值不在省钱,而在检索范式的切换:不是把资料塞给模型,而是让模型自己动手翻。这点对正在折腾 agent 检索链路的人,比单纯跑分更有启发。

4月3日星期五

X · @claudeai

Claude 全系套餐都能直连微软办公三件套了

Anthropic 把 Microsoft 365 连接器开放给了所有 Claude 付费套餐,不再只限高价版本。你可以把 Outlook 邮件、OneDrive 文档和 SharePoint 文件直接拽进对话里,让 Claude 帮你翻邮件、总结文档或从公司资料库里找东西。帖子确认了覆盖范围和对接的应用,但没提权限边界怎么划、管理员要不要额外配置、有...

推荐理由:这是一条中等体量的 Claude 产品更新:Anthropic 把 Microsoft 365 连接器铺到所有方案,改变了 Outlook、OneDrive 和 SharePoint 的实际接入范围。HKR 三项都踩中,但正文没披露价格、权限边界、地区限制和管理后台条件,所以只能放在 featured 低段。我会先打个折——全量放开比加新功能更值得盯,但缺的信息让人没法判断企业能不能直接推。

X · @op7418(歸藏)

阿里发了 Qwen 3.6 Plus,上下文拉到 100 万 token,Agent 和编程能力提升明显

阿里在百炼上线了 Qwen 3.6 Plus,主打 Agent 任务和编程能力,相比 3.5 版有明显提升。图像和文档理解也加强了,数学图像识别、真实世界问答和 OCR 表现都不错。这次默认支持 100 万 token 上下文,最长输出接近 99.1 万 token,输入 6.4 万 token,比之前 256K 的版本开发体验好很多。价格是输入每百万...

推荐理由:阿里放出 Qwen 3.6 Plus,是国内模型一次实打实的更新。HKR 三项都站得住,核心是 100 万上下文和 2/12 元定价这个组合拳,对实际干活的人诱惑很大。但正文没给具体测评分数、对比基线和测试条件,所以先不打最高级,等看到跑分再说。

X · @op7418(歸藏)

谷歌发布 Gemma 4,四个尺寸全 Apache 2.0 开源,主打本地跑 agent 和多模态

Gemma 4 一口气发了四个版本:E2B 给手机和 IoT 用,E4B 给移动端和 Jetson/树莓派,26B MoE 每次只激活 3.8B 参数、延迟低吞吐高,31B 全密集版适合桌面或单卡 H100。这次把 agent 工作流当第一优先级,原生支持函数调用、JSON 输出和系统指令,还直接能处理图像、视频和语音转文本,可以做本地语音助手。全部用...

推荐理由:谷歌发 Gemma 4 是一次有分量的开源模型更新。HKR 三项都成立:26B MoE 只激活 3.8B 的部署弹性够抓人,四个规格和商用许可给了新事实,成本敏感场景的参考价值也明确。分数定在 81 是因为基准、上下文窗口和测试细节都没披露,我会先打个折,这点先别太激动。

X · @claudeai

Claude 的电脑操控功能 Cowork 和 Code Desktop 现在支持 Windows 了

Claude 把电脑操控能力带到了 Windows 上,覆盖 Cowork 和 Code Desktop 两个入口。正文只发了一句话和一条链接,没提支持哪些 Windows 版本、权限怎么管、操作延迟多少、要不要额外付费,也没说什么时候正式推送。对想在 Windows 上跑桌面 agent 的人来说,现在只能知道功能有了,但稳定性和实际跑起来怎么样,这...

推荐理由:Claude 把 computer use 能力从非 Windows 平台扩到了 Windows,标题就这一句事实。正文没披露支持哪些 Windows 版本、权限怎么隔离、操作延迟多少、要不要加钱、什么时候正式上线,这些才是决定能不能在生产环境用的关键。我会先打个折:桌面代理在 Windows 上的稳定性边界还没给可复现条件,别急着全量上。分数维持 74,因为这是官方更新,但信息密度只够确认可用性,离评估还差一截。

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

3月31日星期二

MIT Technology Review · AI

AI 健康工具越来越多,但没人说得清它们到底靠不靠谱

微软上线了 Copilot Health,亚马逊把 Health AI 从 One Medical 会员专属开放给所有人,加上年初 OpenAI 的 ChatGPT Health 和能调取健康档案的 Claude,面向普通人的 AI 健康问答成了大厂标配。微软说 Copilot 每天收到 5000 万个健康问题,需求确实摆在那里,尤其对看病不方便的人群...

推荐理由:这篇文章不是产品发布,而是趋势报道加安全质疑。我会先打个折:微软和 Amazon 都在推消费级健康聊天机器人,但正文没披露任何独立安全评测,六位受访学者也点出这个问题。Mount Sinai 的研究是全文最硬的信息——ChatGPT Health 会误判轻重,说明光靠公司自测基准不够。这点先别太激动,因为研究样本和具体方法正文没展开,但方向值得盯。整体看,信息量够、风险点明确,适合放进 featured。

3月25日星期三

OpenAI News

OpenAI 开了个安全漏洞赏金计划,专门收 AI 滥用和越权操作的问题

OpenAI 在 2026 年 3 月 25 日上线了一个公开的“安全漏洞赏金”计划,跟之前的安全漏洞赏金不同,这次专门盯着 AI 被滥用或绕过安全限制的场景。主要收三类问题:一是智能体(比如浏览器里的 ChatGPT Agent)被第三方提示词注入劫持,导致泄露用户信息或执行有害操作,复现率得超过 50%;二是模型输出里意外暴露了 OpenAI 自己...

推荐理由:这不是模型发布或能力升级,而是一次治理流程更新,所以放在低 featured 档。但 OpenAI 把 AI 安全漏洞悬赏公开化,还划出了代理风险、专有信息泄露这些具体受理项,同时明确排除普通越狱,等于给行业打了个样。我会先打个折:正文没披露赏金金额和实际处理时效,实际效果还得看后续执行。