跳到正文

#产品更新

今日 25 条

5月19日星期二

AI HOT 精选

Cursor 发布 Composer 2.5 编程模型,长任务效率号称提升十倍

Cursor 推出了 Composer 2.5,一个专门做长代码任务的模型。官方说在连续几十甚至上百步的复杂编程里,效率最高能到之前的十倍。技术上的关键是用了文本反馈来训练,解决了十万 token 级别超长轨迹的学习问题,让模型能稳定跟完一长串指令。底座还是拿 Moonshot 的 Kimi K2.5 继续训出来的。另外 Cursor 宣布要和 Spa...

推荐理由:Cursor 发 Composer 2.5,说长任务效率最高能提 10 倍,背后是用 Kimi K2.5 做二训、处理十万 token 级轨迹。我会先打个折——10 倍是官方说法,没看到独立评测,实际效果还得等用户跑起来再看。但 Cursor 本身是编程工具里的头部产品,这次更新又绑定了 Moonshot 的模型,对开发者选工具和模型都有参考价值。正文没披露二训具体用了多少样本、成本如何,这点先别太激动。整体信息量够、时效性强,给 82 分放在 featured 里合理。

AI HOT 精选

GitHub Copilot 现在能让你在手机或网页上接着 VS Code 里没干完的活

GitHub 给 Copilot 加了个远程控制会话功能。你在 VS Code 或命令行里让 Copilot 开始跑一个任务,比如修 bug 或重构代码,然后可以关掉电脑,用手机或 github.com 网页接着看进度、继续对话或者让它接着干。这相当于把本地开发环境里的 AI 助手会话搬到了云端,随时能接上。正文没提这个功能要不要额外付费,也没说手机端...

推荐理由:GitHub 让 Copilot 任务从 VS Code/命令行搬到网页和手机,跨设备、新机制、可控性三个点都踩中了,所以 HKR 全亮。不过正文只给了入口和场景描述,权限怎么设、要不要额外付费、支持哪些任务类型都没说,实际能用成什么样还得等上线看。

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

AI HOT 精选

百度核心 AI 业务 Q1 营收超 136 亿元,首次占通用业务收入过半

百度发了 2026 年 Q1 数据,核心 AI 驱动业务收入超过 136 亿元人民币,同比增长 49%,连续多个季度在涨。这个数字第一次超过百度通用业务收入的一半,说明 AI 相关收入已经从“添头”变成了主力。增长主要来自 AI 云基础设施、AI 应用和自动驾驶出行平台 Apollo Go。完整财报链接在原文里,正文没拆开各板块的具体数字,所以没法判断...

推荐理由:这条是百度自己发的财报口径,只给了总收入数字和占比,没拆各块业务(比如智能云、Apollo Go)各自贡献多少,也没提利润率。所以“AI 收入过半”这个结论先打个折——它更像一个对外叙事信号,而不是一份能细拆的账本。对从业者来说,知道百度 AI 商业化在加速就够了,但别拿这个数字直接对标其他厂的收入结构。

彭博科技

百度 AI 收入首次超过萎缩的传统广告

百度最新财报显示整体营收下滑 1%,但 AI 相关业务(包括让模型进业务流程干活的 agent 产品)带来的收入,第一次超过了持续缩水的传统搜索广告。这是个标志性节点,说明百度的收入结构正在换轨。不过正文没披露 AI 业务的具体收入数字、利润率,也没说 agent 产品到底落地到什么程度、有多少客户在付费。这点先别太激动,目前只能确认趋势,没法判断质量。

推荐理由:百度整体收入跌了 1%,但 AI 销售额头一回压过传统广告,这个转折点本身就值得从业者看一眼。我会先打个折:正文没披露 AI 和广告各自卖了多少钱,也没说清楚所谓 agent 转向到底怎么落地,所以信息缺口很明显。这点先别太激动,但信号本身够硬,放在 featured 低分段合理。

AI HOT 精选

Grok 现在能直接看懂你上传的视频了

Grok 新增了视频理解功能,你可以把整个视频文件丢给它,让它实时分析画面、总结内容、做翻译、解释场景或提取关键上下文。它不只是看单张图片或读文字,而是能理解完整的视频。马斯克这条推文没提视频时长上限、支持哪些格式,也没说这个功能是全员推送还是灰度测试。

推荐理由:Grok 这次更新把视频理解加进来了,能上传整段视频做分析、总结、翻译和解释场景,对多模态产品来说是个实打实的进步。我会先打个折:正文没写支持多长的视频、什么格式、是不是全量上线,这些关键信息都缺着。所以虽然功能本身有看点,但只能按中等偏上的产品更新来处理,先别太激动。

机器之心 · 公众号

openJiuwen 开源了 JiuwenSwarm,一个多智能体协作框架,主打让一群模型像蜂群一样分工干活

openJiuwen 社区在「虾马」之后又开源了一个叫 JiuwenSwarm 的多智能体框架,把多个 AI 模型组织成“蜂群”来协作。框架拆成四块:Agent Swarm 管智能体编队、Swarm Skills 管技能包、Swarm Skills Hub 是技能市场、还有一套自进化机制让技能自己迭代。他们拿 PinchBench 跑了个分,Jiuwe...

推荐理由:我会先打个折:openJiuwen 不是一线实验室,这篇又缺复现细节和基线对比,所以分数停在 78。但 HKR 三项都踩中了——“养蜂”说法有传播力,四个组件加 PinchBench 94.2% 给了硬信息,开源蜂群架构对做智能体编排的人确实有吸引力。正文没披露许可证和复现配置,这点先别太激动。

AI HOT 精选

腾讯把设计工具 Ardot 开放公测,说句话就能出可编辑的 UI 稿,还能直接转成代码

腾讯云上线了自家的 AI 设计工具 Ardot,定位是给产品、设计和开发用的协作平台。核心功能就两个:一是用一句话描述就能生成 App 页面、官网、海报这类可编辑的设计稿,支持调用团队自己的组件库来保证风格统一,也能直接导入 Figma 文件接着改;二是设计稿可以一键转成代码,把变量、组件、布局这些细节数据直接拉进 CodeBuddy 这类 IDE 里...

推荐理由:这条消息本身够具体,产品形态和输出物都交代清楚了,所以 H/K/R 全过。但正文没提模型能力、生成稿的还原度、代码质量、定价和实际用户反馈,这些缺口让它的重要性只能停在 73 分这个位置。我会先打个折,别因为“一键转代码”就过度激动,等有实测数据再调权重。

AI HOT 精选

阿里云上线 HappyHorse 视频模型,一条提示词直接出 1080p 多镜头视频

HappyHorse 现在可以在阿里云 Model Studio 上用了。它主打从文字描述一步生成 1080p 的多镜头视频,官方说法是“电影级”画质。目前有个限时 8 折活动,但正文没写原价是多少、模型参数量多大、可用区域和有效期,也没给技术细节或对比评测。我会先打个折:效果到底怎么样,得自己跑几条片子才知道。

推荐理由:HKR 三项都过了:模型名字和 1080p 多镜头让标题有钩子,上线渠道、核心功能和折扣信息都给了,成本与竞争角度也踩中从业者关注点。但价格、参数量和评测都没披露,信息厚度一般,所以卡在 featured 门槛上。

AI HOT 精选

Grok 上线“技能”功能,教它一次偏好就能跨对话记住

xAI 在 5 月 18 日给 Grok 加了个“技能”功能,覆盖网页、iOS 和安卓。你可以把格式偏好、工作流步骤或常用规则教给 Grok 一次,之后所有对话都会自动沿用,不用每次重复。内置了生成 Word 文档、PPT 幻灯片、Excel 表格和 PDF 的技能,开箱即用;不满意可以自己覆盖。还能通过对话或上传文件新建自定义技能,做完的格式和流程可...

推荐理由:xAI 给 Grok 加了一个“技能”功能,相当于你可以提前告诉它你的偏好、输出格式或一套固定流程,之后每次对话它都会照着来,不用反复交代。跨网页和手机端都能生效,这点对日常用的人挺省事。我会先打个折:正文没写这个功能是免费还是付费、能存多少条规则、会不会跟已有的系统指令冲突。目前看是个实用的更新,但实际好不好用还得看上线后的限制和稳定性。

AI HOT 精选

Cursor 发布 Composer 2.5,用文字反馈教模型改掉坏习惯,合成数据规模翻了 25 倍

Cursor 把代码助手 Composer 升级到了 2.5 版,底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事:一是用“文字反馈强化学习”,在模型犯错的地方直接插一句提示(比如“提醒:可用工具有这些”),让模型在那个点上学会纠正,而不是靠最后的总分去猜哪里做错了;二是把合成训练数据的量提到了上一代的 25 倍,并且动态生成更...

推荐理由:HKR 三项都踩中了:Cursor 本身就是编程助手的核心入口,文章又给了 Moonshot 基座、25 倍合成数据、文本反馈 RL 和分片 Muon 这些实打实的训练细节。我会先打个折——正文没给基准测试、没提价格,也没说用户端能力边界,所以分数卡在 78–84 这个区间是合理的。

Google DeepMind

Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景 grounding 能力,用户可选取美国地点并搭配风格与角色生成世界。

推荐理由:原文说明 Genie 接入 Street View 真实影像后,智能体和机器人可在贴近现实的虚拟环境中训练与导航。

Google DeepMind

Google Antigravity 2.0 发布

Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列。原文未披露版本功能、参数或可用性细节。

5月17日星期日

彭博科技

苹果 iOS 27 会给 Siri 加一个独立 App,聊天记录会自动删除

彭博社爆料 iOS 27 会有一个类似 ChatGPT 的 Siri 独立应用,核心卖点是聊天记录会自动清理。文章没提保留多久、什么时候上线,也没说具体功能细节。另外 Siri 这次可能还是挂着“Beta”标签,同时 Genmoji(AI 生成表情)也会升级。

推荐理由:我会先打个折:标题很抓人,但正文能落地的料太少。Bloomberg 这篇把 Siri 往 ChatGPT 方向靠,还强调聊天会自动删,隐私角度确实能引起讨论。可翻遍正文,只说了 iOS 27 会有 Genmoji 升级,自动删除的保留多久、什么时候上线、Siri 本身怎么改,全都没披露。这点先别太激动,信息缺口摆在那。不过对做 AI 的人来说,苹果在隐私和功能之间怎么取舍,本身就是个长期看点,所以还是值得扫一眼。

Google DeepMind

Google DeepMind 推出 Gemini for Science 科学工具集

Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。

推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请的科学工具,读者可据此判断智能体科研的落地形态。

Google DeepMind

Google 在 Search、Gemini、Chrome 和 Pixel 扩展内容溯源与验证工具

Google 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明度与验证工具,并深化行业合作。SynthID 已为超过 1000 亿张图片和视频、60000 年音频嵌入水印,Gemini 应用中的 SynthID 验证已被使用 5000 万次,该能力今日扩展到 Search、未来几周进入 Chrome。

推荐理由:原文列出 SynthID 与 C2PA 在 Search、Gemini、Chrome、Pixel 的落地范围,可据此判断内容溯源工具的可用边界。

量子位 · 公众号

一只机器狗,把英伟达的算力王座拱翻了

蔚蓝科技发了款消费级机器狗 BabyAlpha A3,用六颗芯片搭了个异构计算集群,直接在本地跑 7B 参数的大模型,推理速度到 280 TPS。视觉上配了 6600 万像素的摄像头,每秒能扫出 223.2 万个点云数据点,计划第三季度上市。不过正文因为环境验证没抓到具体内容,上面这些数字都来自外部摘要,实际表现和定价还没法核实。

推荐理由:我会先打个折:正文是单篇产品发布稿,没披露功耗、价格和对比基准,所以别太激动。但这条消息确实有料——蔚蓝科技在机器狗里塞了6颗芯片搭异构集群,本地跑70亿参数模型,推理速度标到280TPS,Q3就要上市。对做端侧部署和机器人的人来说,这等于给“离了英伟达行不行”提供了一个实物样本。信息缺口也很明显:没写具体芯片型号、没给功耗数据、没说明280TPS是在什么精度和batch size下测的,这些都会影响实际可用性。综合来看,角度抓人、事实具体、但验证信息不足,放在featured门槛上刚好。

AI HOT 精选

Grok Imagine 图像生成上线 X,所有用户都能用,但没公布模型参数和收费

Grok Imagine 在 X 上开放给所有人了,用他们最新的文本到图像模型,能生成写实风格的高质量图片,支持多种宽高比。正文没提模型参数量、是否收费、有没有地区限制,也没给生成速度或样本对比。我会先打个折:功能是开了,但关键信息全缺,别急着当主力工具。

推荐理由:我会先打个折:正文只说了能用、能调比例,模型参数、价格、地区限制一概没提,所以别当完整评测看。但 Grok 把生图直接嵌进 X 的时间线,等于在社交场景里抢了 Midjourney 和 DALL·E 的入口,从业者会盯着两点——一是生成质量和审核尺度,二是这功能到底免不免费、能撑多久。

AI HOT 精选

MagicPath 直接嵌进 Codex 当画布用,拖拽 UI 就能实时出代码

MagicPath 的 CEO 演示了把自家工具直接跑在 Codex 里,不再需要 Figma 和 IDE 两头切。用户在 Codex 里贴一条命令就能装好,然后像拖积木一样摆界面,Codex 会实时感知项目结构并自动生成、修改代码。演示里没提复杂交互和状态管理能覆盖到什么程度,但至少常规 UI 搭建看起来省掉了一轮导出导入的折腾。

推荐理由:MagicPath 把可拖拽的设计画布塞进了 Codex,一条命令配好就能用,拖完 UI 直接出代码。演示看着挺顺,但正文只给了一条视频,没提支持哪些框架、权限怎么控、复杂项目里能不能复现。我会先打个折:想法好,落地证据还薄,先当 featured 里偏轻的一条。

5月16日星期六

AI HOT 精选

Codex 现在能遥控多台电脑,ChatGPT 里切项目就能换设备

Codex 通过 ChatGPT 不仅能连一台电脑,还能直接控制另一台,多设备管理不用来回切换客户端,在 ChatGPT 里换个项目就能拿到对应设备的上下文和文件。推文里还提到支持远程 SSH 去设置其他虚拟机,多机协作的灵活度上了一个台阶。不过正文没披露延迟表现和权限隔离细节,实际用起来稳不稳还得看后续反馈。

推荐理由:这条更新让 Codex 从“陪你聊代码”往“替你上手操作”迈了一步,多设备远程控制和项目级上下文切换是实打实的机制,不是概念包装。我会先打个折:目前只有一条 X 上的简短预告,没有官方发布页、定价、权限模型,也没有可复现的演示,信息密度偏薄。所以重要性给到 76、放在 featured 里是合适的——有料,但别急着当成熟产品看。

AI HOT 精选

OpenAI 在 IPO 前夜大洗牌:Brockman 接管所有产品,三大业务线合并,全力押注一个能自己干活儿的桌面超级应用

OpenAI 把 ChatGPT、Codex 和 API 三个原本各自为战的团队合并成一个产品组织,由总裁 Greg Brockman 正式接管产品战略。ChatGPT 原负责人 Nick Turley 被调去管企业业务,消费者端换上了前 Instagram 副总裁。这次重组的目标是集中力量搞一个代号“Super App”的桌面应用,把聊天、写代码和还...

推荐理由:HKR 三项都成立:这是 OpenAI 顶层产品重组,覆盖 ChatGPT、Codex 和 API。正文只有一条摘要,信息量不算深,但属于当天必须写的新闻。Anthropic 估值 9000 亿美元这个数字正文没给出处,我会先打个折,不把它当核心事实用。

量子位 · 公众号

Codex 接上 HeyGen 插件,用自然语言就能生成和剪辑数字人视频

OpenAI 的 Codex 现在能直接调用 HeyGen 插件,你给它一段文字指令,它就能生成带数字人、字幕的视频,还能做剪辑。文章里测了一个大概一分钟的数字人视频,试了把 10 秒后的内容剪掉,以及删掉第 8 秒的一次眨眼动作。正文没披露生成延迟和具体成本,也没说剪辑精度到底有多高,所以“不用开剪辑软件”这个说法先打个折看。

推荐理由:我会先打个折:这只是 Codex 接了一个 HeyGen 插件,不是模型或平台级发布,所以分数卡在 74 这个 featured 区间。文章好处是给了三个带时间点的实测,不是纯吹牛,能看出它能干什么、干得怎么样。正文没披露生成延迟和失败率,这点先别太激动。整体对做 agent 和工具链的人有参考价值,但范围就一个插件工作流,别当成视频剪辑要被颠覆了。

量子位 · 公众号

阿里健康给医生做了个新工具“青灵子”,把 BMJ 顶刊十年全文和循证流程塞了进去

阿里健康发布了一款叫“青灵子”的医疗 AI,目标用户是中国 500 万医生。它直接拿了 BMJ 集团旗下 70 本期刊过去十年的全文内容做知识底子,不是只搜摘要。回答问题时,模型会按 PICO 框架(把临床问题拆成患者、干预、对照、结局)和 GRADE 证据分级来走流程,相当于先框定问题结构再给答案,而不是自由发挥。产品还拉了 300 多位临床专家做审...

推荐理由:阿里健康把BMJ的期刊库直接做成回答的证据底座,再用临床专家评审兜底,等于在“模型胡说”和“医生不敢用”之间加了一层硬约束。正文没披露评审通过率、更新频率和实际延迟,这些会直接影响医生愿不愿意买单。我会先打个折:方向对,但落地效果还得看真实诊疗场景的反馈。

Computing Life · Share · 鸭哥调研

OpenAI 通过 Plaid 让 ChatGPT 能读你的银行流水了

ChatGPT 在美国向 Pro 用户开放了个人理财功能预览,通过 Plaid 连接银行账户后,能读取余额、交易记录和投资持仓,回答消费和储蓄问题。文章指出,OpenAI 的隐私承诺存在两个关键缺口:理财对话未被列入广告敏感话题排除清单,意味着消费和贷款讨论可以触发广告匹配;财务数据的模型训练默认是 opt-in,用户需主动关闭。作者认为,这个功能的主...

推荐理由:我会先打个折:正文只说了 OpenAI 通过 Plaid 让 ChatGPT 连接银行账户,没披露上线时间、授权流程和可访问的数据范围,所以这更像一个信号而不是一个可评估的产品更新。但信号本身够强——让模型直接碰银行数据,权限和安全的坑一个都不少,从业者看到标题就会想点进去看细节。HKR 三项都踩中了,只是信息缺口把分数压在 featured 档,没往上走。

AI HOT 精选

Runway 推出 Agent,一次对话就能把产品图变成完整广告片

Runway 新上线的 Agent 功能,让你在同一个对话窗口里,上传产品照片、给点想法,它直接吐出一条制作完成的广告。官方帖子没提背后用的是哪款模型、怎么收费、能生成多长的视频,也没说目前开放了哪些地区。我会先打个折:如果它真能省掉剪辑和合成的环节,对做短视频广告的团队来说挺省钱,但实际效果和可控性还得看上手之后的表现。

推荐理由:Runway 这个广告生成 Agent 在 HKR 三项上都踩中了,但属于中等体量的产品更新。我会先打个折:正文没写用了什么模型、怎么收费、生成一支广告要多久、哪些地区能用,信息缺口不小。所以它够得上 featured,但还不到必须写一篇的程度。

The Verge · AI

OpenAI 想让 ChatGPT 直接读你的银行流水

OpenAI 预告了一个新功能,让 ChatGPT 通过 Plaid 连接用户的银行账户,Plaid 在美国对接了 1.2 万家金融机构。OpenAI 说每月有超过 2 亿人用 ChatGPT 问财务问题,但正文没披露这个功能什么时候正式上线。我会先打个折:连上之后,ChatGPT 就能看到你的信用卡欠款和消费明细,隐私风险不小,官方目前也没说清楚数据...

推荐理由:OpenAI 让 ChatGPT 通过 Plaid 直接读银行数据,不是只聊聊天了。1.2 万家机构接入意味着覆盖面很广,2 亿月活用户问金融问题说明需求确实大。但正文没给上线时间,也没说清楚读到的账户数据会不会被模型记住或用于训练,这点先别太激动。金融场景出错成本高,责任怎么划现在还看不到。

TechCrunch · AI

OpenAI 推出个人理财版 ChatGPT,能直接连你的银行账户看资产和开销

用户绑定银行账户后,可以在一个面板里看到投资组合表现、日常支出、订阅服务和待付账单。正文没披露支持哪些银行、在哪些地区上线、是否额外收费,也没说明账户安全怎么保障。

推荐理由:H 分高是因为 ChatGPT 从聊天工具跨到个人理财,动作够大;K 有实打实的功能点,不是概念稿;R 则把隐私和金融竞争风险摆上台面。正文没写支持哪些银行、在哪些地区上线、收不收费,这些缺口让判断只能停在低 P1 档,我会先打个折,等更多细节再调整。

5月15日星期五

r/LocalLLaMA

用 Jetson Orin NX SUPER 16GB 做了个完全离线的行李箱机器人,跑 Gemma 4 E4B,没联网也能聊

一个叫 Sparky 的行李箱机器人,核心是一块 Jetson Orin NX SUPER 16GB 的板子,跑的是 Gemma 4 E4B 模型(Q4_K_M 量化版,用 q8_0 做 KV 缓存)。首次响应延迟大概 200 毫秒,生成速度每秒 14 到 15 个 token,上下文窗口 12K。身上挂了 30 多个传感器,但没装 WiFi、蓝牙和蜂...

推荐理由:这是个 Reddit 上的个人项目帖,不是产品发布或论文,所以放在低 featured 档。我会先打个折:200ms 的缓存首 token 延迟和 14-15 tok/s 的生成速度,在 Jetson 上跑 4B 模型算是能用的水平,但别指望它反应飞快。30+ 传感器听起来唬人,正文没细说都是什么传感器、怎么融合的,这点先别太激动。真正有意思的是全离线跑 Gemma 4 E4B 还让机器人带“观点”,把本地推理做成了人格化交互,比单纯报参数好玩。

MIT Technology Review · AI

中国竖屏短剧正在变成 AI 内容流水线,WHO 的全球健康目标要落空了

今年 1 月,中国平均每天上线 470 部 AI 生成的竖屏短剧。制作周期从几个月压到几周,成本砍掉了九成。剧本走向也越来越依赖播放数据,而不是编剧。这个模式正在快速复制到海外,同时也在改写编剧和摄制组的工作方式。另一条消息:WHO 最新报告显示,全球多项健康指标在倒退——2024 年新增 130 万 HIV 感染者,疟疾反弹,美洲疫苗接种率下滑,42...

推荐理由:MIT科技评论这篇把中国AI短剧流水线的产量、周期和成本数字都摆出来了,HKR三条全中。故事偏应用层,不是底层模型或产品发布,放在featured档刚好。

MIT Technology Review · AI

中国竖屏短剧正在变成 AI 内容流水线

中国短剧公司已经把 AI 全面塞进整部剧的制作里了。DataEye 的数据显示,2026 年 1 月平均每天有 470 部 AI 生成的短剧上线。FlexTV 的副总裁说,以前拍一部剧从构思到剪辑要三四个月,现在用 AI 不到一个月就能搞定;在北美拍一部剧的成本大概 20 万美元,AI 能把这个数字砍掉 80% 到 90%。像 Kunlun Tech ...

推荐理由:这篇不是模型发布或平台更新,而是产业现场报道,用 DataEye 的数据把 AI 短剧的产量和成本压缩讲得很清楚。我会先打个折:正文没披露具体技术栈和模型细节,所以分数停在 80 不往上拉。HKR 三项都踩中了——钩子是内容工厂,知识是实打实的周期和成本数字,共鸣点落在从业者最敏感的饭碗和规模冲击上。

阿里技术 · 公众号

阿里发布 Qoder 1.0,从 AI 写代码工具升级成能自己干活儿的开发工作台

阿里推出了 Qoder 1.0,支持 Windows、macOS 和 Linux。这次最大的变化是它不再只是一个帮你补全代码的编辑器,而是加了一个叫 Quest 的独立工作区,能让多个智能体同时跨项目跑任务。团队知识引擎可以把项目文档、代码库变成可检索的上下文,省得你反复解释。新增的 Experts 模式内置了规划、调研、写码、审查、测试五个角色,试图...

推荐理由:阿里把 Qoder 从写代码工具推到了让智能体自己干活的工作台,加了独立任务视窗、跨项目并行和团队知识库,听着像给开发团队配了几个能记住项目上下文的 AI 同事。正文没披露定价、跑分或任务成功率,所以实际省不省事、稳不稳定还不好说,先当一次有料的产品更新看。

AI HOT 精选

Codex 进了 ChatGPT 手机版,可以不在电脑前写代码了

OpenAI 把 Codex 塞进了 ChatGPT 的手机应用里,现在能直接在手机上写和跑代码。正文没说是 iOS 还是安卓都能用,也没提功能砍了多少、要不要付费、什么时候全量推。我会先打个折:目前只是预览版,稳定性和完整度都别抱太高期待。

推荐理由:OpenAI 官方产品更新,HKR 三项都踩中了,但正文信息很薄。没写支持哪些手机系统、功能开到什么程度、收不收费、什么时候推,所以只能放在 featured 这一档。我会先打个折:移动端编程体验听着新鲜,实际能不能用、好不好用,全看后续放出的细节。

AI HOT 精选

Databricks 把 GPT-5.5 接进企业智能体工作流,在 OfficeQA Pro 上首次突破 50% 准确率

Databricks 通过自家的 AI Unity Gateway,把 GPT-5.5 用在了 AgentBricks 和 Agent Supervisor API 搭建的智能体工作流里。在专门考验模型处理扫描件、老旧文件和长文档能力的 OfficeQA Pro 基准上,GPT-5.5 比上一代 GPT-5.4 的错误率降低了 46%,成了第一个准确率...

推荐理由:GPT-5.5 被 Databricks 接进企业智能体工作流,在 OfficeQA Pro 上准确率首次过半,错误比 GPT-5.4 少了 46%。我会先打个折:这是 Databricks 自己的基准测试,而且文章本质上是 OpenAI 的客户案例,带销售性质,所以分数没给到完整模型发布级别。但对企业 AI 团队来说,这条信息在选型和落地判断上确实有参考价值。

AI HOT 精选

xAI 把 Grok 订阅接入了 Nous Research 的开源智能体 Hermes

现在你可以用 Grok 的付费账号,直接在 Hermes Agent 里跑 Grok 4.3 的文字聊天和推理、用语音合成让智能体出声回复,还能让智能体调用 Grok Imagine 生成图片和视频。Hermes 本身是个开源、能自我改进的智能体,可以在电脑、沙盒或 VPS 上持续运行,跨会话积累长期记忆,也能连 WhatsApp、Discord 等消...

推荐理由:这是一次中等体量的产品集成,把 Grok 塞进开源的 Hermes 智能体里,不是旗舰模型发布。有实际可玩性,但冲击力没到当天必看级别,放 featured 刚好。

AI HOT 精选

ChatGPT 给美国 Pro 用户开了个个人理财功能,能连银行账户看账单、做分析

OpenAI 在 5 月 15 日给美国 ChatGPT Pro 用户上线了一个个人理财功能的预览版。你可以通过 Plaid 绑定超过 12000 家金融机构的账户,之后 ChatGPT 会同步并归类你的交易数据,生成一个涵盖投资组合、支出、订阅和待付账单的仪表盘。它还能结合你告诉它的目标、生活习惯和优先级,帮你分析消费模式、做场景推演或规划买房这类大...

推荐理由:OpenAI 在美国给 Pro 用户开了个人理财预览版,用户授权后 ChatGPT 能直接读账户数据做分析。这事我会先打个折——正文没披露合作方是谁、数据怎么存、收费模式也没说,所以实际落地深度还不清楚。但方向很明确:ChatGPT 从聊天往管钱走了一步,一旦涉及真实账户,用户对隐私和出错后果的容忍度会低很多。重要性给 76,因为目前只是 Pro 预览,规模有限,但信号够强。

AI HOT 精选

Claude Code 更新 v2.1.142:后台会话可配置,快速模式默认切到 Opus 4.7

Anthropic 给 Claude Code 命令行工具发了 v2.1.142 版本。这次主要干了两件事:一是新增了 8 个命令行参数,用来控制后台会话的行为,比如可以指定会话闲置多久自动关掉、最多同时跑几个后台任务;二是把 Fast 模式的默认模型从之前的版本升级到了 Opus 4.7,意味着快速模式下模型的理解和生成能力会更强。另外修了 15 个...

推荐理由:这次更新对 Claude Code 用户来说挺实在:Fast 模式默认用 Opus 4.7,省去手动切换的步骤;8 个后台会话标志让配置更细,15 个以上的修复也说明稳定性在补。我会先打个折,毕竟是个小版本号,但改动直接落在编码流程上,对 Anthropic 工具链用户有实际影响,放在 featured 档合理。

Latent Space

AI 原生医疗:1 亿次问诊、每周省 10–20 小时、几分钟搞定预授权

Abridge 这家公司 2018 年就起步了,比 ChatGPT 火起来早了四年多。他们一开始做的事很实在:把医生和病人的对话录下来,自动生成病历草稿,帮医生省掉下班后补病历的“睡衣时间”,每周能省出 10 到 20 小时。现在他们铺得更开了,今年预计要覆盖超过 8000 万次医患对话,进了 250 家美国大型医疗系统,支持 28 种以上语言和 50...

推荐理由:Abridge 的 CEO 和 CTO 出来聊了聊,说今年要支持超过 8000 万次医患对话,覆盖 250 个美国大型医疗系统,医生每周能省下 10 到 20 小时的文书时间,预授权从几天缩到几分钟。这些数字是公司自己报的,不是第三方审计或独立基准测试,所以我会先打个折来看。但 1 亿次就诊这个量级确实少见,说明医疗 AI 不再只是试点项目,已经在规模化跑流程了。文章没披露准确率、漏诊率或患者满意度数据,也没说省钱具体怎么算的,这点先别太激动。整体看,它更像一次公司访谈放出的运营数据更新,不是重大产品发布或独立验证,所以放在低 featured 档。

AI HOT 精选

Codex 现在能挂脚本、发令牌,把代码助手塞进自动化流程里

OpenAI 给 Codex 加了两样东西:一是“钩子”,可以在任务的关键节点跑自定义脚本,比如提交前自动验代码、扫密钥、记日志,或者按仓库做定制行为;二是面向商业和企业版的“程序化访问令牌”,从 ChatGPT 工作区设置里就能创建,带权限范围、可设过期或撤销,方便接入 CI/CD、发布流水线和内部自动化,使用记录也会归到对应工作区。正文没提这些令牌...

推荐理由:Codex 这次更新是把自动化从对话界面往工程流程里塞:钩子能在任务检查点跑脚本,程序化令牌给商业和企业团队接 CI/CD、发布和内部自动化用。我会先打个折——正文没披露权限粒度、令牌怎么计费、钩子执行失败怎么回滚,这些缺口让实际落地成本还看不清。但方向很明确,就是让模型进开发管线干活,不是只聊天。

彭博科技

马斯克的 xAI 发布首个编程助手 Grok Build,直接对标 Anthropic

xAI 推出了 Grok Build,一个能直接参与软件开发流程的 AI 编程助手,目标直指 Anthropic 的 Claude。目前公开信息很少,正文没披露定价、能用哪些代码编辑器、性能跑分,也没说什么时候正式开放。

推荐理由:H 和 R 都成立:xAI 跳进编程 Agent 这个坑,还点名 Anthropic,对开发者来说是个明确的竞争信号,话题够。但 K 不成立,因为正文除了说有个叫 Grok Build 的东西能写代码,别的什么都没给——价格、开放范围、跑分全缺,信息量撑不起一篇硬核更新。整体只能算中等偏轻的产品消息,我会先打个折,别太激动。

The Verge · AI

OpenAI 把桌面端写代码工具 Codex 塞进了 ChatGPT 手机 App

OpenAI 宣布 Codex 会集成到 ChatGPT 的手机 App 里。Codex 原本是桌面端工具,能写代码、操控你电脑上的其他应用,现在在手机上也能用了。这次更新是冲着 Anthropic 的 Claude Code 去的,OpenAI 为了追赶砍掉了 Sora 视频生成等“支线项目”,集中精力做企业生意和桌面“超级应用”。不过正文没提手机端...

推荐理由:OpenAI 把 Codex 塞进了 ChatGPT 手机 App,算一次中等体量的产品更新。我会先打个折:正文只说了能写代码、能操控电脑应用,但上线时间、价格、支持哪些应用全都没提,这点先别太激动。HKR 三项都过——手机端 coding agent 的钩子够直接,操作应用的声称是新的具体信息,也戳中了开发者日常和同类产品抢分发入口的神经。信息缺口明显,所以重要性停在 featured 地板,不往上拔。