跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 361–380 条 · 共 842 条

5月19日星期二

AI HOT 精选

Claude Code 快速模式默认切到 Opus 4.7,/fast 命令已可用

Claude Code 的快速模式现在默认跑在 Opus 4.7 上,输入 /fast 就能切过去。正文只提了调用方式,没写价格、上下文窗口多大、速率限制和灰度条件,这些实际用起来的关键信息都还缺着。

推荐理由:HKR 三项都成立,因为 Claude Code 把快速模式的默认模型换成了 Opus 4.7,而且给了明确的 /fast 调用路径。但价格、上下文长度、调用限额这些关键信息正文全没提,所以分数压在 72–77 这个区间。我会先打个折:知道换了什么,但不知道换完要花多少钱、能用多久,这点先别太激动。

AI HOT 精选

Qwen 3.7 预览版

通义千问发了条推,标题是 Qwen 3.7 预览版,但正文是空的。没写参数量多大、上下文窗口多长、什么时候能用、怎么访问、收不收费,也没给模型卡和跑分数据。目前只能当个预告看,具体信息得等后续公布。

推荐理由:H 和 R 都过了,因为 Qwen 3.7 预览版这个信号对旗舰模型竞争确实有分量。但 K 过不了:正文是空的,没披露任何技术细节或访问方式,读者看完只知道有个名字,没法判断实际进展。所以整体停在 featured,等有干货再升级。

r/LocalLLaMA

llama.cpp 合并 MTP 投机解码,Qwen3.6 27B 在 Strix Halo 上跑到 2.44 倍速

llama.cpp 在 PR #22673 里正式合并了 MTP(多 token 预测)投机解码支持。实测 Qwen3.6 27B 用 Q8_0 量化,在 Strix Halo 上从 7.4 tok/s 提到 18.1 tok/s,速度翻了 2.44 倍;双 RTX 3090 的 Q8_0 方案也从 25.7 tok/s 涨到 55.9 tok/s,约...

推荐理由:HKR 三项都满足:llama.cpp 合入了 MTP 投机解码,用 Qwen3.6 27B 在 Strix Halo 和 RTX 3090 上跑出了实打实的加速数字。范围限定在本地推理优化,不是大模型发布,78 分放在 featured 合适。

Hacker News 首页

我们让四个 AI 去开电台,半年后一个满嘴黑话,一个最会赚钱

Andon Labs 给 Claude、GPT、Gemini 和 Grok 各 20 美元启动资金,让它们自己买歌、排节目、接听众电话、拉广告,全自动运营四家网络电台。跑了半年,Claude 的电台账上剩 104.8 美元,是唯一赚钱的;Gemini 的 DJ 从最有人情味的主播变成了复读机,一天能把“Stay in the manifest”这句空话...

推荐理由:H 分高是因为 AI 开电台这个设定自带反差,加上收入惨淡,故事性够。K 分有 4 agent 的实操细节,但收入数据没披露,我会先打个折。R 分落在 agent 商业化和媒体自动化上,从业者会关心。整体是实验室博客,不是当天硬新闻,放在 featured 刚好。

AI HOT 精选

Claude 控制台能看缓存为什么没命中了

Anthropic 在 Claude 控制台加了个提示缓存诊断功能。现在请求没命中缓存时,你可以直接看到是提示里哪一段内容变了,以及这次变动多烧了多少 token。

推荐理由:Anthropic 给 Claude 控制台加了个缓存诊断,缓存没命中时会标出提示词里哪段变了,还告诉你因此多花了多少 token。对经常调提示词、抠成本的开发者来说,这比靠猜或翻日志快得多。我会先打个折:这只是个控制台功能,不是模型或 API 层面的改动,所以重要性到不了重大发布那档。但它的确把缓存调试从黑盒变成了可视化的东西,实用度够上 featured。

AI HOT 精选

Cursor 发布 Composer 2.5 编程模型,长任务效率号称提升十倍

Cursor 推出了 Composer 2.5,一个专门做长代码任务的模型。官方说在连续几十甚至上百步的复杂编程里,效率最高能到之前的十倍。技术上的关键是用了文本反馈来训练,解决了十万 token 级别超长轨迹的学习问题,让模型能稳定跟完一长串指令。底座还是拿 Moonshot 的 Kimi K2.5 继续训出来的。另外 Cursor 宣布要和 Spa...

推荐理由:Cursor 发 Composer 2.5,说长任务效率最高能提 10 倍,背后是用 Kimi K2.5 做二训、处理十万 token 级轨迹。我会先打个折——10 倍是官方说法,没看到独立评测,实际效果还得等用户跑起来再看。但 Cursor 本身是编程工具里的头部产品,这次更新又绑定了 Moonshot 的模型,对开发者选工具和模型都有参考价值。正文没披露二训具体用了多少样本、成本如何,这点先别太激动。整体信息量够、时效性强,给 82 分放在 featured 里合理。

AI HOT 精选

GitHub Copilot 现在能让你在手机或网页上接着 VS Code 里没干完的活

GitHub 给 Copilot 加了个远程控制会话功能。你在 VS Code 或命令行里让 Copilot 开始跑一个任务,比如修 bug 或重构代码,然后可以关掉电脑,用手机或 github.com 网页接着看进度、继续对话或者让它接着干。这相当于把本地开发环境里的 AI 助手会话搬到了云端,随时能接上。正文没提这个功能要不要额外付费,也没说手机端...

推荐理由:GitHub 让 Copilot 任务从 VS Code/命令行搬到网页和手机,跨设备、新机制、可控性三个点都踩中了,所以 HKR 全亮。不过正文只给了入口和场景描述,权限怎么设、要不要额外付费、支持哪些任务类型都没说,实际能用成什么样还得等上线看。

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

AI HOT 精选

百度核心 AI 业务 Q1 营收超 136 亿元,首次占通用业务收入过半

百度发了 2026 年 Q1 数据,核心 AI 驱动业务收入超过 136 亿元人民币,同比增长 49%,连续多个季度在涨。这个数字第一次超过百度通用业务收入的一半,说明 AI 相关收入已经从“添头”变成了主力。增长主要来自 AI 云基础设施、AI 应用和自动驾驶出行平台 Apollo Go。完整财报链接在原文里,正文没拆开各板块的具体数字,所以没法判断...

推荐理由:这条是百度自己发的财报口径,只给了总收入数字和占比,没拆各块业务(比如智能云、Apollo Go)各自贡献多少,也没提利润率。所以“AI 收入过半”这个结论先打个折——它更像一个对外叙事信号,而不是一份能细拆的账本。对从业者来说,知道百度 AI 商业化在加速就够了,但别拿这个数字直接对标其他厂的收入结构。

彭博科技

百度 AI 收入首次超过萎缩的传统广告

百度最新财报显示整体营收下滑 1%,但 AI 相关业务(包括让模型进业务流程干活的 agent 产品)带来的收入,第一次超过了持续缩水的传统搜索广告。这是个标志性节点,说明百度的收入结构正在换轨。不过正文没披露 AI 业务的具体收入数字、利润率,也没说 agent 产品到底落地到什么程度、有多少客户在付费。这点先别太激动,目前只能确认趋势,没法判断质量。

推荐理由:百度整体收入跌了 1%,但 AI 销售额头一回压过传统广告,这个转折点本身就值得从业者看一眼。我会先打个折:正文没披露 AI 和广告各自卖了多少钱,也没说清楚所谓 agent 转向到底怎么落地,所以信息缺口很明显。这点先别太激动,但信号本身够硬,放在 featured 低分段合理。

AI HOT 精选

Grok 现在能直接看懂你上传的视频了

Grok 新增了视频理解功能,你可以把整个视频文件丢给它,让它实时分析画面、总结内容、做翻译、解释场景或提取关键上下文。它不只是看单张图片或读文字,而是能理解完整的视频。马斯克这条推文没提视频时长上限、支持哪些格式,也没说这个功能是全员推送还是灰度测试。

推荐理由:Grok 这次更新把视频理解加进来了,能上传整段视频做分析、总结、翻译和解释场景,对多模态产品来说是个实打实的进步。我会先打个折:正文没写支持多长的视频、什么格式、是不是全量上线,这些关键信息都缺着。所以虽然功能本身有看点,但只能按中等偏上的产品更新来处理,先别太激动。

机器之心 · 公众号

openJiuwen 开源了 JiuwenSwarm,一个多智能体协作框架,主打让一群模型像蜂群一样分工干活

openJiuwen 社区在「虾马」之后又开源了一个叫 JiuwenSwarm 的多智能体框架,把多个 AI 模型组织成“蜂群”来协作。框架拆成四块:Agent Swarm 管智能体编队、Swarm Skills 管技能包、Swarm Skills Hub 是技能市场、还有一套自进化机制让技能自己迭代。他们拿 PinchBench 跑了个分,Jiuwe...

推荐理由:我会先打个折:openJiuwen 不是一线实验室,这篇又缺复现细节和基线对比,所以分数停在 78。但 HKR 三项都踩中了——“养蜂”说法有传播力,四个组件加 PinchBench 94.2% 给了硬信息,开源蜂群架构对做智能体编排的人确实有吸引力。正文没披露许可证和复现配置,这点先别太激动。

AI HOT 精选

腾讯把设计工具 Ardot 开放公测,说句话就能出可编辑的 UI 稿,还能直接转成代码

腾讯云上线了自家的 AI 设计工具 Ardot,定位是给产品、设计和开发用的协作平台。核心功能就两个:一是用一句话描述就能生成 App 页面、官网、海报这类可编辑的设计稿,支持调用团队自己的组件库来保证风格统一,也能直接导入 Figma 文件接着改;二是设计稿可以一键转成代码,把变量、组件、布局这些细节数据直接拉进 CodeBuddy 这类 IDE 里...

推荐理由:这条消息本身够具体,产品形态和输出物都交代清楚了,所以 H/K/R 全过。但正文没提模型能力、生成稿的还原度、代码质量、定价和实际用户反馈,这些缺口让它的重要性只能停在 73 分这个位置。我会先打个折,别因为“一键转代码”就过度激动,等有实测数据再调权重。

AI HOT 精选

阿里云上线 HappyHorse 视频模型,一条提示词直接出 1080p 多镜头视频

HappyHorse 现在可以在阿里云 Model Studio 上用了。它主打从文字描述一步生成 1080p 的多镜头视频,官方说法是“电影级”画质。目前有个限时 8 折活动,但正文没写原价是多少、模型参数量多大、可用区域和有效期,也没给技术细节或对比评测。我会先打个折:效果到底怎么样,得自己跑几条片子才知道。

推荐理由:HKR 三项都过了:模型名字和 1080p 多镜头让标题有钩子,上线渠道、核心功能和折扣信息都给了,成本与竞争角度也踩中从业者关注点。但价格、参数量和评测都没披露,信息厚度一般,所以卡在 featured 门槛上。

AI HOT 精选

Grok 上线“技能”功能,教它一次偏好就能跨对话记住

xAI 在 5 月 18 日给 Grok 加了个“技能”功能,覆盖网页、iOS 和安卓。你可以把格式偏好、工作流步骤或常用规则教给 Grok 一次,之后所有对话都会自动沿用,不用每次重复。内置了生成 Word 文档、PPT 幻灯片、Excel 表格和 PDF 的技能,开箱即用;不满意可以自己覆盖。还能通过对话或上传文件新建自定义技能,做完的格式和流程可...

推荐理由:xAI 给 Grok 加了一个“技能”功能,相当于你可以提前告诉它你的偏好、输出格式或一套固定流程,之后每次对话它都会照着来,不用反复交代。跨网页和手机端都能生效,这点对日常用的人挺省事。我会先打个折:正文没写这个功能是免费还是付费、能存多少条规则、会不会跟已有的系统指令冲突。目前看是个实用的更新,但实际好不好用还得看上线后的限制和稳定性。

AI HOT 精选

Cursor 发布 Composer 2.5,用文字反馈教模型改掉坏习惯,合成数据规模翻了 25 倍

Cursor 把代码助手 Composer 升级到了 2.5 版,底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事:一是用“文字反馈强化学习”,在模型犯错的地方直接插一句提示(比如“提醒:可用工具有这些”),让模型在那个点上学会纠正,而不是靠最后的总分去猜哪里做错了;二是把合成训练数据的量提到了上一代的 25 倍,并且动态生成更...

推荐理由:HKR 三项都踩中了:Cursor 本身就是编程助手的核心入口,文章又给了 Moonshot 基座、25 倍合成数据、文本反馈 RL 和分片 Muon 这些实打实的训练细节。我会先打个折——正文没给基准测试、没提价格,也没说用户端能力边界,所以分数卡在 78–84 这个区间是合理的。

Google DeepMind

Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景 grounding 能力,用户可选取美国地点并搭配风格与角色生成世界。

推荐理由:原文说明 Genie 接入 Street View 真实影像后,智能体和机器人可在贴近现实的虚拟环境中训练与导航。

5月17日星期日

彭博科技

苹果 iOS 27 会给 Siri 加一个独立 App,聊天记录会自动删除

彭博社爆料 iOS 27 会有一个类似 ChatGPT 的 Siri 独立应用,核心卖点是聊天记录会自动清理。文章没提保留多久、什么时候上线,也没说具体功能细节。另外 Siri 这次可能还是挂着“Beta”标签,同时 Genmoji(AI 生成表情)也会升级。

推荐理由:我会先打个折:标题很抓人,但正文能落地的料太少。Bloomberg 这篇把 Siri 往 ChatGPT 方向靠,还强调聊天会自动删,隐私角度确实能引起讨论。可翻遍正文,只说了 iOS 27 会有 Genmoji 升级,自动删除的保留多久、什么时候上线、Siri 本身怎么改,全都没披露。这点先别太激动,信息缺口摆在那。不过对做 AI 的人来说,苹果在隐私和功能之间怎么取舍,本身就是个长期看点,所以还是值得扫一眼。

Google DeepMind

Google DeepMind 推出 Gemini for Science 科学工具集

Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。

推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请的科学工具,读者可据此判断智能体科研的落地形态。

Google DeepMind

Google 在 Search、Gemini、Chrome 和 Pixel 扩展内容溯源与验证工具

Google 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明度与验证工具,并深化行业合作。SynthID 已为超过 1000 亿张图片和视频、60000 年音频嵌入水印,Gemini 应用中的 SynthID 验证已被使用 5000 万次,该能力今日扩展到 Search、未来几周进入 Chrome。

推荐理由:原文列出 SynthID 与 C2PA 在 Search、Gemini、Chrome、Pixel 的落地范围,可据此判断内容溯源工具的可用边界。