跳到正文

#产品更新

今日 25 条

5月5日星期二

量子位 · 公众号

豆包在 App Store 挂出三档付费订阅,最高 500 元/月,但还没正式开卖

豆包在苹果商店列出了 68 元、200 元和 500 元三档月费订阅,同时保留免费基础版。字节跳动回应说具体信息以后续官方渠道为准,目前付费功能还没上线。豆包 App 今年 4 月日活超过 1.4 亿,到 3 月模型日均调用量超过 120 万亿 token。正文没披露各档位具体解锁哪些能力,也没说正式收费时间,这点先别太激动。

推荐理由:我会先打个折:付费入口还没开,官方也只说正式上线会发完整信息,所以现在看到的只是App Store露出的价格牌,具体每档给多少配额、解锁什么模型都没披露。但光这三档价格和免费版并存的信号,就已经把字节在豆包上的商业化试探摆上台面了。日活1.4亿、日均120万亿tokens这两个数字说明底子够厚,有底气试收费。不过500元那档到底卖什么,正文没写,这点先别太激动。

r/LocalLLaMA

MTPLX 让苹果芯片跑大模型快了一倍多,原生 MTP 推理引擎来了

一个叫 MTPLX 的推理引擎在 MacBook Pro M5 Max 上把 Qwen3.6-27B 的生成速度从每秒 28 个 token 提到了 63 个 token,快了 2.24 倍。测试用的是 4-bit MLX 量化,温度 0.6,top_p 0.95,top_k 20,最佳推测深度 D3。关键点是它直接用了模型自带的 MTP 头做推测解码...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,测试范围也限定在 Apple Silicon,验证面还窄。但 2.24 倍的吞吐提升是实打实的数字,而且 MTP heads 内置在模型里,不用额外加载一个 drafter 模型占内存,这点对 Mac 用户确实挺省钱。正文没披露更多模型或硬件的对比数据,所以先放在 featured 低位,等有更广的复现再往上调。

OpenAI News

OpenAI 给 ChatGPT 广告加了自助下单和按点击付费

OpenAI 开始在美国小范围测试自助广告后台,广告主可以直接注册、充值、上传素材、管理投放。同时新增了按点击付费(CPC)的出价方式,之前只有按千次展示付费(CPM),现在广告主可以只为用户点击买单。文章说 ChatGPT 对话里很多人正在做决策,点击能说明广告确实帮到了用户。测量工具也加了转化 API 和像素追踪,能看广告带来的购买、留资、注册等后...

推荐理由:OpenAI 把 ChatGPT 广告做成可自助采买的工具了,上线了 beta 版广告管理器,支持按点击付费,还补了测量工具。官方强调广告和对话数据是分开的,不会拿聊天记录去投广告。但正文没披露价格、投放范围,也没说什么时候全面开放,所以先打个折,这还是个中等体量的产品更新,别当重大商业化节点来读。

5月4日星期一

r/LocalLLaMA

Gemma 4 E2B 在 8GB 安卓手机上跑得动,还搭了个本地语音笔记 App

一位 Reddit 用户把 Gemma 4 E2B(2.4GB 模型)塞进 8GB 内存的 OnePlus CE 5 手机里,做了个完全离线的语音笔记应用。流程是:Whisper Small(244MB)先把语音转成文字,Gemma 4 E2B 再负责把文字拆成笔记并打标签。录一段 10 到 15 秒的语音,从转录到出结果总共花 12 到 15 秒。搜...

推荐理由:这是 Reddit 个人项目帖,不是官方发布,但信息量够。作者把 Whisper Small 转写和 Gemma 4 E2B 分类都塞进手机,还搭了检索管道(查询扩展、多路全文搜索、RRF 融合,可选 Gemma 重排,超时 15 秒回退),工程细节比很多官方 demo 实在。我会先打个折:没提功耗、发热和长时间稳定性,12-15 秒延迟对语音笔记算可用但不算快。如果是真的,2.4GB 模型在 8GB 手机上跑通整套流程挺省钱,对想做离线 AI 应用的人有参考价值。

r/LocalLLaMA

Intel 和 AMD 联手推 x64 新指令集 ACE,一次能算 1024 次乘法,但没硬件、没功耗、没发货时间

这篇帖子想讨论新的 x64 指令扩展能不能缓解 AI 硬件短缺,但 Reddit 原文被屏蔽了,看不到具体讨论。根据现有摘要,Intel 和 AMD 公布的 ACE 扩展用 2D 瓦片寄存器和外积算法,每时钟周期能做 1024 次乘法,对比现在 AVX 的 64 次,纸面吞吐量直接翻了 16 倍。不过先别太激动——目前没有任何 ACE 硬件上市,功耗、...

推荐理由:HKR 三项都站得住:切入点把 CPU 指令集改动和 AI 硬件荒挂上了钩,有反差;技术细节给了吞吐量倍数和实现机制,不是空谈。分数没给更高,是因为正文自己说了——支持 ACE 的硬件还没发布,功耗、框架适配、量产时间全是空白,现在只能当个技术预告看,别太激动。

5月2日星期六

Hacker News 首页

SimplePDF 推出 AI 填表助手,PDF 解析和填写全在浏览器里完成

SimplePDF 发布了一个叫 Copilot 的演示,能让你用聊天的方式填写 PDF 表单。它把 PDF 的解析、渲染和字段识别都放在浏览器本地跑,文件不会上传到服务器。默认接的是 DeepSeek V4 Flash 的代理,也支持你自己带 API 密钥、用云端模型或者接 LM Studio 本地模型。正文说 SimplePDF 现在月活用户超过 ...

推荐理由:HKR 三项都成立:审判式冲突来自“AI 填表但不上传文件”的设定;事实层面给出了 20 万月活、本地解析和蒸馏机制,不是空泛宣传;治理和竞争伦理的神经被触动,因为客户端工具调用绕开了传统 SaaS 的隐私风险。不过目前只是产品演示,没有裁决或平台级发布,所以重要性停在 74 分、featured 档位是合理的。

Hacker News 首页

Spotify 给真人音乐人加“已验证”绿标,用来和 AI 账号区分开

Spotify 开始给符合“真实性标准”的艺人打上绿色对勾和“Verified by Spotify”标识,帮用户分辨账号背后是真人还是 AI。验证条件包括关联社交账号、稳定的听众数据、有周边或演出信息等,官方说听众常搜的艺人里超过 99% 都会拿到这个标,覆盖几十万人。但正文没披露具体审核流程、申诉机制,也没说怎么处理那些不用巡演和周边的小众独立音乐...

推荐理由:Spotify 开始给人类艺人贴 Verified 徽章,标题说就是为了跟 AI 音乐划清界限。我会先打个折——正文只有 RSS 片段,怎么验证、覆盖多少人、什么时候上线、审核标准是什么,全都没说。这点先别太激动,信息缺口太大。但话题本身够敏感,涉及版权、艺人身份和 AI 标注,容易引发行业争论,所以给了 featured 和 72 分。

5月1日星期五

The Verge · AI

微软在 Word 里塞了个法律 AI 助手,想让律师放心把合同交给它审

微软发布了一个叫 Legal Agent 的 Word 插件,专门帮法律团队审合同。它会按你预设的规则手册(playbook)逐条检查条款,还能直接处理文档里的修订痕迹。这个功能来自微软收购的 Robin AI 团队。不过正文没披露具体定价和推送范围,所以实际用起来贵不贵、什么时候能用上还不清楚。

推荐理由:微软把 AI 塞进 Word 给律师用,不是写泛泛摘要,而是按法律实务流程干活——对照内部 playbook 审条款、处理修订记录。这点比通用 copilot 更具体,但正文没披露价格、上线范围和客户验证,所以先打个折,放在 featured 低段。

r/LocalLLaMA

Reddit 网友用 16 台 DGX Spark 攒了个集群,跑通 434GB 大模型

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机,单链路跑到 100–111 Gbps,总带宽约 200 Gbps,所有节点都跑满了线速。这次测试的重点是统一内存:8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型,接下来他还...

推荐理由:H、K、R 三项都成立:帖子是第一手集群实测数据,网络条件和模型运行情况都交代清楚了,434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件,所以重要性落在 72–77 这个区间,没到产品发布级别。

新智元 · 公众号

OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手

OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...

推荐理由:HKR 三条全中。OpenAI Codex 这次不是补代码,是直接上手操作 Mac,集成 Slack、Google Workspace 和 Microsoft 365,等于把 agent 塞进日常办公软件里。Mike Russell 的实测给了具体数字:8 分钟跑完音频修复、Photoshop 封面和 Firefly 视频生成,效果 85—90 分,虽然只有单信源,但 OS-agent 这个方向本身就够重,P1 没毛病。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

FT · 科技

华为 AI 芯片在中国大卖,英伟达却卡住了

这篇是付费墙后面的文章,正文没披露具体订单金额、芯片型号和交付时间。从标题看,核心信息是华为接到了国内科技公司的大笔 AI 处理器订单,而英伟达因为出口管制在中国市场动弹不得。这背后反映的是中国算力供应链正在被迫转向国产替代,但文章本身没给出更多细节来支撑这个判断,先别太激动。

推荐理由:FT 的信源和华为 vs Nvidia 的中国市场角力,让 H 和 R 都站得住。但 K 这边确实虚:金额、型号、交付节点一概没给,所以分数只能压在 78–84 这个区间,别因为标题冲高。

NVIDIA 博客

NVIDIA 说 OpenClaw 开源智能体项目 60 天拿了 25 万星,但治理成本才是真问题

NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...

推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...

TechCrunch · AI

OpenAI 一边吐槽 Anthropic 搞限量,一边也给自家安全工具 Cyber 上了门禁

OpenAI 要把 GPT-5.5 Cyber 先推给“关键网络防御人员”,普通用户暂时用不上。这个工具能做渗透测试、漏洞发现和利用、恶意软件逆向,相当于帮公司找安全漏洞的武器库。Sam Altman 之前还嘲笑 Anthropic 对 Mythos 搞限量是“恐惧营销”,现在自己用了同一招。正文没披露具体的申请门槛、定价和全面开放时间,想用的人得先填...

推荐理由:我会先打个折:正文只有 RSS 摘要,能确认的就是 GPT-5.5 Cyber 会搞分级访问,先给安全圈子里的人用。至于谁算“关键网络防御者”、要不要付费、什么时候轮到普通用户,这些全没披露。真正值得盯的不是 Cyber 本身有多强,而是 OpenAI 在安全工具上也开始玩分批放量,这跟它之前批评 Anthropic 的姿势放在一起看,就有点意思了。如果是真的为了安全可控,那可以理解;但如果只是换个说法控节奏,那这波操作就挺双标。

TechCrunch · AI

谷歌把 Gemini 助手装进了几百万辆车里

谷歌宣布 Gemini 会逐步替换掉车机里原来的 Google Assistant,首批覆盖的是内置谷歌服务的车型。官方说法是能让车载语音对话更自然、更聪明,但正文没披露具体用了哪个版本的 Gemini 模型、哪些功能会先上、什么时候推完,也没提要不要额外收费。这点先别太激动——目前看更像是一次品牌升级和底层模型切换,实际体验能好多少还得等实车评测。

推荐理由:标题说 Gemini 要上车,规模是“数百万辆”,听着挺唬人。但正文基本就是一句话新闻,没给车型、没给时间、没给功能细节,也没说要不要额外收费。我会先打个折:这事方向对,但落地信息太少,现在激动还太早。对从业者来说,知道 Google 在铺车载渠道就够了,具体怎么打、打不打得赢,还得等后续。

TechCrunch · AI

Stripe 推出 Link 数字钱包,AI 代理也能用它花钱

Stripe 在年度大会上发布了 Link,一个能绑卡、银行账户、订阅和加密钱包的数字钱包。它不只是给人用,还允许你授权 AI 代理(比如帮你订票、买东西的自动化程序)通过审批流程花你的钱。Link 有网页版和 iOS、Android 客户端,可以集中看支出和订阅。但正文没披露代理支付的手续费、额度上限、支持哪些商户,也没说授权边界具体怎么划——这点先...

推荐理由:我会先打个折:正文没披露费率、额度上限和商户覆盖范围,所以实际能用多广还不好说。但让 AI 代理进支付环节这件事,比很多 demo 都实在——它给出了一个具体的控制机制(审批),而不是让模型自己随便刷。这点先别太激动,但方向对,值得盯后续的授权粒度怎么细化。

The Verge · AI

Meta 用“快速致富”风格的广告推销自家 AI 工具

Meta 收购的 Manus 在 Instagram 和 Facebook 上投了一批广告,话术很像“别去打工了,用 AI 躺着赚钱”。广告瞄准的是本地小商家,尤其是那些没有网站或者网站做得很烂的店主,让他们用 Meta 的 AI 工具生成网站。Manus 还花钱请创作者在 Instagram、YouTube 和 TikTok 上发推广内容,其中一些 ...

推荐理由:The Verge 挖出 Meta 花 20 亿美元买的 Manus,在投广告教人用 AI 快速赚钱。套路是找没网站或网站很烂的本地商家,AI 自动建站再电话推销。Manus 还付钱让创作者运营社媒账号,部分 TikTok 账号被问后就下架了。这不是产品发布,是调查报道,但把平台自己搞 AI 垃圾生意的链条扒得很清楚,对行业名声打击不小。

4月30日星期四

MIT Technology Review · AI

Goodfire 发布 Silico,一个能让你像调试代码一样调试大模型内部参数的工具

Goodfire 推出了一款叫 Silico 的工具,让工程师可以在训练过程中直接查看和调整模型的参数,也就是决定模型行为的那些“旋钮”。它能把模型里的神经元和通路画成地图,比如他们在 Qwen 3 里发现一个神经元,激活后模型回答会变成电车难题式的道德困境。Silico 用智能体自动完成了大量原本需要人工做的可解释性工作,目标是让模型开发少点炼丹味,...

推荐理由:HKR 三项都成立:Silico 给出了一个可操作的机械可解释性调试手段。分数停在 76,因为目前只是一家创业公司的产品预览,正文没披露定价,也没有任何实际部署规模或客户数量的数据,所以我会先打个折,不往更高里推。

Ben's Bites

搭东西变简单了:Cloudflare 让 AI 能自己买域名部署,Stripe 给 AI 发了钱包

Ben 这期聊的是工具链在变,他最近迷上了 Codex 应用,用自然语言指挥 AI 写了个恐龙跳跳游戏、搭了套 Gmail 自动分类系统。重点在后面的产品更新:Cloudflare 现在允许 AI 代理自己创建账户、买域名、拿 API 令牌并部署,人只需要最后点个头,中间那些繁琐的后台配置被包装成了 AI 能读懂的接口。Stripe 在 Session...

推荐理由:这是一篇产品线索汇总,不是单一重磅发布,但 Cloudflare 和 Stripe 把代理权限落到了开户、支付、部署这些硬环节上,我会先打个折放在 featured 低段。正文没披露具体延迟或成本数字,如果是真的,代理跑通账号和支付流程确实省钱省事,但权限敞口也大,这点先别太激动。

彭博科技

三星芯片部门利润暴增 48 倍,全靠 AI 数据中心抢内存

三星电子芯片部门在 2026 年第一季度利润同比翻了 48 倍,创下历史新高并超出市场预期。这波增长直接来自 AI 数据中心对内存的疯狂采购,导致供应紧张。不过正文没披露具体的利润金额、是哪种内存(比如 HBM 还是普通 DRAM)以及主要客户是谁。

推荐理由:三星半导体部门一个季度利润翻了48倍,这个涨幅放在任何行业都算炸裂。我会先打个折:正文没写具体赚了多少钱,也没说是哪类内存(HBM还是普通DRAM)在拉动,客户是谁也一概没提。所以这条消息的价值在于信号——AI数据中心在疯狂下单,内存供给可能进一步收紧。如果是真的,对做推理优化和硬件采购的团队来说,成本压力会更大。Bloomberg的报道本身可信度不低,但信息缺口明显,我维持74分,不往上调。

TechCrunch · AI

微软说 Copilot 付费用户超过 2000 万,但没讲清楚大家到底怎么用

微软 CEO 纳德拉在财报会上说,嵌在 Word、Excel 和 Outlook 里的 M365 Copilot 现在有 2000 万个企业付费席位。这个数字说明愿意掏钱的公司确实在变多,但文章没披露活跃度、留存率、每个用户平均贡献多少收入,也没说这 2000 万是怎么统计的——是买过就算,还是真正在用。所以“他们真的在用”这个说法,目前只能先打个折看。

推荐理由:HKR-K 的强度在于微软罕见地公布了付费用户数,这是市场最缺的采纳证据。但正文只说了用户数和参与度在涨,活跃率、留存、ARPU 和统计方法一概没提,所以分数卡在 featured 门槛附近,没往上拉。

彭博科技

Meta 上调 2026 年资本支出到 1250 亿至 1450 亿美元,股价应声大跌

Meta 把今年的资本开支预期从之前的数字拉高到了 1250 亿到 1450 亿美元,CFO Susan Li 解释是因为零部件涨价和数据中心要多花钱。消息一出股价直接跳水。市场担心的不是这一天的涨跌,而是砸这么多钱搞 AI 模型,什么时候才能看到回报——这个问题正文没给出时间表。

推荐理由:Meta 把全年资本开支预期拉到 1250 亿到 1450 亿美元,CFO 解释是组件贵了、数据中心要多花钱,股价应声下跌。这不是模型或产品发布,而是 AI 投入的经济账信号,所以分数没给到 78 以上。

The Verge · AI

Google 搜索量上季度创历史新高,但没公布具体数字

Alphabet 一季度财报电话会上,CEO Sundar Pichai 说 Google 搜索的查询量达到了“历史最高”,搜索广告收入涨了 19%。他把增长归因于 AI 功能(比如 AI Overviews 那种直接在搜索结果顶部给答案的体验)和 Gemini App 的拉动。另外,YouTube 订阅和 Google One 这类付费服务总订阅数超...

推荐理由:HKR 三项全中:Alphabet 报出搜索查询量历史新高、搜索收入涨 19%、付费订阅破 3.5 亿。但正文没给查询量基数,也没拆 AI Overviews 带来的增量,所以信息有缺口。整体够得上 72–77 分的 featured 档位。

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

彭博科技

Meta 的路易斯安那 AI 数据中心让电力公司 Entergy 追加 140 亿美元,新建 10 座燃气电厂

Entergy 把四年资本开支计划上调了近三分之一,到 570 亿美元,大头是给 Meta 在路易斯安那的数据中心供电。新增的 140 亿美元主要用来建燃气电厂,一共要上 10 座。报道没提这些电厂的总装机容量和投产时间,所以暂时没法判断对当地电价和碳排放的具体影响。Meta 急着要稳定电力,直接跳过电网自己拉专线,这种操作在 AI 大厂里越来越常见,...

推荐理由:这条消息本身够硬——Meta 一个数据中心的用电需求,就让 Entergy 把四年投资计划直接拉高近三分之一,多掏 140 亿美元建天然气电厂。我会先打个折:正文没披露电站具体容量和投运时间,所以没法判断这钱花得划不划算、什么时候能缓解供电压力。但光是这个数字就说明,大模型训练和推理背后的电力账单正在变成基础设施投资的主驱动,不是未来时,是现在进行时。这点先别太激动,但值得放进雷达里让同行看到。

4月29日星期三

r/LocalLLaMA

Mistral 发布 Medium 3.5,开放权重但商用要付费

Mistral 推出了新模型 Medium 3.5,权重开放,用的是修改过的 MIT 许可证——非商业用途免费,商业用途得掏钱买授权。帖子本身因为 Reddit 的反爬机制没抓到正文,所以参数量、跑分成绩、API 价格这些关键信息目前都看不到。光看标题和摘要片段,没法判断它跟上一代比强了多少,也不知道具体适合哪些场景。我会先打个折:等官方技术报告或实测...

推荐理由:Mistral Medium 3.5 标题确认上线,开放权重这点对本地部署是好事,但 modified MIT 许可里商用要付费授权,我会先打个折——正文没给参数量、跑分和具体价格,没法判断性价比。HKR 三项都踩中了:模型发布本身有热度,许可细节是新信息,商用收费又戳到本地模型社区的敏感点。不过信息缺口明显,分数停在 74 合理。

The Verge · AI

ChatGPT 下载量增速放缓,可能给 OpenAI 的 IPO 添堵

Sensor Tower 的数据显示,ChatGPT 的卸载量在 4 月同比上升了 132%,用户要么走了,要么去试了竞品。OpenAI 在 2 月跟五角大楼签了合同后,上个月的卸载率更是暴涨了 413%。月活用户的增速也从 1 月的 168% 掉到了 4 月的 78%。

推荐理由:HKR 三项都站得住:钩子是 ChatGPT 增长踩刹车 vs IPO 的故事张力,知识来自 Sensor Tower 的卸载和月活增速数据,相关性直接打在行业对 OpenAI 增长质量和用户流失的焦虑上。分数没给更高,因为数据源是第三方移动端估算,不是 OpenAI 自己的财报或产品发布,我会先打个折。

X · @op7418(歸藏)

DeepSeek 多模态模型全量上线,网页版识图模式能用了

DeepSeek 把多模态模型全量推上线了,现在打开网页版就能用识图模式。从体验看,这应该是一个独立的多模态模型,不是把图片转文字再丢给纯文本模型那种拼接方案。正文没披露模型名字、参数量、定价和 API 开放时间,这些关键信息都还缺着,想接进自己流程的朋友得再等等。

推荐理由:我会先打个折:这条消息本身够重磅,DeepSeek 的多模态终于从传闻变成可试用的东西了。但正文只确认了网页版识图入口,模型叫什么、多大、多少钱、什么时候上 API 全都没说,信息密度其实挺薄的。HKR 三条都踩中了,不过来源只有一条 X 帖,验证不够硬,所以分数压在 78–84 这个区间是合理的。这点先别太激动,等 API 和 benchmark 出来再重新评估。

新智元 · 公众号

谷歌翻译 20 岁,劈柴哥说它换了四代 AI,现在能直接听懂语气了

劈柴哥发帖庆祝谷歌翻译上线 20 年,月活用户到了 10 亿。他梳理了背后的四代技术:最早是统计机器翻译,2016 年换成神经网络翻译,后来用上 PaLM 2 大模型,2024 年一口气加了 110 种语言。最新的是 Gemini 2.5 Flash 的原生音频翻译,不再先把语音转文字再翻译,而是直接处理声音,能保留原话的语调、停顿和节奏。劈柴哥形容这...

推荐理由:核心事件是谷歌翻译过生日和架构回顾,不是新品发布,但 10 亿月活、110 种语言扩增和原生语音翻译的细节撑得起 featured 档位。我会先打个折,因为正文没给出原生语音功能的具体上线时间或实测数据,这点先别太激动。不过它点到了语音 AI 产品眼下最纠结的问题:级联管线 vs. 原生多模态,所以值得从业者看一眼。

量子位 · 公众号

DeepSeek 多模态模型开始灰度测试,能识别图片里的饮料和杯子

DeepSeek 研究员确认 V4 视觉版已经在灰度测试,官网首页上线了图片识别入口。一张截图显示,模型花了 4 秒识别出一张文字不多的图片里的饮料种类和杯子类型。正文没披露灰度覆盖范围、API 是否开放以及定价,所以能不能用上、花多少钱还不清楚。

推荐理由:HKR 三项都站得住:DeepSeek V4 视觉灰度测试是实打实的国内旗舰更新,有截图和 4 秒思考样本。分数维持 80,因为正文没披露开放范围、API 怎么接、价格和跑分,信息缺口不小,先别太激动。

量子位 · 公众号

生数科技认领了那个神秘登顶的机器人模型,叫 MotuBrain,在两项评测里拿了高分,还放了个三台机器人接力干活的演示

4 月中旬有个叫 MotuBrain 的模型在 WorldArena 和 RoboTwin2.0 两个榜单上突然登顶,生数科技在 4 月 29 日认领了它。RoboTwin2.0 的干净环境和随机干扰环境分别拿了 95.8 和 96.1 分。演示里用三台不同的人形机器人接力完成了五项任务,核心是一套叫“世界动作模型”的设计,把视频、动作和语言用混合专家...

推荐理由:我会先打个折:分数和 Demo 都来自公司自己,没有独立部署数据,所以 82 分不往上调。但悬念认领加三台机器人实物演示,H 轴直接拉满;RoboTwin2.0 双场景高分和三流 MoT 架构把 K 轴撑实了;视频公司跨进具身智能这条线,R 轴也站得住。整体判断没变,三个轴都过,分数保持。

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

TechCrunch · AI

微软独家协议刚结束一天,AWS 就把 OpenAI 模型搬上了 Bedrock

OpenAI 和微软修改协议、不再有独家授权后,亚马逊隔天就在 AWS 的 Bedrock 服务里上线了 OpenAI 最新模型、代码工具 Codex,以及一个叫 Bedrock Managed Agents 的新东西,专门用来搭 OpenAI 驱动的 AI 智能体。亚马逊说这只是“更深合作的开头”,但正文没披露具体上了哪些模型、怎么收费、在哪些区域可...

推荐理由:我会先打个折:正文只说了 AWS 要卖 OpenAI 产品,连具体模型名都没列,所以重要性停在 78 是合理的。真正值得盯的是分发渠道从 Azure 独占转向多云,这对企业采购和云厂商竞争格局都有影响。agent 服务被点名,说明 OpenAI 在推让模型进业务流程干活的产品,但没细节就先别太激动。

彭博科技

苹果要在 iOS 27 和 macOS 27 里重做照片编辑,主打 AI 修图

彭博社这篇报道的正文被付费墙挡住了,只抓到了标题和一段机器人验证页面,所以具体功能、用了什么模型、支持哪些机型、什么时候上线,正文都没披露。从标题看,苹果准备在系统自带的照片 App 里塞进一批 AI 编辑工具,关键词是“扩展、增强、重新构图”,听起来像是能自动补全画面边缘、提画质、帮你重新裁切构图。RSS 提要里提了一句这是为了跟安卓阵营的 AI 修...

推荐理由:消息来自 Bloomberg,可信度还行,而且照片编辑是系统自带的高频功能,所以 hook 和 reach 都成立。但 knowledge 这块确实撑不起来——功能细节、模型方案、上线时间全是空白,只能给到 featured 的底线分 72。

The Verge · AI

Claude 现在能直接操控 Photoshop、Blender 和 Ableton 了

Anthropic 给 Claude 装上了“创意连接器”,让它能直接读写 Adobe 全家桶、Affinity、Blender、Ableton 和 Autodesk 这些专业软件。以 Blender 为例,Claude 可以帮你排查 3D 场景哪里出了问题、写自定义工具,还能批量修改一堆物体的属性。另外,Anthropic 还给 Blender 基金...

推荐理由:HKR 三项都成立:Claude 进入主流创作软件是明确的跨工具钩子,连接器覆盖广且 Blender 端有具体操作能力,这件事踩中了 agent 进入专业工作流的神经。正文没提价格和完整上线地区,所以先别太激动,但方向本身值得关注。

NVIDIA 博客

英伟达发布 Nemotron 3 Nano Omni:一个模型同时看懂图文、听懂语音,做 AI 代理时吞吐量号称是同类 9 倍

英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni,一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构(MoE),实际激活的参数量是 3B,配合 Conv3D 和 EVS 技术来处理音视频,上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下,跑 A...

推荐理由:NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里,还开放了权重和训练技术。我会先打个折:9 倍效率提升是跟谁比、测什么任务,正文没细说,这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置,加上直接上 Hugging Face 和 OpenRouter,对想用开源方案搭多模态 agent 的团队确实省事。单信源,信息够用但不算独家,所以放在 featured 里。

4月28日星期二

X · @claudeai

Claude 现在能直接操作 Blender,在聊天窗口里改 3D 场景

Claude 上线了 Blender 连接器,你可以在对话里让它帮你排查场景问题、写新工具,或者批量修改所有物体。正文没提这个功能是免费还是付费、支持哪些版本,也没说清楚 Claude 在 Blender 里的操作权限边界——它能改到什么程度、会不会误删东西,这些都得等实测才知道。

推荐理由:HKR 三项都过:Claude 接 Blender 是 Agent 往专业工具里伸了一只真能干活的手,不是概念图。正文没提版本、定价和上线范围,所以重要性停在 76,够 featured 但不到必写。我会先打个折——没看到实际跑起来的延迟和权限边界,这点先别太激动。

Ben's Bites

GPT-5.5 来了,价格翻倍但号称省 token,Cursor 跟 SpaceX 搞了个大单

OpenAI 发了 GPT-5.5,比上一代贵了一倍,单 token 价格甚至略高于 Claude Opus 4.7。但他们说新模型 token 效率提升了 40%,所以实际跑一个任务的成本没怎么变,Ramp 的测试也印证了这点。Ben 自己用下来觉得模型在“思考:低”模式下又快又聪明,已经把它设成默认了。另外 Claude 的托管代理记忆功能开始公测...

推荐理由:这是一篇通讯汇总,不是一手发布,所以分数不会顶到 95 以上。但三条消息都够硬:GPT-5.5 的定价和效率数字能让人直接算账,Claude 记忆功能公测意味着外挂记忆开始进生产流程,Cursor 的收购选择权更是把编程工具的价值拉到一个新量级。我会先打个折,因为正文没展开技术细节,比如 40% 效率提升是在什么场景下测的、记忆功能有没有延迟数据,这些缺口让信息停留在“值得关注”而不是“可以立刻决策”的层面。整体对 AI 从业者来说,信息密度高、不水,给 89 分合理。

Hacker News 首页

GitHub Copilot 的代码审查功能将从 2026 年 6 月 1 日起消耗 Actions 分钟数

GitHub 发了条计费变更通知:从 2026 年 6 月 1 日起,Copilot 的代码审查功能会开始消耗你账户里的 GitHub Actions 分钟数。以前这个功能只算在 Copilot 自己的额度里,现在等于要双重计费——Copilot 那边按新出的 AI 点数算,跑审查任务本身还要再吃一份 Actions 的时长。私有仓库会先从你套餐里包含...

推荐理由:这是 GitHub 官方对 Copilot 代码审查的计费规则调整,把审查消耗从隐形变成显性,直接打到 CI 配额和团队发票上。HKR 三项都满足,但它本质是定价规则而非新能力发布,所以重要性放在 72–77 这个区间。

Computing Life · Share · 鸭哥调研

Anthropic 发布 9 个创意工具连接器,让 Claude 直接操控 Blender、Photoshop 等软件

Anthropic 在 4 月 28 日发布了 Claude for Creative Work,包含 9 个连接器,让 Claude 能直接调用 Blender、Adobe 全家桶、Ableton 等专业软件的后端接口干活。用户用自然语言下指令,Claude 就能在软件里执行操作,比如在 Blender 里生成带空间关系的 3D 场景。这件事本身不是...

推荐理由:Anthropic 这次不是发模型,是给 Claude 接了 9 个创意工具的连接器,相当于让模型直接操作设计软件。文章自己提了个三层框架来看这事靠不靠谱:工具有没有可编程接口、中间有没有连接协议层、最后能不能形成感知评估的闭环。我会先打个折——正文没披露具体接了哪些工具,也没说开放到什么程度,所以实际能跑通多少还不好讲。真正值得盯的是 feedback loop 那层,如果模型能收到设计输出的反馈再自己调整,才算进了创意流程的脑子,不然还只是高级点的批处理。这点先别太激动,等名单和接入方式出来再看。