跳到正文

#产品更新

今日 25 条

5月28日星期四

AI HOT 精选

Google Pay 更新:让 AI 代理替你跑支付流程,安卓端也能一键结账了

Google Pay 这次更新主要干了两件事:一是把支付系统开放给 AI 代理,二是把安卓和桌面端的结账体验做得更顺滑。先说 AI 这块,他们搞了个通用商业协议(UCP),你现有的商户号和支付后台不用动,就能让 AI 代理直接调用支付能力去完成交易。还发了个 MCP 服务器(公开预览版),相当于给开发用的 AI 助手配了个支付插件,能帮你查集成问题、分...

推荐理由:我会先打个折:正文只列了功能点,没给实际采用规模、定价,也没展示一个真实的 agent 交易案例,所以分数卡在 72–77 这个区间。但 MCP 支付这个方向本身够具体,对 agent 商业化的推动力是实打实的,值得放进 featured。

AI HOT 精选

Google 搜索产品 VP 聊 AI 原生搜索:新模式怎么跑、成本多高、出版商怎么办

Robby Stein 在 Google I/O 上谈了搜索正在从列链接转向直接给答案的 AI 原生模式。AI Mode 会把复杂问题拆成多轮搜索去查,背后跑在 Google 自己的 TPU 上,推理成本不低,但正文没给具体数字。搜索量没降反升,这点他提了但没展开数据。关于答案里引用哪些信息源和链接,有一套选择逻辑,但没细说权重。出版商最关心的流量问题...

推荐理由:这是一篇访谈摘要,不是产品发布,所以我会先打个折。HKR 三个维度都踩中了,但正文没披露具体价格、流量数字或成本数据,判断只能停在“高质量访谈”这个区间。文章把 Google 转向 AI 原生搜索的几个矛盾摆得很清楚:想用多轮对话和 AI Mode 留住用户,又得面对 TPU 成本高和出版商怕被截流的现实。信息够硬,但缺量化验证,所以分数给到 74 是合理的。

5月27日星期三

The Verge · AI

Robinhood 开放接口,允许 AI 代理直接帮你炒股

Robinhood 宣布允许用户创建独立账户,划拨一笔钱后,让 AI 代理(也就是能自主执行任务的模型)直接买卖股票。Robinhood 自己也在风险提示里写得很直白:AI 交易可能导致全部本金亏光。正文没披露这个 AI 代理具体是 Robinhood 自研还是第三方模型,也没说交易策略由谁提供。

推荐理由:Robinhood 这次不是开放行情数据,而是直接让 AI agent 进场下单。用户给 agent 单开账户、注入指定资金,agent 就能自主买卖股票。我会先打个折:正文没披露风控细节、回撤限制、交易频率上限,也没说 agent 跑在什么模型上、能不能接外部信号。所以“赚很多或赔很多”目前更像产品定位,不是实测结论。但这件事本身信号很强——交易权限从人移交到 agent,合规和客诉风险会成倍放大。

TechCrunch · AI

ElevenLabs 的新音乐模型能在同一首歌里切换曲风

ElevenLabs 发布了音乐生成模型 Music v2,主打功能是可以在不破坏整首歌的前提下,单独重写其中一段,比如从歌剧直接跳到重金属再跳回来,或者塞一段快嘴说唱。公司说模型在唱腔和编曲上都更复杂了,还能加音效。不过正文没披露上线时间、定价和模型参数,实际效果和版权风险也还没第三方验证,这点先别太激动。

推荐理由:HKR-H/K 通过,因为 ElevenLabs 这次把音乐生成做成了分段可替换、中途可切风格,不是整首重来。我会先打个折:发布时间、定价、模型大小全都没披露,所以行业层面的震动暂时只能算中等。如果是真的,对做音效和配乐的人挺省钱,但先别太激动。

AI HOT 精选

Runway 发布 MCP 服务器,让 Claude、ChatGPT 这类助手能直接在对话框里帮你生图和剪视频

Runway 推出了一个 MCP 服务器,相当于给 AI 助手装了个插件,让 Claude、ChatGPT、Cursor 等工具能在聊天窗口里直接调用 Runway 的模型生成图片和视频。你不用再切换软件,给助手扔一个商品链接、一张参考图或一段文字描述,它就能把成品返回到同一个对话框里。这次接入的模型包括 Gen-4.5、Seedance 2.0、GP...

推荐理由:这条消息的钩子很直接——Runway 的视频能力进了程序员和创作者天天用的对话工具。技术上不是模型突破,而是集成方式变了,MCP 服务器当中间人,让多个模型被一个入口调度。对从业者来说,这比单纯发个新模型更贴近实际工作流,所以 HKR 三项都成立。不过正文没提延迟、并发限制和计费方式,实际体验还得观望。整体算一次产品整合更新,重要性给 76 分,放在 featured 里合理。

TechCrunch · AI

YouTube 开始自动给 AI 视频打标签,不再全靠创作者自觉

YouTube 不再只靠创作者自己申报 AI 内容,现在会用内部系统自动检测并给“用了大量逼真 AI 画面”的视频打上标签。同时标签位置会更显眼,长视频和 Shorts 都适用。不过正文没披露这套自动检测的准确率、误判后怎么申诉、具体什么时候全面铺开,也没说对直播有没有用。

推荐理由:YouTube 不再只靠创作者自己勾选,而是平台主动识别并标注写实 AI 视频,标签也会更醒目。我会先打个折:正文没披露识别准确率、申诉机制和具体铺开范围,所以别急着把它当成完美方案。但这条更新本身是实打实的规则变化,对做视频生成和内容合规的人有直接参考价值。

TechCrunch · AI

Robinhood 开始让 AI 代理替你炒股了

Robinhood 给用户开了个口子:你可以创建一个独立账户,连上一个专用钱包,让 AI 代理(也就是能自己干活的小程序)去读你的持仓、分析行情、出策略、推股票。但下单的钱只能从这个钱包里扣,动不了你主账户里的资金。每笔交易都会推通知,有些单子还得你点一下确认才会执行。正文没披露代理的决策模型具体怎么搭、回测表现如何,也没说风控和止损机制。Robinh...

推荐理由:我会先打个折:Robinhood 不是前沿 AI 实验室,所以这条消息的份量更多在产品落地层面。但它的机制设计很实在——代理能看组合、能分析,但动钱时只能碰你专门划拨的那一小块余额,不是整个账户敞开了让它玩。这点先别太激动,正文没披露代理具体用什么模型、分析能力有多深,但光是“代理+真实资金+预存钱包”这个组合,就足够让做 agent 安全的人盯一阵了。

纽约时报中文网

谷歌怎么从 AI 掉队变成领跑的?

两年前谷歌的 AI 还在建议人吃石头、往披萨上抹胶水,现在它的聊天机器人 Gemini 月活用户已经冲到 9 亿,跟 OpenAI 自报的 ChatGPT 用户数打平。谷歌没把 Gemini 当独立产品养,而是直接塞进 Gmail、地图、Google.com 这些每天被几十亿人用的服务里,连苹果 Siri 未来的底层技术也换成了它,等于 Gemini ...

推荐理由:HKR三项全中。文章用逆袭主线把谷歌从掉队拉到能打的位置,钩子够强;9亿用户、770亿广告收入、Siri合作这些数字和信息量扎实,不是空谈;对从业者来说,模型竞争格局和分发渠道的变动直接关系工作判断,相关性高。整体是产业分析而非模型发布,放在78-84分档合理。

AI HOT 精选

Anthropic 在伦敦发布了两项让 Claude 自己动手干活的新功能:自托管沙盒和 MCP 隧道

Anthropic 在 Code w/ Claude 伦敦活动上宣布了两项 Claude 托管代理的新能力。一个是自托管沙盒,公开测试版,让 Claude 能在你自己的安全环境里跑代码、操作浏览器,不用把敏感数据交给第三方;另一个是 MCP 隧道,研究预览版,相当于给 Claude 开了条加密通道,让它能直接连到你本地或私有网络里的工具和数据源。Spo...

推荐理由:Anthropic 官方产品更新,在伦敦活动上发布了 Claude 托管代理的两项具体能力。我会先打个折:这不是新模型发布,而是开发者工具层面的迭代,所以重要性给到 78。自托管沙箱让代理在隔离环境里跑代码,MCP 隧道则打通了本地工具和云端代理的连接,对实际干活的人比刷榜分数更有用。正文没披露沙箱的安全隔离具体到什么程度,这点先别太激动。

AI HOT 精选

Reachy Mini 机器人现在能完全在本地跑语音对话了

Hugging Face 给 Reachy Mini 机器人配了一套纯本地运行的语音对话方案,数据不用上传云端。他们用 speech-to-speech 库搭了一条流水线:先靠 Silero VAD 检测有没有人在说话,再用 Parakeet-TDT 把语音转成文字,接着交给大模型想怎么回,最后让 Qwen3-TTS 把文字念出来。这套东西通过一个兼容...

推荐理由:HKR 三项都成立:有个清晰的本地机器人语音钩子,技术栈细节给得实在,对边缘端语音代理场景有直接吸引力。范围就限定在 Reachy Mini 的语音交互上,所以放在 featured 档。

AI HOT 精选

TRL 新增增量权重同步:只传模型变化的部分,每步传输量从 1.2GB 降到 20-35MB

异步强化学习训练有个很现实的问题:每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB,换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现,在两次优化步骤之间,大约 99% 的 bf16 权重其实完全没变,真正变动的部分很小。他们合入了 TRL 的一个 PR,做法是把变动的权重打包成稀疏...

推荐理由:Hugging Face 在 TRL 里合了一个增量权重同步的 PR,用稀疏 safetensors 只传变化的部分,Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说,这个压缩比很实在,能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据,所以“万亿参数”目前更像一个能力上限的表述,实际效果还得看后续验证。整体是训练基础设施层面的改进,对从业者有用,但还没到必须全员关注的程度。

TechCrunch · AI

用户不想被硬塞 AI 搜索,DuckDuckGo 安装量涨了 30%

Google 在 2026 I/O 大会上把传统搜索结果页的蓝色链接换成了 AI 代理,直接替用户做决定。用户反弹很快,DuckDuckGo 的 App 安装量跟着涨了 30%,说明不少人开始找别的搜索入口。正文没披露这个 30% 的绝对基数有多大,所以实际规模还不好说。

推荐理由:HKR 三项都踩中了:30% 的安装涨幅是个具体的用户用脚投票信号,直接挂钩 Google AI Search 改版。不过正文没写清楚这个涨幅是多长时间内的、怎么统计的,所以信息有缺口,我会先打个折,放在 featured 里比较合适。

AI HOT 精选

小米 MiMo 2.5 Pro 永久降价,最高砍掉 99%,跟 DeepSeek V4 Pro 一个价

小米把 MiMo-V2.5 系列的 API 价格永久打下来了,最高降了 99%,现在和 DeepSeek V4 Pro 定价持平。花同样的钱,能用的 token 数多了 5 到 8 倍,计费方式也变简单了。老用户之前买的套餐额度会全部重置补满。降价的原因是他们在推理环节做了全栈优化,省下来的成本直接让出来了,具体技术细节后面会发博客。另外 MiMo-V...

推荐理由:HKR 三项都成立:99% 的降幅和直接点名 DeepSeek 同价,话题性够强;降价幅度和生效时间都是硬信息;API 成本压力是从业者每天在算的账。不过这只是调价公告,没有新模型或新能力,所以重要性停在 76 分,不往上拉了。

r/LocalLLaMA

PrismML 放出二值/三值 Bonsai Image 4B:1-bit 文生图扩散模型,浏览器里就能跑

PrismML 发布了 Bonsai Image 4B 的二值和三值版本,把文生图扩散 Transformer 的权重压到 1-bit 或三值,模型体积约 3GB。作为对比,FLUX.2 Klein 4B 大概要 16GB。Reddit 帖子里给了浏览器端 WebGPU 本地运行的 demo 链接,模型用 Apache-2.0 协议开源。不过帖子正文被...

推荐理由:PrismML 这个 Bonsai Image 4B 把文生图 DiT 压到 1-bit 和三值,模型约 3GB,能在浏览器 WebGPU 上完全本地跑,Apache-2.0 开源。我会先打个折:Reddit 信源、实验室发布,实际出图质量和速度还没第三方验证,这点先别太激动。但技术方向上,低比特量化做到浏览器可跑,对本地推理和隐私场景确实挺省钱,所以给 featured 低位。

5月26日星期二

AI HOT 精选

Sundar Pichai 聊 AI 搜索:Google 想把搜索框变成帮你干活的入口

Sundar Pichai 在 Google I/O 后聊了聊公司怎么应对 ChatGPT 的冲击。核心是把 Gemini 模型塞进新的智能搜索框和 Gemini Spark 智能体平台,让搜索从“给你一堆链接”变成“直接帮你启动任务”。他回应了“Google Zero”的担忧——网站从 Google 来的流量可能归零,但没给出具体流量影响数据。另外,...

推荐理由:这篇是 Sundar Pichai 在 I/O 后的访谈,核心就两件事:Gemini 要嵌入搜索框,以及 Spark 这个让模型进业务流程干活的平台。我会先打个折——正文没披露任何模型规模、延迟数据或上线节奏,所以别当产品发布看。但它的价值在于把 Google 对搜索未来的态度摆上台面:AI 直接生成答案会进一步挤压传统网页流量,同时 Spark 又在抢 agent 平台的身位。这点先别太激动,因为没给技术细节,但方向本身对做搜索、做内容和做 agent 的人都有影响。

量子位 · 公众号

面壁智能发布 ForgeTrain 和 MiniCPM5-1B,声称训练框架由 AI 自己编写,训练速度比英伟达 Megatron 快 10%

面壁智能放出了 ForgeTrain 训练框架和 MiniCPM5-1B 模型。ForgeTrain 最抓眼球的地方是,他们说是让 AI 自己写的代码,在同样硬件下比英伟达的 Megatron 训练快 10%。MiniCPM5-1B 是个 10 亿参数的小模型,FP16 权重约 2GB,压缩到 INT4/Q4 后约 0.5GB,主打端侧部署。不过原文因...

推荐理由:面壁智能说 ForgeTrain 是 AI 写的训练框架,同硬件下比英伟达 Megatron 快 10%,还发了 1B 参数的端侧模型 MiniCPM5-1B,FP16 权重约 2GB,压缩到 INT4/Q4 约 0.5GB。我会先打个折——“全球首例 AI 造 AI”这个说法正文没给出第三方复现,10% 的速度提升也没交代测的是什么任务、什么卡、什么 batch size。但即便保守看,一个 AI 生成的训练框架能跑起来还声称更快,本身就有信息量;1B 模型压到 0.5GB 对手机端部署也够直接。分数定在 80,是因为概念够新、数字够具体,但验证...

机器之心 · 公众号

xAI 解散但 Grok 没停,马斯克预告新模型

马斯克说,1.5 万亿参数的 Grok V9-Medium 已经训完了,过几天开始做强化学习,计划两到三周后发布。Grok Build 现在支持同时跑 8 个子代理,上下文窗口拉到 25.6 万 token,还加了计划模式、竞技场模式、MCP 和 ACP。不过正文因为微信环境验证失败,具体技术细节和评测数据都没披露,这些功能实际效果怎么样还得等实测。

推荐理由:这条消息的钩子在于 xAI 解散的传闻和 Grok 上新同时出现,戏剧性够。马斯克亲自预告 1.5T 参数的 Grok V9-Medium,还给了两到三周的发布窗口,对盯着模型竞赛的人是个明确的信号。Grok Build 那边放出的 8 个子智能体、256K 上下文、Plan Mode 和 Arena Mode,说明他们在把智能体往实际业务流程里塞,不是只发个 API 就完事。我会先打个折:模型刚训完还没进强化学习,没跑分没对比,性能完全未知,这点先别太激动。但整体信息密度和时效性都够,放在 featured 里合理,给 82 分。

机器之心 · 公众号

面壁开源 MiniCPM5-1B 和训练框架 ForgeTrain,框架代码是 AI 自己写的,1B 模型跑分 17.9

面壁智能放出了两个东西:一个叫 MiniCPM5-1B 的端侧小模型,和一个叫 ForgeTrain 的训练框架。1B 模型在 AA-Index 上拿了 17.9 分,这个分数说明小体量也能有不错的综合能力。更特别的是 ForgeTrain,它的训练代码不是人写的,是让 AI 自动生成的,跑出来的结果跟英伟达的 Megatron 框架对得上,而且在 H...

推荐理由:HKR 三项都踩中了:AI 写训练框架这个钩子够新鲜,不是又一个千篇一律的模型发布;AA-Index 17.9 分和比 Megatron 快 10% 的 H100 数据让信息有骨头;话题又落在开源小模型和端侧部署上,读者会想点开看。不过它毕竟不是旗舰模型发布,所以分数放在 78 这个区间是合适的。

新智元 · 公众号

昆仑万维发布天工 Agent,号称性能逼近 Opus 4.6,还给了 2-4 周免费试用

这篇文章本身被微信环境验证挡住了,正文内容没抓到。从标题和现有英文摘要看,昆仑万维发了两个模型:SkyClaw-v1.0 和 SkyClaw-v1.0-lite,主打 Agent 场景,也就是让模型进业务流程干活。他们宣称 SkyClaw-v1.0 的输入成本是 DeepSeek V4 Pro 的 1/24、Sonnet 4.6 的 1/43,这个数字...

推荐理由:这条消息我会先打个折,因为所有性能对比和成本数字都来自厂商自己,没有第三方验证。但它的传播点很清晰:一个国产 Agent 模型宣称能力接近 Claude Opus 4.6,同时把输入价格压到对手的四十分之一,还白送几周试用。对正在被 Token 账单压得喘不过气的团队来说,哪怕只是“声称”,也足够让人点进去看一眼。正文没披露这些基准测试的具体条件和评测机构,所以“逼近 Opus 4.6”先别太激动,但成本对比如果属实,确实挺省钱。

AI HOT 精选

OpenAI 被曝下月发 GPT-5.6,上下文窗口拉到 150 万 token

开发者在 OpenAI Codex 的后台日志里挖出了一个叫 iris-alpha 的未公开模型,对应 GPT-5.6,可能 6 月发布。最直观的变化是上下文窗口涨到 150 万 token,比现在 GPT-5.5 API 的 105 万多出约 43%。有人在辅助工具 OpenCode 里实测,喂到 90 万 token 还能流畅回话,甚至能处理超过 ...

推荐理由:这条消息来自 Codex 日志泄露,不是官方公告,所以我会先打个折。但 150 万 token 的上下文窗口和 iris-alpha 代号都是实打实的数字,对做 agent 和长文档处理的人有直接参考价值。正文没提发布时间和定价,这点先别太激动。整体属于值得从业者扫一眼的更新,但还没到必须立刻行动的程度。

r/LocalLLaMA

一位律师用 12 块 V100 显卡搭本地集群跑法律文书起草,Qwen3.5-122B 模型跑到约 50 token/秒

Reddit 上一位律师分享了自己用 12 块 32GB 显存的 SXM V100 显卡搭建本地 AI 集群的进展,专门用来起草法律文书。核心模型是 Qwen3.5-122B-A10B,在 4 块 V100 上推理速度大约 50 token/秒。这套流程里还加了一个“验证器”,会在最终文件使用前自动拦截没有真实来源的引用、日期和 Bates 编号(案件...

推荐理由:这是一篇来自Reddit的第一手实验记录,不是厂商通稿。律师自己攒16块V100跑Qwen 122B做法律文书,速度约50 tok/s,还加了引用和日期验证器来拦截幻觉,信息量扎实。我会先打个折:来源是个人帖子,权威性有限,所以放在featured低段而不是p1。但HKR三项全中——故事性强、有可复现数字、切中本地部署和合规痛点,对想自己动手的团队是个不错的参照。

AI HOT 精选

苹果被曝用定制版 1.2 万亿参数谷歌模型改造 Siri,简单问题仍跑本地

爆料说苹果下一代 Siri 的核心换成了一个定制的谷歌大模型,参数规模 1.2 万亿,比大家猜的 Gemini 3.5 Flash(约 3000 亿参数)大好几倍。复杂任务会交给这个大模型,简单查询还是留在手机上跑。苹果现在最头疼的是日常问题的响应速度,大模型再聪明,回慢了也没人用。另外,下个月 WWDC 可能会官宣 Apple Intelligenc...

推荐理由:这篇就一个 X 上的爆料,给了些架构细节但没附源文件、没提上线时间和功能范围,所以我会先打个折。1.2T 参数这个数字挺具体,但正文没解释是总参数还是激活参数,也没说模型怎么裁出来给手机用。简单查询跑本地、复杂任务走云端这个分工听着合理,不过延迟到底压到多少、在哪些机型上能跑都没交代。这点先别太激动,等有实测或官方确认再往上调。

AI HOT 精选

Grok Build 测试版上线,SuperGrok 用户能直接用它做图、剪视频和跑自动化脚本

xAI 把 Grok Build 的测试版开放给了所有 SuperGrok 和 X Premium+ 用户。这次主要给了三个东西:Plan Mode 可以分步骤拆解任务;Imagine 模块能直接生成图片和视频;还有一个命令行工具(CLI),方便你把 Grok 接进自动化流程或者编排器里干活。想试的话去 x.ai/cli 就能开始。

推荐理由:HKR 三项都踩中了:xAI 放出一个付费测试版,功能名目列得清楚。分数卡在 featured 底线,因为正文没写能力边界、没给定价、也没测试数据,我会先打个折——东西看着热闹,但能跑多稳、花多少钱,现在还不知道。

5月25日星期一

量子位 · 公众号

Reasonix 给 DeepSeek V4 加了个缓存层,长代码任务里缓存命中率 99.82%,成本打到两折

正文页面被微信环境验证挡住了,看不到具体技术细节。从标题和摘要看,Reasonix 这个工具用了一种“只追加不修改”的循环机制来给 DeepSeek V4 做缓存。在长代码会话场景里,缓存命中率报到了 99.82%,相当于模型每次生成新内容时,前面绝大部分上下文都不用重复计算。一个原本要烧掉 400M token、花 61 美元的任务,用上这套缓存后账...

推荐理由:Reasonix 这个工具把 DeepSeek V4 长会话的缓存命中率拉到 99.82%,账单直接打两折,从 61 美元降到 12 美元。对用 DeepSeek 跑长任务的团队来说,成本降幅很实在。不过正文没披露测试场景的会话长度和任务类型,也没说这个命中率在不同负载下稳不稳,所以先别当通用结论。

彭博科技

华为放话说在芯片制造上找到了新路子,想缩短跟台积电的差距

华为声称绕开了先进设备,用另一条技术路线做出了先进芯片。但正文没披露具体是几纳米工艺、良率多少、成本多高、什么时候能量产。这些关键数字一个都没给,所以现在只能当个信号看,离真正追上还有多远不好说。

推荐理由:彭博的消息源加上华为对台积电的追赶姿态,让这条新闻的硬度和关联度都够,所以 H 和 R 都给了真。但关键信息——到底做到了什么程度、能不能量产——正文全都没说,K 只能给假。我会先打个折,别看到“突破”就激动,等良率和节点出来再判断含金量。

5月24日星期日

r/LocalLLaMA

在 llama-server 网页里用原生工具做联网资料检索的实操分享

一位 Reddit 用户分享了怎么在 llama-server 自带的网页界面里,直接用 llama.cpp 的原生工具实现联网资料检索(也就是 web RAG)。他的做法分七步:先开启 get_datetime 和 exec_shell_command 这两个工具,然后让模型通过 firejail 沙箱、一个独立的 Linux 用户以及一个 Alpi...

推荐理由:这是一篇社区教程,不是模型发布或产品更新,所以权威性和覆盖面有限,但实操价值高。H、K、R 三项都成立:动手门槛低、步骤清晰、切中本地部署的痛点。我会先打个折,因为来源是个人帖子,验证强度弱,但信息量足够放进精选。

新智元 · 公众号

Anthropic 三张底牌全翻:Mythos 1 首次现身,Opus 4.8 被扒出

Anthropic 的新模型和项目被提前曝光了。claude-opus-4.8 的名字出现在 Google Vertex AI 平台上,同时一份 59.8MB 的 Claude Code 源码映射文件泄露,里面 51.2 万行 TypeScript 代码不仅提到了 Sonnet 4.8,还带出了 Mythos 1 的线索。Mythos 1 看起来和 C...

推荐理由:我会先打个折:这是泄露加平台列表,不是 Anthropic 官方发布。正文没披露能力分数、定价、上下文窗口或可复现评测,所以分数卡在 78–84 区间。但 Mythos 1 第一次被挖出来,Opus 4.8 又在 Vertex 上露脸,对关注 Anthropic 路线图的人来说信息量不小,值得放进 featured。

r/LocalLLaMA

llama.cpp 服务器现在自带 8 个原生工具,不用再拼 MCP 就能让本地模型直接读文件、搜代码、跑命令

llama.cpp 的 server 端多了一个实验性的 --tools 参数,一口气给了 8 个内置工具:read_file、file_glob_search、grep_search、exec_shell_command、write_file、edit_file、apply_diff 和 get_datetime。说白了,就是让跑在本地的模型能直接读...

推荐理由:我会先打个折,因为还是实验性功能,而且来源主要是 Reddit 讨论,不是官方安全公告。但这事本身挺炸:llama.cpp 服务端直接塞进 exec_shell 和 edit_file,等于给模型开了系统级后门,正文又明说没有白名单和严格沙箱。对在本地跑 agent 的开发者来说,这不是“未来可能的风险”,是现在就得小心配置的东西。所以给了 featured 里偏低的分数,提醒大家注意,但不过度渲染。

AI HOT 精选

阶跃星辰发了 StepAudio 2.5 实时语音模型,能听懂语气、停顿和情绪,还支持自定义人格

这个模型不只是把语音转成文字再回复,它会捕捉你说话时的语气、语速、停顿甚至微表情这些“副语言”信息,让对话更自然。你可以通过 API 给它设定人格、背景故事和说话风格,官方说原生人格选项超过一万种,组合起来能有数百万种特征。产品内置了 5 个预设人格可以直接试,并且用 RLHF(基于人类反馈的强化学习)做了调优,在复杂的角色扮演压力测试里也能保持人设不...

推荐理由:我会先打个折:这是官方推文,没给延迟、定价、基准测试和实际铺开范围,所以只能当个中等体量的产品更新来看。亮点在于副语言感知——就是能听懂语气、停顿、笑声这些非文字信号,再配上可调的人格,对想做出有“人味儿”的语音助手团队来说,确实是个值得跟的信号。但没实测数据之前,先别太激动。

5月23日星期六

The Verge · AI

上手 Gemini Omni:什么都能转什么都能生,我先拿毛绒玩具试了试

作者去年用 Gemini 给儿子的毛绒鹿做过一段度假视频,没给孩子看,但这件事让他反复琢磨“无害的 AI 乐子”和“纯 AI 垃圾”之间的那条线。这次上手 Gemini 的“任意输入、任意输出”新模型,他再次拿那只毛绒鹿做了一段 deepfake 视频,发现生成逼真视频的工具已经好用到几乎不需要技术门槛,而且这个趋势还在加速。正文没披露模型参数量、定价...

推荐理由:这篇值得推,因为 The Verge 上手玩了一个很唬人的 Gemini 新模型,用一张毛绒鹿照片直接生成视频,效果够“野”。但我会先打个折:全文就一个例子,没参数没价格没时间表,属于尝鲜体验不是产品发布。H 和 R 都过关,K 卡在信息太少,所以整体给 featured 但别当硬核技术稿看。

彭博科技

DeepSeek 要把旗舰模型永久降价 75%,但没说具体是哪个模型、原价多少

Bloomberg 发了一条简短消息,说 DeepSeek 会把某个旗舰模型的 75% 折扣变成永久定价。正文没披露模型名称、原价、折后价和生效日期,也没说明这次降价是针对 API 调用、模型下载还是其他服务。我会先打个折——这条消息信息量太少,暂时只能当个信号看:DeepSeek 在继续压价抢市场,但具体怎么抢、对谁影响最大,还得等官方出细节。

推荐理由:这条消息对关注 API 成本的人来说是个实打实的信号,75% 折扣永久化意味着 DeepSeek 在价格上继续施压。但我会先打个折——正文连模型名、原价和折后价都没给,也没说什么时候生效,所以只能当个半截情报看。HKR 都踩中了,但信息太稀疏,只能放在低 featured 档位。

r/LocalLLaMA

美团 LongCat 放出视频数字人模型 1.5 版,换用 Whisper 做语音驱动,推理步数压到 8 步

美团 LongCat 在 Hugging Face 上发了 LongCat-Video-Avatar-1.5,模型权重用 MIT 协议开源。它能做音频驱动视频、音频加图片驱动视频,还能接着一段视频往后生成。这版把语音编码器从 Wav2Vec2 换成了 Whisper-Large,理论上对语音的理解会更准。推理部分用 DMD2 蒸馏把步数降到了 8 NF...

推荐理由:我会先打个折:这不算行业地震级别的发布,但对做开源视频数字人的团队来说是个实在的更新。H、K、R 三条都站得住——美团 LongCat 把模型权重用 MIT 协议放出来,推理压到 8 NFE,意味着本地跑起来的门槛低了不少。技术上,它把语音编码器从 Wav2Vec2 换成 Whisper-Large,对中文语音的适配可能会更好,但正文没给出具体的对比测试数据,这点先别太激动。如果是真的省钱又好用,对想自己搭数字人、不想走云端 API 的开发者来说,是个值得上手试试的选项。

AI HOT 精选

Gemini 月活破 9 亿,新增两个能替你干活的代理功能

Google 说 Gemini 应用月活用户超过 9 亿了。这次更新把 Gemini 从问答工具往主动干活的个人代理方向推了一步。新模型叫 Gemini 3.5 Flash,还换了套叫“Neural Expressive”的设计语言,另外 Gemini Omni 模型能把提示词直接生成视频。重点在两项代理功能:Daily Brief 会给你出个性化每日...

推荐理由:Google 这次更新核心就两件事:一是 Gemini 应用月活冲到 9 亿,盘子确实大;二是推出了 Daily Brief 和 Gemini Spark 两个代理功能,后者可以在用户授权下 24 小时跑任务。我会先打个折,正文没披露代理功能的具体完成率和延迟数据,实际干活靠不靠谱还不知道。但 9 亿这个量级加上“常驻后台的个人代理”定位,对做 agent 产品的团队来说是个明确的信号——大厂开始用自家分发渠道推代理了,竞争门槛在抬高。

AI HOT 精选

Claude Code v2.1.149:用量报告分类展示、企业可开放云端 MCP 连接器,并修了三个安全漏洞

这个版本主要做了三件事。第一,/usage 命令现在会按类别(比如对话轮次、工具调用)分开展示用量,方便你看出成本花在哪。第二,企业管理员可以通过 allowAllClaudeAiMcps 设置,允许团队直接使用 Anthropic 云端的 MCP 连接器,不用自己搭。第三,修了三个安全漏洞:PowerShell 脚本可能绕过权限执行、Git work...

推荐理由:Claude Code 的一次小版本更新,改动不多但都落在实处。/usage 现在能按类别看用量,方便你盯成本;企业管理员多了个 allowAllClaudeAiMcps 开关,可以统一放行 MCP 工具,不用一个个批。安全方面修了 3 个问题,最要紧的是 PowerShell 权限绕过——正文没展开具体利用条件,但光这个就够让运维团队推更新了。整体属于实用型发版,没画饼。

AI HOT 精选

Claude 自动模式向 Pro 用户开放,支持 Sonnet 4.6 和 Opus 4.7

Claude 的自动模式现在 Pro 计划也能用了,不再是最贵那一档的专属。这次更新还接入了 Sonnet 4.6 和 Opus 4.7 两个模型,按 Shift+Tab 就能让 Claude 自己跑任务。正文没提价格有没有变,也没说是不是全量推送,这点先别太激动。

推荐理由:这是一次中等体量的产品更新,不是新模型或重大能力发布。自动模式进 Pro 计划,配上两个模型和快捷键,对日常靠 Claude 干活的开发者有实际影响,但还没到需要全行业关注的程度。

AI HOT 精选

Kakuna:把原型代码自动加固成生产级项目的 AI 工具

Kakuna 是一个 AI 代理工具,专门把早期快速原型转成可维护的生产级代码库。它内置检查清单和“先定计划再执行”的工作流,模拟人类开发与运维的流程,在不动功能的前提下自动做代码审查、补测试、重构这些“无聊活”。工具强调用多个子代理并行干活来提效,一次大约 16 小时的运行能生成上百次提交,把一个脆弱的 MVP 变成结构清晰、能长期迭代的稳定项目。正...

推荐理由:Kakuna 这个工具让代理按内置检查清单和“计划-目标”流程自动加固代码,一次约16小时能跑出上百次提交。我会先打个折——单条推文来源、非大厂出品,验证强度有限,但信息量够:工作流机制、运行时长、产出规模都给了具体数字,不是画饼。对正在折腾原型转生产的开发者来说,这种“代理帮你擦屁股”的思路有参考价值,所以放在 featured 档。

AI HOT 精选

谷歌在 I/O 大会甩出一整套 AI 代理开发工具,从写代码到上线调试全包了

谷歌这次发布的不是单个模型,而是一条让 AI 代理(能自主干活的程序)落地的工具链。Antigravity 2.0 是个独立桌面应用,配了命令行工具和 SDK,方便开发者直接在本机跑代理。Google AI Studio 新增 Kotlin 支持,号称能一键生成安卓应用并发布,还出了手机版 App。Gemini API 里加了托管代理服务,部署步骤简化...

推荐理由:HKR 三项都成立:谷歌端出了一套有名字、有组件的代理工具栈,覆盖本地开发、云端托管和浏览器协议。不过目前只有社交媒体的摘要,正文没披露定价、API 细节和实际演示,所以分数卡在 78–84 这个区间。我会先打个折,等看到更完整的文档再往上调。

5月22日星期五

Hacker News 首页

DeepSeek 把 V4 Pro 的 75 折促销变成永久降价了

DeepSeek 在定价页更新了一条脚注:V4 Pro 模型现在的 75 折优惠在 2026 年 5 月 31 日结束后,会直接变成正式价格,也就是原价的四分之一。具体来说,输入 token(没命中缓存)从每百万 1.74 美元降到 0.435 美元,输出 token 从 3.48 美元降到 0.87 美元。缓存命中的输入价格更便宜,只要 0.0036...

推荐理由:我会先打个折:这条消息的钩子很足,永久四分之一价直接挑动价格战神经,对开发者钱包影响大,所以 H、K、R 都成立。但正文没披露具体单价,信息缺了一块,没法判断实际便宜到什么程度,所以只够 featured 门槛,算不上必写的大新闻。

TechCrunch · AI

Google 的 AI 眼镜我们上手试了,离好用就差一口气

Google 在 I/O 大会上给了一小段上手时间,试的是带显示功能的 Android XR 眼镜,不是今年秋天只出声的那款。镜片上能直接叠一层信息,比如天气、步行导航、打车详情和实时翻译,还能用 AI 自己捏小组件。眼镜会同时支持 iPhone 和安卓手机。但正文没提价格、什么时候开卖、续航和具体硬件参数,所以现在只能算工程机阶段,别急着掏钱。

推荐理由:我会先打个折:正文没披露价格、上市时间和续航,所以重要性停在 74 分、放在 featured 低位是合理的。但 TechCrunch 的实际上手测试本身就比通稿有说服力,Gemini 把翻译和导航叠进视野这个机制,是把 AI 从“问一句答一句”推到“你看着世界它帮你理解”的关键一步。对从业者来说,这比又一个聊天机器人更新更值得盯。

AI HOT 精选

Project Genie 接入谷歌街景,能把美国真实地点变成可交互世界

Project Genie 和谷歌地图街景打通了,现在你可以把美国真实地点直接转成能走进去玩的交互式世界。正文没披露具体支持哪些城市、生成机制、收费方式,也没说开放范围有多大。

推荐理由:Project Genie 跟谷歌街景合作,把美国真实地点变成能走进去互动的世界。我会先打个折——正文没写具体城市、生成机制和开放范围,所以别当产品发布看。但如果是真的,用街景数据直接生成可交互环境,省掉建模成本,这点对做仿真和世界模型的人挺有吸引力。