跳到正文

#Google

今日 0 条

昨天 · 9月29日星期二

9月25日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。

8月16日星期日

Computing Life · Share · 鸭哥调研

Google 开源 DiffusionGemma:把 Gemma 4 改成扩散模型,解码飙到 1456 tok/s,但复杂推理掉分明显

Google 把训练好的 Gemma 4 26B-A4B 模型权重直接转成了离散多项式扩散模型,并在 Hugging Face 上开源。它不再从左到右逐个 token 写,而是在 256 个 token 的“画布”里通过多轮去噪并行生成。在单张 H100、FP8、单请求的纯解码测试中,速度达到每秒 1456 个 token,是原自回归模型的 7 倍多,...

推荐理由:Google 把训好的 Gemma 4 权重直接转成扩散模型开源了,不是从头训的,这点挺特别。它不再一个字一个字往外蹦,而是在 256 个 token 的“画布”里并行去噪生成,单张 H100 上纯解码跑到每秒 1456 个 token,是原版自回归模型的 7 倍多。代价是数学能力掉了一截,AIME 从 88.3 降到 69.1,正文没细说其他 benchmark 的跌幅,但至少给了推理工程师一个能算账的参考点。我会先打个折:这还只是单请求、FP8 的测试,真实并发和长文本下的表现还没看到,别急着下结论说扩散模型要替代自回归。

8月12日星期三

Google DeepMind

Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,可据此判断手语翻译进入消费级产品的可行边界。

7月21日星期二

Google DeepMind

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。

推荐理由:原文给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型变化。

7月17日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

推荐理由:原文给出轻量安全模型在多个基准和 Google 内部代码库的实测结果,可据此判断专用小模型在漏洞发现上的性价比。

6月11日星期四

机器之心 · 公众号

谷歌开源 26B 文本扩散 MoE 模型 DiffusionGemma,推理时只激活 3.8B 参数,一次生成 256 个 token

谷歌发了一个实验性的开源模型 DiffusionGemma,用的是 Apache 2.0 协议。它不走自回归模型逐 token 生成的路线,而是一次性起草 256 个 token 的文本块,把解码瓶颈从内存带宽转向了计算本身。在单张 H100 上能跑到每秒 1000+ token,比自回归模型快最多 4 倍。模型总规模 26B,但推理时只激活 3.8B...

推荐理由:谷歌开源了一个 26B 的文本扩散模型,跳过自回归解码,推理只激活 3.8B 参数,单张 H100 跑到每秒 1000+ token。Apache 2.0 协议,有具体的速度对比和机制说明,对做推理优化的人有直接参考价值。不是公关稿,数字和做法都给了,值得放进精选。

量子位 · 公众号

谷歌开源扩散文本模型 DiffusionGemma,生成速度比自回归模型快 4 倍

谷歌把生成图片的扩散模型思路搬到了文字生成上,开源了 DiffusionGemma。它不像传统模型那样一个字一个字往外蹦,而是一次铺开 256 个 token 的“画布”,从噪声开始多轮去噪,整段文字同时浮现。在 H100 上跑到每秒 1000+ token,消费级 RTX 5090 上也有 700+,比同规格自回归模型快了约 4 倍。这个 26B 参...

推荐理由:谷歌悄悄开源 DiffusionGemma,把扩散模型那套一次去噪整段文字的路子用在文本生成上,速度数字很漂亮,比同类模型快约 4 倍。我会先打个折——目前只有速度数据,生成质量、实际任务表现都没披露,这点先别太激动。分数没更高就是因为缺这些关键验证。

6月9日星期二

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。

推荐理由:原文给出模型的语言覆盖、实时翻译机制与多产品上线节奏,可据此判断语音翻译的可用边界。

6月6日星期六

r/LocalLLaMA

开源模型这周炸了:25+ 个开放权重模型一口气放出,覆盖文本、图像、语音

Victor M 在 X 上整理了一份清单,过去一周有超过 25 个开放权重的模型发布,几乎覆盖了所有模态。其中最扎眼的是 NVIDIA 的 Nemotron 3 Ultra,一个 550B 参数的混合架构(Mamba-MoE),每次推理只激活 55B 参数,上下文窗口能塞进 100 万个 token。不过正文被 Reddit 的安全策略拦住了,具体还...

推荐理由:我会先打个折:消息源是 X 上的个人整理,Reddit 原文还被安全策略拦了,具体细节没法交叉验证。但一周 25+ 个开放权重模型这个密度本身就值得关注,NVIDIA 那个 550B 的 Nemotron 用 Mamba-MoE 架构,激活参数只有 55B,上下文能塞 100 万 token,如果实测靠谱,推理成本会省不少。这点先别太激动,等完整评测出来再说。

6月3日星期三

r/LocalLLaMA

用 LiteRT 跑 Gemma 4 E4B,文字生成比 Q4 GGUF 快 2.4 倍,图片处理几乎没变

有人在 RTX 4060 Ti 16GB 上实测了 Gemma 4 E4B 模型。用 LiteRT 引擎跑文字生成,平均每秒能出 157.2 个 token,而用 llama.cpp 的 Q4 GGUF 格式只有 66.3 tok/s,快了大约 2.4 倍。不过图片标注任务就没这么乐观了:处理 111 张全分辨率图片,LiteRT 耗时约 72 秒,Q...

推荐理由:这是一篇个人在 Reddit 上发的实测,不是官方报告,权威性有限,所以分数没往上拉。但 H、K、R 三项都站得住:速度对比抓眼球,测试条件和数据都写清楚了,对想在自己机器上跑 Gemma 的人有直接参考价值。我会先打个折,因为只有单卡单次测试,没提功耗和精度变化,但作为一手体验已经够用。

6月1日星期一

AI HOT 精选

MiniMax 开源 M3 模型:一个模型搞定编程、100 万 token 上下文和原生多模态

MiniMax 把 M3 模型开源了,权重公开可下载。它把三个能力塞进了一个模型里:编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边(SWE-Bench Pro 得分 59.0%),能处理 100 万 token 的超长上下文,还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

推荐理由:MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案,上下文窗口拉到100万token。最实在的点是MSA注意力机制,每token计算成本降到前代的1/20,长文本推理能省不少钱。编码和Agent跑分看着不错,但正文没给出具体对比对象和测试细节,这点先别太激动。整体是一次有诚意的开源发布,信息量够,但验证还缺一环,所以放在featured而不是P1。

5月31日星期日

r/LocalLLaMA

用 44 小时 RTX 5090 给 Gemma 4 E2B 做了 13 个“去限制”变体,有害指令成功率从 32% 飙到 82% 以上

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者 Abliterlitics 用 44 小时的 RTX 5090 算力,对 Gemma 4 E2B 模型做了 13 种不同强度的“去限制”(abliteration)处理。简单说,就是通过修改模型内部参数,削弱它对敏感问题的拒绝回答倾向。结果很直接:原版模型在 HarmBench 有害指令测...

推荐理由:我会先打个折:这只是一次个人发起的去审查实验,不是官方发布,结论别直接当生产依据。但文章把 13 个变体的基准分、GPU 开销和有害指令通过率都列清楚了,读起来像朋友在群里甩了一份跑分记录。对想了解 Gemma 4 安全边界、或者自己动手做 abliration 的人,这份数据比泛泛的讨论有用得多。

5月21日星期四

r/LocalLLaMA

Fireworks 提出“Agent 执行税”:浏览器智能体跑任务时,22.9% 的推理算力都浪费了

Fireworks 在 WebVoyager 上跑了 720 个浏览器智能体任务,发现平均有 22.9% 的推理调用属于无效消耗,他们管这个叫“Agent 执行税”——也就是为了完成任务,模型多做的无用功。具体到各家模型:MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍;GLM-5 的任务成功率做到 57.1%;Ki...

推荐理由:HKR 三项都站得住:它把一个跑分现象包装成了可复用的采购指标,有具体数字支撑,而且直接回应了从业者在选型时对隐性成本的焦虑。信源是 Fireworks 自己的博客和 Reddit 讨论,不是第三方独立评测,所以重要性停在 74 分 featured 档,没往上拉。

5月20日星期三

AI HOT 精选

Google AI Edge Gallery 更新:手机端模型能调外部工具、设提醒、记住聊天了

Google 给 AI Edge Gallery 这个手机端模型体验应用加了三个新能力。一是安卓版开始实验性支持 MCP(模型上下文协议),你可以给手机上的 Gemma 4 模型配一个外部工具服务器地址,比如连上 Google Workspace 查日历邮件,或者接 Google Maps 问路、接网页抓取工具读链接内容。模型在本地决定调哪个工具,请求...

推荐理由:Google 在安卓 AI Edge Gallery 里塞了实验性 MCP 支持,Gemma 4 能直接调 Workspace、Maps 这些外部工具,还补了通知和会话记忆。我会先打个折——正文没披露延迟、耗电和实际可用工具数量,目前更像开发者尝鲜版。但方向很明确:让手机端模型从聊天框跳出来,进到系统里干活。这点先别太激动,等看实际跑起来的稳定性。

Hacker News 首页

Gemini 3.5 发布,主打“能干活”的模型

Google 在 I/O 大会上推出了 Gemini 3.5 系列模型,核心卖点是让模型不仅能回答问题,还能直接执行操作。博客正文没披露参数量、上下文窗口和具体定价,只强调了“前沿智能+行动”这个方向。Hacker News 上讨论热度很高,有 196 个赞和 179 条评论,但大家基本都在猜实际能力和成本。我会先打个折——没看到跑分和实测数据之前,这...

推荐理由:我会先打个折:这条消息只有型号名和文档链接,正文没披露参数、价格或上下文窗口,所以没法判断它到底强了多少或者省了多少钱。HN 上 196 分、179 条评论说明大家确实在盯着 Gemini 的更新节奏,但热度主要来自对谷歌模型竞争力和成本的关心,而不是因为看到了硬指标。这点先别太激动,等官方把价格和基准测试放出来再看。

5月18日星期一

Google DeepMind

Google DeepMind 发布 Gemini Omni Flash 视频生成模型

Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑。

推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。

5月16日星期六

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash

Google DeepMind 发布 Gemini 3.5 模型家族,首款 Gemini 3.5 Flash 当日上线 Gemini 应用、Google Search AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise。

推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断它在长任务工作流中的定位。

5月11日星期一

AI HOT 精选

OpenRouter 用真实市场需求给模型排座次,DeepSeek V4 Pro 排第一

OpenRouter 搞了个叫 Pareto Code 的排名方法,不看跑分,直接看用户在实际调用中怎么选模型,找出性价比最优的那条线。目前排第一的是 DeepSeek V4 Pro,后面跟着 GPT 5.4 Mini 和 Gemini 3.1 Pro。不过正文没披露具体怎么算分、样本量多大,所以这个排名到底多稳,我会先打个折。

推荐理由:我会先打个折:OpenRouter 只发了一篇帖子,没公布样本量、统计时间窗口和具体定价依据,所以这个排名不能当严谨评测用。但它的价值在于思路——用市场实际调用数据来反映模型性价比,比跑分更贴近真实使用场景。DeepSeek V4 Pro 排第一这点先别太激动,得看后续有没有更透明的数据支撑。整体上,这条信息对正在选模型的开发者有参考意义,但信息缺口明显,够 featured 但上不了更高分。

5月5日星期二

r/LocalLLaMA

Heretic 1.3 发布:模型可复现、内置跑分、显存占用更低

Heretic 1.3 这个版本主要干了三件事。第一,它现在能把跑模型时的环境——PyTorch 版本、GPU 型号、驱动、加速库这些——都打包记录下来,别人照着做就能复现结果,不用再猜“为啥我跑出来不一样”。第二,它内置了一套跑分系统,直接用 lm-evaluation-harness 测 MMLU、EQ-Bench、GSM8K 和 HellaSwa...

推荐理由:我会先打个折:正文没给出 VRAM 具体降了多少,这点先别太激动。但 Heretic 这次更新确实踩到了两个实在需求——一是让模型运行环境可复现,把 PyTorch、GPU、驱动版本都记下来,方便排查问题;二是内置了 lm-evaluation-harness 基准测试,不用再自己搭评测流程。项目有 2 万星、1300 万次下载,社区验证度够高。缺憾是 VRAM 优化只提了方向没给数字,所以重要性停在 72 分,放在 featured 里合适。

5月2日星期六

量子位 · 公众号

腾讯混元开源 440MB 翻译模型,手机离线跑,自称翻译质量超谷歌

腾讯混元放出了一个叫 Hy-MT1.5-1.8B-1.25bit 的翻译模型,把原本 1.8B 参数的模型压到了 440MB,能在骁龙 888、8GB 内存的安卓手机上离线跑。它支持 33 种语言、1056 个翻译方向。压缩的关键是一种叫 Sherry 1.25 比特量化的技术,做法是每 4 个权重里,3 个用 1 比特存,1 个直接置零。官方说翻译质...

推荐理由:我会先打个折:这是个垂直翻译模型,不是基础模型大更新,所以没到 P1。但亮点很实在——1.8B 模型压到 440MB,靠的是 1.25-bit Sherry 量化,每 4 个参数里 3 个用 1-bit、1 个直接置零,这种压缩方式少见。正文给了骁龙 888、8GB 内存的离线跑分,不是空口说白话。翻译质量超谷歌这点先别太激动,正文没披露具体测试集和对比条件,但如果是真的,端侧翻译的性价比会明显拉高。

4月19日星期日

r/LocalLLaMA

实测 8 个模型当桌游主持人:27B 小模型叙事质量干翻了 405B 巨无霸

作者用 6 个固定跑团场景测了 8 个模型,让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分,整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B,但正文被屏蔽了,没披露那个 405B 具体是哪个模型,也没给出完整排名。这点先别太激动...

推荐理由:这篇来自 Reddit 的个人评测,钩子够锋利——小模型在叙事质量上干翻大模型,HKR 三项全中。我把它留在 featured 而不是更高,是因为正文截断了,405B 具体是哪个模型、完整排名都没给出来,信息有缺口,先别太激动。

4月17日星期五

Hacker News 首页

实测 Claude 4.7 新分词器:技术文档的 token 消耗涨了 47%

作者用 Anthropic 的免费 token 计数接口,拿同一批内容分别喂给 Claude Opus 4.6 和 4.7,看 token 数涨了多少。7 份真实 Claude Code 用户会发的样本(包括 CLAUDE.md 文件、终端输出、代码 diff 等)加权后从 8254 个 token 涨到 10937 个,整体多了 32.5%。其中技术...

推荐理由:这篇不是官方通稿,是第三方实测,把“同价”背后的 token 膨胀算清楚了。我会先打个折:IFEval 只抽了 20 题,样本量不大,但真实文档 1.47 倍、中文日文几乎不涨这些数字对实际用量有参考价值。对用 Claude Code 的人,窗口烧得快、缓存命中变贵、限流更容易触发,这些比 IFEval 涨 5 个点更值得盯。正文没披露样本的具体内容,但加权方法和对照设置交代得够用。

4月16日星期四

Google DeepMind

Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

推荐理由:原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口,可据此判断语音生成的可控性变化。

4月13日星期一

Google DeepMind

Google DeepMind 发布 Gemini Robotics-ER 1.6 机器人推理模型

Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,可据此判断机器人高层推理的进展。

4月7日星期二

Latent Space

Gemma 4 首周下载量破 200 万,本地跑模型成了新趋势

Google 的 Gemma 4 上线第一周就冲到约 200 万次下载。做个对比:Gemma 3 过去一年总共 670 万次,Gemma 2 从 2024 年 6 月到现在 140 万次,而 Qwen 3.5 在大约一个半月里拿了约 2700 万次。这次最值得关注的是本地部署的速度——有人用 iPhone 17 Pro 跑 Gemma 4 E2B,通过...

推荐理由:这条消息的看点不是 Google 又发了个模型,而是首周 200 万下载这个数字本身,以及它和 Qwen 3.5 一个半月 2700 万的对比——开源模型的采用速度在明显变快。更实在的是有人已经在 iPhone 上跑出 40 tok/s,这对做端侧部署的人来说是个可参考的实测数据,不是公关稿里的理论值。我会先打个折:下载量不等于日活,正文也没披露留存或实际调用量,所以别直接当成市场份额来看。但生态支持列得挺全,至少说明主流推理框架没掉队,这点对选型有帮助。

4月3日星期五

X · @dotey(宝玉)

Google 发布 Gemma 4 开源模型家族,全系改用 Apache 2.0 协议

Google 把 Gemma 4 全系列换成了 Apache 2.0 协议,商用、修改、分发不再受限,之前自家协议里的灰色地带这次清掉了。系列包含四个尺寸:31B Dense、26B MoE(混合专家架构)、E4B 和 E2B。31B 在 Arena AI 开源模型文本榜排第三,26B 排第六,Google 说它们表现超过体量大 20 倍的模型。大模型...

推荐理由:这次发布的分量,许可证变更和模型规格差不多重。Apache 2.0 意味着小公司和独立开发者可以放心拿来改、拿来商用,不用再为法律条款头疼。四个尺寸里,31B 能跑在单张 H100 上,26B 是 MoE 架构,推理成本会更低,这两点对实际部署的人比跑分更有吸引力。原生支持函数调用和 JSON 输出,摆明了是冲着让模型直接进业务流程干活去的。正文没给详细评测链接和横向对比数据,所以先别急着说它性能碾压谁,但就开放程度和工程友好度来说,这波更新挺实在。

Google DeepMind

Google DeepMind 发布 Gemma 4 开源模型家族

Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,31B 在 Arena AI 文本榜位列全球开源模型第 3,26B 位列第 6。

推荐理由:Gemma 4 以 Apache 2.0 开源并覆盖端侧到工作站四种尺寸,可据此判断开源模型的部署与微调选择。

2025年3月12日星期三

Hugging Face 博客

谷歌发布 Gemma 3 系列开源模型,最高 270 亿参数,能看图、懂 140 多种语言

Gemma 3 是谷歌最新放出的开放权重模型,有 1B、4B、12B、27B 四个尺寸。4B 及以上的版本能同时处理图片和文字,支持超过 140 种语言,上下文窗口拉到 128k token(1B 是 32k)。官方说 4B 的指令版在跑分上能打赢上一代 27B,27B 则超过了 Gemini 1.5 Pro。模型已经挂在 Hugging Face 上...

推荐理由:标题信息量不小,但正文为空,我会先打个折。Google 新 Gemma 本身自带关注度,多模态和长上下文这两个点又正好打在本地部署和模型选型的痛点上,所以 H 和 R 都站得住。K 完全拿不到分,因为参数、上下文窗口、许可证、基准成绩一概没披露,现在只能当个预告看,不能当评测结论用。整体放在 featured 低位是合理的,等模型卡或技术报告出来再重新判断。