跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 281–300 条 · 共 409 条

5月20日星期三

TechCrunch · AI

Google 发布 Android CLI 1.0,让 Claude Code、OpenAI Codex 这类 AI 编程工具也能直接命令行开发安卓应用

Google 在 I/O 大会上把 Android CLI 推到了 1.0 稳定版。这东西是个命令行工具,主要作用是让各种 AI 编程助手(比如 Claude Code、OpenAI Codex,或者 Google 自家的 Antigravity)能直接通过命令行来构建安卓应用,不用非得打开 Android Studio 的图形界面。它内置了一个“an...

推荐理由:我会先打个折:正文没给版本号、发布时间,也没性能数据,所以只能当个信号看。但 Google 加 Android 加 agentic coding 这个组合,本身就够上 featured 线。它不是在秀技术指标,而是在开一扇门——让 agent 从命令行直接插手 Android 构建,这对移动端开发者的工作方式冲击不小。

TechCrunch · AI

Google AI Studio 现在能让任何人几分钟内生成原生安卓应用

Google 在 I/O 2026 上给自家的网页版 AI Studio 加了个新功能:直接用自然语言描述需求,几分钟就能生成一个原生的安卓应用。以前搭环境、写代码可能要几周,现在把门槛压到了“会打字就行”。不过正文没披露背后用的是哪款模型、生成的应用能复杂到什么程度、有没有代码审查机制,也没提收费方式。另外 Google 还提到会用 Gemini 帮...

推荐理由:Google AI Studio 这次更新把代码生成直接落到安卓原生应用上,速度卖点很明确。正文没披露模型、价格和发布范围,所以只能算中等体量的产品更新,先放在 featured 档。

TechCrunch · AI

OpenAI 给自家模型生成的图片加了两种防伪标记,查起来更方便了

OpenAI 宣布了两项措施来标记自家模型生成的图片。一是加入 C2PA 开放标准,在图片的元数据里直接写明“这是 AI 生成的”;二是把 Google 的 SynthID 水印技术集成到产品里,这是一种肉眼看不见的水印,想擦掉也没那么容易。这两招都只对 OpenAI 自家产品生成的图片生效,正文没提是否支持以前生成的老图,也没说具体什么时候上线。

推荐理由:我会先打个折:正文没写具体哪些产品上线、什么时候能用,也没说检测准确率或误判率,所以别当成熟方案看。OpenAI 这次做了两件事——一是加入 C2PA,相当于给图片贴上“数字出生证明”,记录谁、用什么工具生成的;二是在产品里塞进 Google 的 SynthID 水印,等于给图片打上肉眼看不见的标记,方便后续识别。有意思的是,OpenAI 没用自研方案,直接拿对手的技术来用,说明在图像溯源这块,行业更认开放标准而不是各搞各的。对从业者来说,这意味着以后做内容审核或平台合规,可能有一套更通用的检测路径,但前提是覆盖率和验证流程得跟上,这点先别太激动。

TechCrunch · AI

谷歌发布 Gemini Omni:用文字、图片和音频就能直接生成视频

谷歌推出了新的多模态模型 Gemini Omni,能把文字、图片、音频和视频作为输入,通过对话直接生成或编辑视频。首发版本叫 Omni Flash,主打跨模态推理,也就是模型能同时理解不同格式的信息并据此产出视频。但文章没公布具体上线时间、价格、上下文长度限制、跑分成绩,也没说 API 什么时候开放。这点先别太激动,目前看更像是一个技术预告,实际能用起...

推荐理由:Google 把 Gemini 的多模态能力推到了视频生成这一步,Omni Flash 能通过聊天界面把文字、图片、音频甚至视频片段变成新视频,还能编辑。这个更新在 HKR 三个维度上都站得住:玩法直观有传播力,产品形态和输入模态是明确的新信息,而且正好卡在多模态视频生成这个竞争激烈的节点上。正文没公布定价和具体上线时间,所以我会先打个折,把它放在必写但不算顶格的区间。

TechCrunch · AI

Google 在 I/O 2026 发布 Antigravity 2.0,更新了桌面应用和命令行工具

Google 在 I/O 大会上推出了编程助手 Antigravity 的 2.0 版本,主要更新了桌面应用、命令行工具和一个用来搭自定义流程的 SDK。同时,他们新加了一个每月 100 美元的 AI Ultra 套餐,使用额度是 AI Pro 套餐的 5 倍。不过,这篇报道没具体说桌面应用和命令行工具到底更新了哪些功能,也没提 SDK 能接入哪些外部系统。

推荐理由:HKR 三项都踩中了,但正文没写桌面应用和 CLI 具体能干什么,功能细节是空的,所以分数压一压,不上 78。Google I/O 的发布节点加上 100 美元套餐和 5 倍额度,够上 featured。

TechCrunch · AI

Google 在 I/O 2026 发布 Gemini Spark,一个能全天候帮你干活的 AI 助手,还接入了 Gmail

Google 在 I/O 大会上掏出了 Gemini Spark,一个基于 Gemini 模型和 Antigravity 智能体框架(让模型进业务流程干活)搭起来的个人助手,主打 24 小时在线。它最大的卖点是直接连你的 Gmail,能读邮件、替你处理任务。不过文章没细说它能具体操作 Gmail 里的哪些事,也没提价格和什么时候能用上。这点先别太激动,...

推荐理由:Google 在 I/O 上扔了个新东西:Gemini Spark,一个号称全天候在线、能直接进你 Gmail 干活的助手。我会先打个折——正文没写定价、没写具体开放范围,也没提安全护栏做到什么程度,所以别急着把它当成已经落地的产品。但信息量是够的:它基于 Gemini 模型,跑在 Antigravity 智能体框架上,等于把模型塞进业务流程里当常驻工人,而不是一问一答的工具。标题里“24/7”和“Gmail 接入”这两个点,直接拉高了从业者对隐私和权限控制的疑问,也让它和 OpenAI 的助手路线形成对标。整体看,产品更新本身够硬,但缺落地细节,...

AI HOT 精选

Google I/O 2026:Gemini 开始自己动手干活了

Sundar Pichai 在 I/O 大会上宣布 Gemini 进入“自主代理”阶段,能自动处理邮件、安排日历和生成报告。但整篇博客没提模型参数、具体上线时间,也没说收费方式。我会先打个折——这更像一个产品方向预告,离真正稳定可用还有距离。

推荐理由:这条消息我会先打个折:Google 画了个自主代理的饼,能自动处理邮件、日历和报告,听着挺省人力,但正文没披露模型参数、上线时间或价格,所以别太激动。对从业者来说,办公 agent 的落地节奏和成本才是关键,现在只能当方向信号看。

AI HOT 精选

Google 在 I/O 2026 推出每月 100 美元的 AI Ultra 订阅,并给 Plus、Pro、Ultra 三档加了新功能

Google 在 I/O 2026 大会上更新了 AI 订阅体系,新增一档每月 100 美元的 AI Ultra 计划。官方博客没有详细列出 Ultra 包含哪些独占能力,只说它面向重度 AI 用户。已有的 AI Plus 和 Pro 订阅也获得新功能和权益,但正文同样没展开具体是什么。我会先打个折:这篇公告更像一个预告,关键的产品细节和与现有 Goo...

推荐理由:Google 在 I/O 2026 把 AI 订阅拉到了 100 美元一档,叫 AI Ultra。我会先打个折:正文没披露 Ultra 具体比 Pro 多了什么能力,也没说模型规格、上下文窗口或调用次数上限,所以这个价格到底值不值还不好判断。对从业者来说,新分层意味着以后选 Google AI 服务要多算一笔账,尤其是小团队或创业公司,100 美元月费可能直接劝退。这点先别太激动,等具体权益出来再看。

Hacker News 首页

Gemini 3.5 发布,主打“能干活”的模型

Google 在 I/O 大会上推出了 Gemini 3.5 系列模型,核心卖点是让模型不仅能回答问题,还能直接执行操作。博客正文没披露参数量、上下文窗口和具体定价,只强调了“前沿智能+行动”这个方向。Hacker News 上讨论热度很高,有 196 个赞和 179 条评论,但大家基本都在猜实际能力和成本。我会先打个折——没看到跑分和实测数据之前,这...

推荐理由:我会先打个折:这条消息只有型号名和文档链接,正文没披露参数、价格或上下文窗口,所以没法判断它到底强了多少或者省了多少钱。HN 上 196 分、179 条评论说明大家确实在盯着 Gemini 的更新节奏,但热度主要来自对谷歌模型竞争力和成本的关心,而不是因为看到了硬指标。这点先别太激动,等官方把价格和基准测试放出来再看。

AI HOT 精选

Google AI Ultra 套餐降价,新增 100 美元档位

Google 把顶配 AI Ultra 套餐从每月 250 美元降到 200 美元,同时加了一个每月 100 美元的新档位。新档位把 Gemini 应用的使用上限提到 Pro 套餐的 5 倍,主要面向编程和创作场景,还附带新功能抢先体验、20TB 存储和 YouTube Premium。正文没说明 5 倍限额具体对应多少调用次数,也没提新功能抢先体验的...

推荐理由:这是订阅价格和配额打包调整,不是模型或能力发布,但官方来源、价格数字都实在,对用 Google 生态干活的人有直接影响。降价幅度和新增档位让信息够硬,放在 featured 没问题。

AI HOT 精选

Gemini Spark:谷歌说它能关机后替你干活,但没讲什么时候能用

谷歌在 I/O 上放了个预告,叫 Gemini Spark,定位是全天候个人 AI 代理。你给它派活,它能在后台自己跑,哪怕你的手机和笔记本都关了。按官方说法,做重大操作前会先问你。正文没披露上线时间、收费方式和具体能干哪些任务,我会先打个折——关机执行这点听着省心,但实际怎么实现、安全边界在哪,目前全是空白。

推荐理由:我会先打个折:正文没披露上线时间、价格,也没说清楚到底能帮你干哪些任务,所以它还不是那种今天就必须追的新闻。但概念本身够新鲜——一个关机后还能替你跑腿的助手,而且承诺动大操作前会先问你,这点先别太激动,因为没看到具体怎么问、问多细。整体是值得放进精选的料,只是缺了落地信息,分数停在 82 合理。

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,输出速度跑到每秒 289 个 token,是 GPT-5.5 的四倍

谷歌在 I/O 大会上推出了 Gemini 3.5 Flash,官方说它在很多基准测试里比自家 3.1 Pro 强。最直观的卖点是快:输出速度达到每秒 289 个 token,对比的是 Claude Opus 4.7 和 GPT-5.5 xhigh,快了大约四倍。谷歌内部还用 Antigravity 工具做了个实验,让 93 个子智能体协作,12 小时...

推荐理由:谷歌在 I/O 上扔了个速度炸弹:Gemini 3.5 Flash 每秒吐 289 个 token,号称是 GPT-5.5 xhigh 和 Claude Opus 4.7 的四倍。这个数字对做应用的人很直观——响应更快、排队更短、按 token 算钱可能也更省。不过正文没提价格、上下文窗口多大、以及能力上限在哪,所以先别把它当成全面碾压,目前就是个单项速度领先。

AI HOT 精选

谷歌发布 Antigravity 2.0,用 93 个并行子智能体 12 小时搭出一个操作系统

谷歌在 I/O 大会上放出了 Antigravity 2.0 平台,已经对全球用户开放。现场演示里,他们让智能体从零构建了一个能跑起来的操作系统,只用了 12 小时。具体做法是同时跑 93 个子智能体,总共调了超过 1.5 万次模型、处理了 26 亿个 token,最后算下来 API 成本不到 1000 美元。平台本身集成了新的智能体系统和自然语音交互...

推荐理由:谷歌在 I/O 上放了个 Antigravity 2.0 的演示,让智能体用 12 小时、93 个并行子智能体、1.5 万次模型调用和 26 亿 token 搭出一个能跑的操作系统,API 成本不到 1000 美元。我会先打个折:这是发布会演示,不是可复现的公开测试,正文没披露可用性、定价和复现条件,所以别直接当成采购依据。但数字本身挺实在,12 小时和不到 1000 美元这两个数,对想用智能体做复杂工程的人是个参考锚点。标题够抓人,信息量也足,从业者会想点进去看细节,整体值得推。

AI HOT 精选

谷歌发布 Gemini Omni 模型,任意输入都能生成任意输出,一句话就能改视频

谷歌在 I/O 2026 大会上推出了 Gemini Omni,这是 Gemini 家族目前能力最全的版本,能同时处理文字、图片、音频和视频,并直接生成这些格式的内容。现场演示了对话式视频编辑,用户说句话就能换掉视频里的角色或背景。先放出来的是速度更快的 Gemini Omni Flash,已经在 Gemini App、Google Flow 和 Yo...

推荐理由:谷歌在 I/O 上扔出 Gemini Omni 和 Omni Flash,主打全模态互转,一句话就能让 AI 改视频,听着挺猛。我会先打个折:API 什么时候开、怎么收费、跑分多少,正文全没提。Flash 已经进了自家三个产品,说明至少能跑起来,但外部开发者还得干等。这点先别太激动,等有定价和延迟数据再判断值不值得接。

AI HOT 精选

Gemini 3.5 Flash 发布,主打快速高效跑任务

Google 推出了 Gemini 3.5 Flash,官方说法是它在快速、高效完成任务上目前最强。定位是处理日常任务和多步骤创意项目,强调能应对现实世界的复杂情况。不过正文没披露价格、上下文窗口大小、跑分成绩和 API 可用条件,这些关键信息得等后续公布。

推荐理由:H 和 R 都过,因为这是 Google 新发的 Flash 模型,天然跟推理成本和延迟绑在一起。K 没过:正文没给价格、上下文窗口、基准分数,也没说 API 什么时候能用、有什么条件,所以分数只能压在 78–84 这个区间。我会先打个折,等具体数字出来再重新判断。

AI HOT 精选

Gemini 3.5 发布,先上 Flash 版,主打智能体和写代码

Google DeepMind 推出 Gemini 3.5 系列,首发的是 3.5 Flash。官方说这是他们目前最适合让模型进业务流程干活和写代码的模型。正文没披露参数量、价格和上下文窗口,实际能力还得等跑分和实测。

推荐理由:HKR 三项都成立。Google DeepMind 把 Gemini 3.5 的首发押在 Flash 版本上,并且直接挂上 agent 和 coding 的标签,钩子够清晰。新事实是 3.5 Flash 先跑出来,但参数、价格、上下文窗口一概没提,信息有缺口,所以重要性我给 88,没往更高拉。对做模型选型和 agent 落地的人来说,这条更新会直接影响后续决策,相关性没问题。

AI HOT 精选

Gemini Omni 发布:先拿视频生成试水,目标是“什么都能生成”

Google DeepMind 发了条推,说 Gemini Omni 是他们朝“用任何内容生成任何内容”迈出的第一步,首发功能是视频生成。它把 Gemini 的理解能力和自家的生成式媒体系统揉在一起,号称在多模态理解和编辑上有大跨步。但正文没披露模型参数、价格和什么时候能用,我会先打个折——目前只有一句口号和一段视频演示,具体效果和限制还得等后续公开。

推荐理由:我会先打个折:正文没披露参数量、价格和开放时间,所以没法判断实际成本和可用性。但 HKR 三项都过关——DeepMind 用 Gemini 品牌推视频生成,切入点清楚,技术路线也说了(模型加生成系统),而且直接踩在视频生成的热门赛道上。信息缺口让分数停在 72–77 这个区间,不算高但合理。

AI HOT 精选

谷歌 I/O 大会公布数据:每月处理 Token 量超 3200 万亿,一年翻了 7 倍

谷歌 CEO 皮查伊在 2026 年 I/O 大会上甩出了一组数据:今年 5 月,谷歌平台每月处理的 Token 量超过 3200 万亿,比去年同期涨了 7 倍。这个数字说明谷歌 AI 服务的调用规模在急剧膨胀。同时,Gemini App 的月活用户超过了 9 亿,同比翻了一番多,每日请求量也涨了 7 倍多。另外,Nano Banana 这个模型已经累...

推荐理由:谷歌 I/O 这次放的是用量规模,不是新模型或重大能力发布。7 倍增长、9 亿月活和 3200 万亿 Token/月让 HKR 三项都过关,但因为没有产品级大更新,分数就落在 78–84 这个区间。我会先打个折:这些是平台方自己报的数字,外部没法独立验证,不过作为规模参考仍然有分量。

5月19日星期二

Latent Space

想进顶尖 AI 实验室做预训练?先学会写一个比官方库还快的 GPU 内核

Vlad Feinberg 写了一篇求职笔记,把进前沿实验室的门槛讲得很直白:核心能力是底层性能调优,也就是能动手改内核(kernel),让模型训练真的跑得动。他给了一道具体的面试题——先推导 Chinchilla 缩放定律,并比较它在稠密模型和 MoE(混合专家)架构下的区别;然后用 JAX 从零实现,最后写一个 Pallas 内核,要求在专家维度 ...

推荐理由:这篇文章把“进前沿实验室做预训练”拆成了可操作的技能清单:手写 JAX 内核、自己推一遍 Chinchilla 定律、用 Pallas 给 MoE 的 up/down 投影做融合。我会先打个折——正文没披露这些建议是 Vlad Feinberg 的个人经验还是 Google 的普遍要求,也没说这些技能在面试里占多大权重。但光是这份清单本身,对想往预训练方向走的人就有参考价值,尤其是把“懂缩放定律”从一句空话落到“自己推导过”这个动作上。

机器之心 · 公众号

Sebastian Raschka 梳理了 Gemma 4 到 DeepSeek V4 的架构变化,重点在省显存和长上下文

这篇文章是机器之心翻译的 Sebastian Raschka 博客,盘点了几款新模型的架构改动,核心都在想办法降低长上下文的显存开销。Gemma 4 的 E2B 方案在 128K 上下文、bfloat16 精度下,KV 缓存能省大约 2.7GB,这个数字挺实在的。另外还提到了 Laguna XS.2 和 ZAYA1-8B,但正文因为微信环境验证拦截,具...

推荐理由:这是一篇编译的架构趋势梳理,不是一手发布,但信息密度不错。我会先打个折,不往 breaking 级别推。HKR 三档都站得住:标题有明确的模型名钩子,正文有可引用的 KV Cache 节省数字,话题本身也直接关系到推理成本和部署预算。整体放在 featured 中段比较合适,既不过度拔高,也不低估它对从业者的参考价值。