跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 281–300 条 · 共 514 条

5月19日星期二

AI HOT 精选

Qwen3.7预览版上线竞技场,阿里视觉排名冲到第五

阿里云在 X 上官宣 Qwen3.7-Plus-Preview 已经挂上竞技场,同时提到自家在视觉榜单上排到第五。帖子没给具体跑分、参评模型数量,也没说 Qwen3.7 系列什么时候正式发,只说“迫不及待要发布”。我会先打个折:排名第五听着不错,但不知道跟谁比、怎么比,这点先别太激动。

推荐理由:Qwen3.7-Plus-Preview 上了 Arena 并拿到视觉第五,我会先打个折——正文没披露具体分数、同期参评模型有多少、也没说什么时候正式发布。排名能说明模型在视觉任务上有竞争力,但信息缺口不小,分数暂时放在 featured 低位。

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

Latent Space

无人机自主技术栈与经济学:从宠物摄像头到 AI 制导炸弹

Yaroslav Azhnyuk 是 The Fourth Law 的创始人,这家公司做 AI 制导无人机。他之前创办了 Petcube,卖的是给宠物扔零食的摄像头,现在做的是给占领军扔炸药的摄像头。这期播客他和 Noah Smith 聊了两个小时,核心是 FPV 穿越机怎么成了战场上的新杀器——前线 70% 到 80% 的伤亡都是它造成的。他提出无人...

推荐理由:这是一期播客对谈,不是产品发布或论文,所以别当硬核技术报告看。我会先打个折:它给的是行业判断和框架,不是实测数据。但聊得挺实在,把无人机从遥控到全自主拆成了5个等级,又用8个维度讲战场怎么用、成本怎么算,还专门分析了中国制造为什么能把价格打下来。对想快速理解无人机产业和自主化路线的人,这期信息密度够,值得放进精选。

r/LocalLLaMA

Qwen 3.6 27B 在 24G 显存上的部署实测:后端、量化方案与参数对比

作者用一张 RTX 3090 24GB 跑 Qwen 3.6 27B,最终留用了 ik_llama.cpp 搭配 Qwen3.6-27B-MTP-IQ4_KS.gguf 这个量化版本。在 156k 上下文、q8_0 KV 缓存并开启 MTP 的设置下,输入约 5900 token 的提示、生成 1024 token 时,预填充速度约 1261 tok/...

推荐理由:这是一篇个人实测,不是官方发布,所以传播面窄一些,但信息密度很高。作者在单张 3090 上把 Qwen 3.6 27B 压进 24GB 显存,还跑通了 156k 上下文,最终选了 ik_llama.cpp 加 IQ4_KS 量化。prefill 能到 1261 tok/s,decode 72.9 tok/s,对本地部署来说相当可用。后端对比部分把 llama.cpp 系和 vllm 的取舍讲清楚了,对想自己搭推理服务的人有直接参考价值。我会先打个折:这只是单人单卡的一次测试,没有多卡、没有生产环境压测,但作为选型参考够用了。

AI HOT 精选

Grok 现在能直接看懂你上传的视频了

Grok 新增了视频理解功能,你可以把整个视频文件丢给它,让它实时分析画面、总结内容、做翻译、解释场景或提取关键上下文。它不只是看单张图片或读文字,而是能理解完整的视频。马斯克这条推文没提视频时长上限、支持哪些格式,也没说这个功能是全员推送还是灰度测试。

推荐理由:Grok 这次更新把视频理解加进来了,能上传整段视频做分析、总结、翻译和解释场景,对多模态产品来说是个实打实的进步。我会先打个折:正文没写支持多长的视频、什么格式、是不是全量上线,这些关键信息都缺着。所以虽然功能本身有看点,但只能按中等偏上的产品更新来处理,先别太激动。

AI HOT 精选

阿里云上线 HappyHorse 视频模型,一条提示词直接出 1080p 多镜头视频

HappyHorse 现在可以在阿里云 Model Studio 上用了。它主打从文字描述一步生成 1080p 的多镜头视频,官方说法是“电影级”画质。目前有个限时 8 折活动,但正文没写原价是多少、模型参数量多大、可用区域和有效期,也没给技术细节或对比评测。我会先打个折:效果到底怎么样,得自己跑几条片子才知道。

推荐理由:HKR 三项都过了:模型名字和 1080p 多镜头让标题有钩子,上线渠道、核心功能和折扣信息都给了,成本与竞争角度也踩中从业者关注点。但价格、参数量和评测都没披露,信息厚度一般,所以卡在 featured 门槛上。

Google DeepMind

Google DeepMind 发布 Gemini Omni Flash 视频生成模型

Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑。

推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。

5月17日星期日

彭博科技

苹果 iOS 27 会给 Siri 加一个独立 App,聊天记录会自动删除

彭博社爆料 iOS 27 会有一个类似 ChatGPT 的 Siri 独立应用,核心卖点是聊天记录会自动清理。文章没提保留多久、什么时候上线,也没说具体功能细节。另外 Siri 这次可能还是挂着“Beta”标签,同时 Genmoji(AI 生成表情)也会升级。

推荐理由:我会先打个折:标题很抓人,但正文能落地的料太少。Bloomberg 这篇把 Siri 往 ChatGPT 方向靠,还强调聊天会自动删,隐私角度确实能引起讨论。可翻遍正文,只说了 iOS 27 会有 Genmoji 升级,自动删除的保留多久、什么时候上线、Siri 本身怎么改,全都没披露。这点先别太激动,信息缺口摆在那。不过对做 AI 的人来说,苹果在隐私和功能之间怎么取舍,本身就是个长期看点,所以还是值得扫一眼。

Google DeepMind

Google 在 Search、Gemini、Chrome 和 Pixel 扩展内容溯源与验证工具

Google 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明度与验证工具,并深化行业合作。SynthID 已为超过 1000 亿张图片和视频、60000 年音频嵌入水印,Gemini 应用中的 SynthID 验证已被使用 5000 万次,该能力今日扩展到 Search、未来几周进入 Chrome。

推荐理由:原文列出 SynthID 与 C2PA 在 Search、Gemini、Chrome、Pixel 的落地范围,可据此判断内容溯源工具的可用边界。

量子位 · 公众号

TGO:不用人工挑好坏样本,靠一个分数就能把生图模型调得更听话

新加坡国立大学搞了个叫 TGO(阈值引导优化)的方法,被 ICML 2026 收了。它最大的好处是不需要提前构造“这张比那张好”的偏好对,直接拿一个标量分数(比如美学分、图文匹配度)就能做对齐。做法是先让模型生成一批图,算出分数的分布,定一个阈值:高于阈值的当正样本往上拉,低于的当负样本往下压。论文在 Stable Diffusion v1.5、FLU...

推荐理由:这篇 ICML 2026 的论文提了个叫 TGO 的方法,核心是把标量反馈(比如一个打分)直接转成模型的正负更新方向,不用像传统 RLHF 那样先构造偏好对。我会先打个折:正文没披露具体节省了多少标注成本或计算量,但思路本身挺直接——用分数分布的阈值来决定哪些样本该学、哪些该躲。实验覆盖了四个主流视觉生成模型,从 SD v1.5 到 FLUX 都有,说明不是单点特调。这点先别太激动,因为论文偏研究向,离工程落地还有距离,但对正在头疼对齐数据采集的团队来说,值得看一眼。

量子位 · 公众号

一只机器狗,把英伟达的算力王座拱翻了

蔚蓝科技发了款消费级机器狗 BabyAlpha A3,用六颗芯片搭了个异构计算集群,直接在本地跑 7B 参数的大模型,推理速度到 280 TPS。视觉上配了 6600 万像素的摄像头,每秒能扫出 223.2 万个点云数据点,计划第三季度上市。不过正文因为环境验证没抓到具体内容,上面这些数字都来自外部摘要,实际表现和定价还没法核实。

推荐理由:我会先打个折:正文是单篇产品发布稿,没披露功耗、价格和对比基准,所以别太激动。但这条消息确实有料——蔚蓝科技在机器狗里塞了6颗芯片搭异构集群,本地跑70亿参数模型,推理速度标到280TPS,Q3就要上市。对做端侧部署和机器人的人来说,这等于给“离了英伟达行不行”提供了一个实物样本。信息缺口也很明显:没写具体芯片型号、没给功耗数据、没说明280TPS是在什么精度和batch size下测的,这些都会影响实际可用性。综合来看,角度抓人、事实具体、但验证信息不足,放在featured门槛上刚好。

AI HOT 精选

Grok Imagine 图像生成上线 X,所有用户都能用,但没公布模型参数和收费

Grok Imagine 在 X 上开放给所有人了,用他们最新的文本到图像模型,能生成写实风格的高质量图片,支持多种宽高比。正文没提模型参数量、是否收费、有没有地区限制,也没给生成速度或样本对比。我会先打个折:功能是开了,但关键信息全缺,别急着当主力工具。

推荐理由:我会先打个折:正文只说了能用、能调比例,模型参数、价格、地区限制一概没提,所以别当完整评测看。但 Grok 把生图直接嵌进 X 的时间线,等于在社交场景里抢了 Midjourney 和 DALL·E 的入口,从业者会盯着两点——一是生成质量和审核尺度,二是这功能到底免不免费、能撑多久。

FT · 科技

FT 称中国 AI 公司在视频生成上反超美国对手,但正文被付费墙挡住,没看到具体模型和评测数据

FT 这篇文章的标题说字节跳动和快手等中国 AI 公司在视频生成领域已经领先美国对手,在广告和娱乐场景里效果更好。但点进去只看到安全验证页面,正文完全没加载出来,所以不知道他们拿什么模型比的、用的什么评测标准、样本量多大、延迟和成本怎么样。我会先打个折——标题里的“领先”目前只能当个信号看,等看到具体数据再下判断。

推荐理由:FT 这篇标题很猛,说中国公司在视频生成上反超美国,但正文信息很薄。只提到字节和快手在广告、娱乐视频质量上领先西方对手,具体怎么比、用什么标准、样本多少全没写。我会先打个折:标题的“领先”目前只能当个信号看,别急着当定论。不过视频生成确实是现在中美模型竞赛里最卷的一条线,这条消息对关注多模态落地的人有提醒价值,所以给了 featured 门槛分。

机器之心 · 公众号

世界模型的两条路线和一场百亿赌局

这篇文章是机器之心编译自 MoE Capital 的一篇博客,梳理了“世界模型”这个概念的两条发展脉络。一条是 AI 学术圈常说的,让模型在脑子里推演环境变化、做规划;另一条来自游戏和影视工业,追求用模型直接生成逼真的 3D 世界。文章提到,过去一年半里,有超过 100 亿美元的资金涌入了这个方向。里面举了一个具体例子:DreamDojo 这个项目用 ...

推荐理由:这篇是编译的科普+评论,不是一手发布,但把世界模型两条路线讲得清楚,还给了百亿美元和44711小时视频这些具体数字。我会先打个折,因为信息密度集中在解释概念,新事实不多。不过对想快速理解世界模型热度和技术现状的人来说,读这一篇比翻论文省时间。

5月16日星期六

Hacker News 首页

SANA-WM:一个 26 亿参数的开源世界模型,能根据单张图片和镜头轨迹生成 1 分钟 720p 可控视频

NVIDIA 放出了一个叫 SANA-WM 的开源模型,参数规模 26 亿,主打的是用一张图加一条镜头移动路线,直接生成长达一分钟的 720p 视频。它把长视频生成拆成两步:先用一个混合线性注意力的主干网络跑出长序列粗稿,再用一个 170 亿参数的精修模型去改善纹理、动作和后半段的画质。训练成本不算高,64 块 H100 跑 15 天,用了约 21.3...

推荐理由:标题说 SANA-WM 是个 2.6B 参数的开源世界模型,能生成 1 分钟 720p 视频。我会先打个折:正文只给了链接、9 分和 8 条评论,训练数据、许可证、推理成本、跟其他模型的对比跑分全都没披露。2.6B 这个尺寸在视频模型里算小的,如果真能稳定跑一分钟不崩,推理成本可能比较友好,但这点先别太激动,因为没看到任何实测证据。开源是个加分项,不过没写是什么许可证,商用能不能用还不清楚。整体看,这是个有话题度的发布,但信息缺口很大,实际能力得等更多细节出来才能判断。

机器之心 · 公众号

机器人为什么需要世界模型?顶尖机构联合发布综述

这篇综述正文被微信的验证页面挡住了,我没法看到具体内容。从标题和已知信息看,NTU MARS Lab 联合几家机构发了一篇 43 页的综述,讲的是机器人世界模型。世界模型可以理解成让机器人脑子里有个对物理世界的模拟器,能预判“我动一下会发生什么”,而不是每次都靠真实试错。文章大概会梳理这类模型怎么定义、用什么架构、在哪些任务上能用,以及当前卡在哪——比...

推荐理由:我会先打个折:标题里的“震撼发布”可以忽略,但内容本身不水。这篇综述把机器人世界模型这件事拆得很细——从“世界模型到底是什么”到怎么搭、怎么测、动作一致性卡在哪,都给了结构化的梳理。对正在琢磨具身智能或仿真训练的人来说,相当于一份现成的地图,省得自己去翻几十篇论文。不过它没给出具体的性能数字或成本对比,所以别指望直接拿来算投入产出。

量子位 · 公众号

浙大和微软用3000条纯文本提示词,让视频生成模型学会理解3D空间

浙大和微软搞了个叫 World-R1 的方法,拿 Wan 2.1 模型做实验,只用了大概 3000 条纯文本提示词,没加任何 3D 标注数据,就让模型生成的视频在空间一致性上好了不少。他们设计了一套叫 Flow-GRPO 的训练流程,外加四个维度的奖励信号来引导模型。1.3B 参数量版本跑出来的 PSNR 指标比原版高了 10.23 dB,说明画面里的...

推荐理由:我会先打个折:正文没披露这3000条文本的具体来源和构造方式,也没说四维奖励里各维度的权重怎么定,所以效果能不能稳定复现还得看后续。但亮点很实在——不用费劲标视频数据,纯靠文本就让 Wan 2.1 的 1.3B 小模型在 PSNR 上跳了10.23 dB,说明用偏好对齐的思路(Flow-GRPO)去修视频里的物理一致性,这条路走得通而且成本低。对想低成本改进视频模型物理合理性的团队来说,这个方向值得跟。

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash

Google DeepMind 发布 Gemini 3.5 模型家族,首款 Gemini 3.5 Flash 当日上线 Gemini 应用、Google Search AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise。

推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断它在长任务工作流中的定位。

AI HOT 精选

Runway 推出 Agent,一次对话就能把产品图变成完整广告片

Runway 新上线的 Agent 功能,让你在同一个对话窗口里,上传产品照片、给点想法,它直接吐出一条制作完成的广告。官方帖子没提背后用的是哪款模型、怎么收费、能生成多长的视频,也没说目前开放了哪些地区。我会先打个折:如果它真能省掉剪辑和合成的环节,对做短视频广告的团队来说挺省钱,但实际效果和可控性还得看上手之后的表现。

推荐理由:Runway 这个广告生成 Agent 在 HKR 三项上都踩中了,但属于中等体量的产品更新。我会先打个折:正文没写用了什么模型、怎么收费、生成一支广告要多久、哪些地区能用,信息缺口不小。所以它够得上 featured,但还不到必须写一篇的程度。

5月15日星期五

r/LocalLLaMA

用 Jetson Orin NX SUPER 16GB 做了个完全离线的行李箱机器人,跑 Gemma 4 E4B,没联网也能聊

一个叫 Sparky 的行李箱机器人,核心是一块 Jetson Orin NX SUPER 16GB 的板子,跑的是 Gemma 4 E4B 模型(Q4_K_M 量化版,用 q8_0 做 KV 缓存)。首次响应延迟大概 200 毫秒,生成速度每秒 14 到 15 个 token,上下文窗口 12K。身上挂了 30 多个传感器,但没装 WiFi、蓝牙和蜂...

推荐理由:这是个 Reddit 上的个人项目帖,不是产品发布或论文,所以放在低 featured 档。我会先打个折:200ms 的缓存首 token 延迟和 14-15 tok/s 的生成速度,在 Jetson 上跑 4B 模型算是能用的水平,但别指望它反应飞快。30+ 传感器听起来唬人,正文没细说都是什么传感器、怎么融合的,这点先别太激动。真正有意思的是全离线跑 Gemma 4 E4B 还让机器人带“观点”,把本地推理做成了人格化交互,比单纯报参数好玩。