跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 341–360 条 · 共 514 条

5月6日星期三

r/LocalLLaMA

Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍,48GB 显存可跑 26 万上下文

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者分享了一个 llama.cpp 的 PR,为 Qwen 3.6 27B 模型添加了 MTP(多令牌预测)支持,实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化,这让一...

推荐理由:HKR 三项都站得住:提速和长上下文对本地 agent 是实打实的吸引力,帖子里机制和数字都列清楚了,成本优势也直接。不过只有 Reddit 单源,配置也有点折腾,所以放在 featured 低位。

机器之心 · 公众号

阿里开源 PromptEcho:用冻结的视觉语言模型给文生图训练打分,省掉额外训练成本

PromptEcho 的做法很直接:拿一个现成的、参数冻结的 Qwen3-VL-32B 模型,让它“读”一遍原始提示词,算出模型自己生成这些词的概率(交叉熵),然后把这个概率的负值当作连续奖励信号,喂给文生图模型做训练。好处是不用再单独训一个评分模型,省事。在 5000 张海报测试里,文字准确率从 68% 提到了 75%。不过正文没披露这个奖励信号跟人...

推荐理由:我会先打个折:这不是一个新模型发布,而是训练侧的 reward 方法开源,所以重要性给 78 算合理。钩子在于冻结大模型直接当 reward 用,省成本;知识密度够,把 teacher-forcing CE 怎么变成连续 reward 讲明白了,还给了 10 万张图的规模和具体数字;相关性上,文生图圈对廉价 reward 和文字准确率这两个需求很实在,75% 虽然不算完美,但方向对。正文没披露这个 reward 方法在更大规模训练下的稳定性,这点先别太激动。

机器之心 · 公众号

明略开源两套工具,让 Mac 跑本地模型和操控桌面

明略科技放出了两个开源项目:Cider 和 Mano-P 1.0,都是给苹果 M 系列芯片用的。Cider 是个推理加速引擎,在 M5 Pro 上跑 Qwen3-VL-2B 时,把生成第一个 token 前的等待时间缩短了 57% 到 61%。Mano-P 1.0 是个能操作电脑界面的模型,72B 版本在 OSWorld 测试里拿了 58.2 分。不过...

推荐理由:我会先打个折:明略不是一线模型实验室,所以分数没往上拉。但选题本身够实用——Mac 本地跑视觉模型和 GUI 智能体,还给了可复现的提速数据和内存门槛。Cider 的 prefill 加速和 Mano-P 在 OSWorld 的成功率都有具体数字,16GB 设备准确率下降也写明了,不是纯 PR 稿。对想在 Apple Silicon 上折腾本地推理的人,这篇值得看一眼。

新智元 · 公众号

GPT-5.5 Instant 成了 ChatGPT 的免费默认模型

OpenAI 把 GPT-5.5 Instant 设成了 ChatGPT 的默认模型,所有用户都能免费用。AIME 2025 的得分从 65.4% 涨到 81.2%,回答长度缩短了 30.2%,在高风险提示上的幻觉率比 GPT-5.3 Instant 低了 52.5%。Plus 和 Pro 的网页用户会先拿到聊天、文件和 Gmail 的个性化功能;AP...

推荐理由:我会先打个折:OpenAI 把 GPT-5.5 Instant 免费推给所有人,这件事本身就值得写。文章给了三个硬数字——AIME 2025 准确率涨了 15.8 个百分点、回复字数砍掉近三分之一、高风险幻觉少了一半多,说明新模型在推理和可靠性上都有明显提升,而且输出更省 token。对从业者来说,默认模型一换,日常使用成本和体验都会变,Plus/Pro 还加了聊天记录和 Gmail 个性化,这些改动直接踩在工作流上。正文没披露免费版的速度和并发限制,这点先别太激动,但整体信息量够,属于必须覆盖的更新。

The Verge · AI

苹果可能在 iOS 27 里让你自己选 AI 模型

Mark Gurman 爆料,苹果计划在 iOS 27、iPadOS 27 和 macOS 27 里开放“扩展”机制,让第三方聊天机器人接管 Siri、写作工具和图片生成这些系统级功能,不再只绑死 ChatGPT。用户能把自己常用的模型设成默认。不过原文没提会支持哪些模型、怎么收费、开发者接口长什么样,这些关键信息都还缺着,先别太激动。

推荐理由:HKR 三项都成立:系统级模型选择器是个强钩子,也给了具体的 Extension 落点。打 80 分是因为正文没披露支持哪些模型、怎么收费、开发者接口长什么样,目前还只是一份路线图爆料,我会先打个折。

5月5日星期二

r/LocalLLaMA

SenseNova-U1-8B-MoT 开源多模态架构引发讨论,去掉 VE 和 VAE 的单体设计是亮点还是噱头?

商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型,能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构,把传统多模态模型里常见的 VE(视觉编码器)和 VAE(变分自编码器)都去掉了,支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升,但帖子正文没给出...

推荐理由:HKR 三项都踩中了:架构钩子够具体,一个 8B 模型把理解和生成揉在一起,还砍掉了 VE/VAE;信息增量有,但缺实测分数和部署成本,所以分数压在 72–77 这个区间。我会先打个折,没看到跑分和许可就别急着全信,但方向值得盯。

The Verge · AI

郭明錤爆料 OpenAI 正在给 ChatGPT 做手机,计划 2027 年初量产

天风国际分析师郭明錤说,OpenAI 正在加速推进一款 ChatGPT 手机,目标是 2027 年初开始大规模生产。这款手机会用联发科定制的天玑 9600 芯片,图像处理器(ISP)专门加强了 HDR 能力,可能是为了提升相机和视觉识别体验。不过,原文没提手机卖多少钱、长什么样、用什么操作系统。郭明錤的供应链爆料准确率不低,但 OpenAI 自己还没回...

推荐理由:HKR 三项全中,但消息源是郭明錤的供应链爆料,不是 OpenAI 官方发布。我会先打个折:正文没披露价格、外观和系统,这些关键信息全缺,所以重要性到不了必写级别。

TechCrunch · AI

Meta 要用 AI 看身高和骨骼结构来判断用户是不是未成年

Meta 正在部分国家上线一套视觉分析系统,通过照片估算用户的身高和骨骼发育程度,来抓出谎报年龄的未成年用户。公司说后续会推到更多地区,但正文没披露具体是哪些国家、误判率有多高,也没提用户如果被误判后怎么申诉。

推荐理由:我会先打个折:正文没披露覆盖国家、误判率和申诉机制,所以没法判断实际效果。但这件事值得盯,因为用骨骼结构做年龄推断,比单纯看脸更隐蔽,一旦出错,未成年人可能被误拦或漏过,后续怎么申诉、谁来复核,目前全是空白。

5月4日星期一

机器之心 · 公众号

ACL 2026:港理工开源“会思考”的手语翻译模型 SignThought,不用中间标注直接出文字

香港理工大学和四川大学搞了个叫 SignThought 的手语翻译模型,中了 ACL 2026 主会,还被推荐做口头报告。它最大的不同是不依赖“手语注释”(gloss),直接看视频出文字,省掉了中间那层人工标注。做法是让模型先在心里盘一遍大概意思(latent thoughts),再分两步走:先规划再落地(plan-then-ground),最后用双流...

推荐理由:ACL 2026 Main 接收并拟推荐口头报告,加上开源模型和新数据集,H、K、R 三项都站得住。方法有具体拆解,五个 benchmark 验证,不是空对空。手语翻译这个细分方向让它比通用多模态模型或开发者工具的关注度低一些,所以重要性没给更高。

r/LocalLLaMA

一个 4.5 亿参数的视觉模型在卫星上跑野火检测,瓶颈不是模型质量,是带宽

作者 PauLabartaBajo 搭了一套端到端的野火预防管线,把 4.5 亿参数的视觉语言模型 LFM2.5-VL 直接部署在卫星上做推理。核心约束是卫星下行带宽太窄,传不了大尺寸多光谱图像,所以方案反过来:在轨跑模型,只下传一份 JSON 格式的风险评估结果。管线用 Sentinel-2 的 RGB 和短波红外(SWIR)图像拼成输入——SWIR...

推荐理由:我会先打个折:这是单人 PoC,只在 22 个地点跑过模拟轨道,正文没披露真实卫星上的延迟和误报率,所以别当成熟方案看。但它的思路很清晰——把算力留在天上,只传结论不传图,带宽省得不是一点半点。用 450M 小模型而不是大模型,也说明在轨推理的硬件约束有多硬。对关注边缘部署和遥感落地的从业者,这个方向值得跟,但验证还差得远。

5月3日星期日

量子位 · 公众号

清华 AIR 开源具身智能仿真框架 GS-Playground,一块 4090 能同时跑 2048 个场景

清华 AIR DISCOVER 实验室和合作方开源了 GS-Playground,已被 RSS 2026 接收。这个框架把批量 3D 高斯泼溅渲染和并行物理引擎绑在一起,专门解决机器人训练时视觉仿真的算力瓶颈。在 RTX 4090 上,640×480 分辨率能跑到每秒一万帧,同时并行跑 2048 个场景;50 个人形机器人的基准测试里也能维持每秒 10...

推荐理由:这篇是清华 AIR DISCOVER Lab 开源的具身智能仿真框架 GS-Playground,论文被 RSS 2026 录用。我会先打个折:它解决的是仿真渲染的吞吐问题,不是直接训出一个更强的机器人模型,所以重要性到不了模型发布那档。但它的数字确实硬——单卡 RTX 4090 在 640×480 下渲染能冲到 10000 FPS,最多并行跑 2048 个场景,50 个人形机器人基准也能稳住 1015 FPS。真正值得盯的是他们把 3D 高斯泼溅的批渲染跟物理仿真并行耦合起来了,这比单纯吹 FPS 更有工程价值。正文没披露大规模训练后的策略迁移效...

r/LocalLLaMA

M1 Max 本地跑 10 个生图模型横评:Qwen-Image 蒸馏版 8 步出图比原版快 9 倍

一位 Reddit 用户在自己的 M1 Max(64GB 内存)上测了 10 个图像模型,从 SD 1.5 一路测到 Flux dev、Qwen-Image 和 Gemini。Qwen-Image Lightning 用 8 步蒸馏把出图时间从 93 分钟压到 10 分钟,效果还比原版好。Flux dev 在本地模型里写实感最强,但提示词偏英文思维,处...

推荐理由:Reddit 用户实打实在自己机器上跑了一遍,不是厂商通稿。Qwen-Image 蒸馏版 10 分钟出图、质量还更高,这点先别太激动,样本只有一个人一台机器,但 93 分钟到 10 分钟的差距确实说明蒸馏这条路在本地部署上挺省钱。Flux dev 写实强但偏英语文化,Gemini 中文和日语语境更准但要上云,这个取舍对国内用户有参考价值。正文没披露具体 prompt 和评分标准,所以数字只能当参考,不能当排名。

TechCrunch · AI

奥斯卡新规:AI 生成的演员和剧本不能拿奖了

美国电影艺术与科学学院给第 99 届奥斯卡定了新规矩,直接把 AI 生成的表演和剧本挡在门外。规则写得很明白:能提名表演奖的,必须是片尾字幕里合法署名、且由真人同意后完成的演出;剧本也得是“人类写的”才有资格。学院还留了一手,有权随时要求片方交代电影里用了多少 AI、人的创作占了多少。这波操作背景是 AI 已经在影视圈搅出不少事——有独立电影在用 AI...

推荐理由:美国电影艺术与科学学院给第 99 届奥斯卡加了硬杠杠:AI 生成的表演和剧本不能拿奖。表演得是活人演的,而且这个人要有法律署名、明确同意出演;剧本也得是人写的。学院还留了一手,可以要求片方交代用了哪些 AI、人类作者是谁。正文没提如果不披露会有什么后果,这点先别太激动。整体看,这不是模型发布或产品上线,而是行业头部奖项在给生成式 AI 划地盘,对创作圈的版权和饭碗焦虑算是一次明确回应,所以放在 featured 低位。

5月2日星期六

r/LocalLLaMA

Qwen 3.6 跑分赢,但 Gemma 4 实际用起来更省心:本地跑 27B/31B 视觉模型的 7 条实测发现

一位 Reddit 用户把 Qwen 3.6 和 Gemma 4 的 27B/31B 视觉模型拉到本地,用 vLLM 跑 FP8 精度对比。Qwen 在 GeoGuessr 这种难图上一次推理能烧掉 8000 多个 token,Gemma 经常 1500 个就搞定;Qwen 做视频还得先花 2 FPS 预处理。另外有个坑:vLLM 和 Llama.cp...

推荐理由:我会先打个折:这只是 Reddit 单帖,不是系统评测,权威性有限。但它的价值不在权威,而在“榜单赢家落地翻车”这个反差,以及 8000+ vs 1500 token、2 FPS、视觉 token 预算这些具体设定。对正在纠结选 Qwen 还是 Gemma 做本地视觉任务的人,这些信息比跑分榜实在得多。所以 HKR 三项全过,但因为没有官方结论或产品级变动,分数就停在 76,不进 P1。

5月1日星期五

新智元 · 公众号

一个开发者用10天婚假做了个AI世界生成器,一句话就能生成会自己运转的小镇

这个叫WorldX的项目,你输入一句话,它大概5分钟就能生成一个完整的AI世界。背后是一套6步地图生成流程,每个世界消耗约3万到18万个token。里面的NPC有自己的两层记忆和双轴情绪,会按Tick循环自主行动。比较有意思的是它用叠加标签加色差定位来做确定性坐标,让角色能真正走到具体位置而不是大概描述。不过正文没披露实际运行时的延迟和稳定性数据,这点...

推荐理由:我会先打个折,这是个独立项目不是大厂发布,所以分数压在75附近。但它的技术披露很实在,地图管线分6步、token消耗范围明确、坐标转换方案有工程参考价值,不是那种只放视频不说原理的展示。对正在折腾 Agent 记忆和世界生成的人,这篇文章能省不少试错时间,所以给 featured 没问题。

量子位 · 公众号

北大和快手可灵开源 OpenWorldLib,一个框架想统一视频生成、3D、机器人控制和推理

正文因为微信环境异常被拦截了,实际内容没抓到。从现有标题和英文摘要看,北大 DCAI 和快手可灵开源了一个叫 OpenWorldLib 的统一世界模型框架,把视频生成、3D 建模、VLA 机器人控制、多模态推理四类任务塞进一套 Pipeline 里。Pipeline 里分了 Operator、推理、合成、表征和记忆几个模块,支持前向和流式执行。核心看点...

推荐理由:HKR 三项都踩中了:框架覆盖四类任务、模块和推理模式交代得具体、落脚点在降低复现成本。但正文没给基准测试结果、没提实际部署规模或生态接入情况,所以分数先停在 78,别急着往上调。

r/LocalLLaMA

Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文,工具调用也稳了

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B(一个 270 亿参数的模型),把上下文窗口推到了约 21.8 万个 token,生成速度在每秒 50 到 66 个 token 之间。之前工具调用时,如果返回结果有 2.5 万个 token 左右就会爆显存,他修了一个叫 Genesis PN12 补丁的锚点...

推荐理由:我会先打个折,这是 Reddit 个人实测,不是官方基准。但信息量够:修了 Genesis PN12 补丁后,25K token 的工具调用不再 OOM,198K 加 vision 能到 51/68 TPS。限制也说清楚了,单提示单卡在 50–60K 附近还有第二个内存断崖,这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说,这些数字和踩坑记录比论文更有参考价值。

4月30日星期四

r/LocalLLaMA

DeepSeek 放出了“用视觉原语思考”框架,让模型在推理时直接画坐标和框

DeepSeek 和北大、清华一起发了篇论文,还公开了代码库。这个框架的思路是在思维链里插入坐标点和边界框,相当于让模型边想边在图上做标记。帖子本身没贴跑分数据,正文也没披露具体指标,所以效果到底提升多少还不清楚。

推荐理由:我会先打个折,因为正文没披露任何 benchmark 分数,效果到底怎么样还不清楚。但亮点很实在:它让模型在推理时能指着图像说“看这里”,把坐标点和边界框当成思考的最小单元,这比纯文字描述直观得多。代码已经开源,对做多模态推理和可解释性的从业者来说,是个值得上手试的方向。没给分数就先别太激动,但思路本身够新,所以给到 80 分。

Hacker News 首页

Meta 因智能眼镜隐私争议终止肯尼亚外包合同,上千名数据标注员失业

BBC 报道,Meta 在瑞典媒体曝光其智能眼镜用户被拍到上厕所、发生性关系等私密画面后,终止了与肯尼亚外包公司 Sama 的合同,导致 1108 名员工被裁。这些员工的工作是给 AI 做数据标注,也就是人工查看眼镜拍下的视频和对话记录,教 AI 识别图像、改进回答。Meta 给出的理由是 Sama 没达到标准,但 Sama 否认,并称从未收到过不合格...

推荐理由:我会先打个折——信息源只有一条 RSS 片段,很多细节都空着。但标题给出的冲突已经足够具体:Meta 员工在审核智能眼镜内容时撞见用户隐私画面,结果自己被裁。这比一般的隐私争议更尖锐,因为它把“谁来看、看了怎么办”的审核机制问题摆到了台面上。对做 AI 硬件的团队来说,这是个现成的风险案例:产品还没大规模铺开,信任先裂了一道口子。正文没写人数和岗位,这点先别太激动,但话题本身值得放进精选。

Google DeepMind

Google DeepMind 发布 AI co-clinician 医疗研究计划

Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,它在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。

推荐理由:Google DeepMind 公开 AI co-clinician 研究计划与多模态问诊评测,可了解医疗智能体当前能力边界。