跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 421–440 条 · 共 514 条

4月17日星期五

MIT Technology Review · AI

机器人是怎么学会干活的:一段当代简史

2025年人形机器人拿到的投资是61亿美元,是2024年的4倍。钱突然涌进来,不是因为造出了C-3PO,而是机器人学习的方式彻底变了。以前靠人手写规则,比如叠衣服要定义领口、袖口、折叠角度,情况一多规则就爆炸。2015年前后,前沿做法改成在仿真里用奖励信号让机器自己试错,跑几百万次来学会一个动作。2022年ChatGPT出来后,思路又跳了一步:把大模型...

推荐理由:这篇不是新发布,更像一篇梳理,所以放在 featured 偏低的档位。我会先打个折:正文在案例部分被截断了,后续公司细节没披露,这点先别太激动。但它的价值在于把 61 亿美元的热钱和两条技术路线讲清楚了——仿真试错那套从 2015 年就在跑,2022 年后多模态动作模型开始让机器人直接输出动作,本质是用数据换掉手写规则。对做具身智能的人来说,这个框架比单点新闻更有用。

X · @dotey(宝玉)

Seedance 2.0 API 开放,视频生成能直接串进工作流了

火山引擎把 Seedance 2.0 的 API 放出来了,国内走方舟平台,海外走 BytePlus。国内定价 46 元/百万 token,纯视频生成大概 1 元/秒,海外价格正文没写。这个 API 支持文字、图片、音频、视频四种输入,还内置了人脸验证、肖像授权和一万多个预置虚拟人像,可以用代码或 Agent Skills 把整条视频制作流程自动化。官...

推荐理由:这是一次 API 开放和定价更新,不是新模型发布。海外同步上线是个实在的钩子,价格信息也够具体,但正文没披露模型参数和统一评测基准,那个“效率提升近 10 倍”的个案先打个折看。整体对从业者有参考价值,所以给 74 分。

X · @op7418(歸藏)

Seedance 2.0 API 全量开放,支持文图音视频四种输入,还能做人脸登记和肖像授权

火山引擎把 Seedance 2.0 的 API 全量放出来了,国内走火山引擎,海外走 BytePlus。这个接口一次能接收文字、图片、音频、视频四种输入,也开放了人脸登记和肖像授权功能,可以直接用自己的脸生成视频,平台还预置了一批虚拟人像特征。正文没提价格、调用频率限制、模型版本和地区可用性,这些得自己去查。作者最期待的是把视频生成接进 Skills...

推荐理由:这是一次实打实的产品更新,不是概念发布。H 打满是因为全量开放意味着从 demo 到可集成的跨越;K 打满是因为四种模态输入和肖像授权机制都写清楚了,不是模糊的“多模态”;R 打满是因为视频生成类 API 的落地需求一直很旺,合规控制又是企业接入的硬门槛。分数定在 75,因为价格、速率限制、地区铺开节奏和实际生成质量正文都没给,这些缺口让实用性先打个折,别急着吹。

Latent Space

Anthropic 发布 Claude Opus 4.7:每个推理档位都压过 4.6 一头,还新增了 xhigh 模式

Anthropic 推出了新旗舰模型 Claude Opus 4.7,价格没变,还是每百万输入/输出 token 收 5 美元和 25 美元。最直观的变化是性能档位全面上移:4.7 的低档(low)比 4.6 中档强,中档比 4.6 高档强,高档则超过了 4.6 的 max 档。此外还新增了一个叫 xhigh 的推理强度,Claude Code 现在默...

推荐理由:Anthropic 旗舰模型更新,给了一堆可验证的数字和变化点,不是空对空吹牛。HKR 三项全过:钩子清楚、信息量足、对 Claude 用户群高度相关。重要性给 90 没毛病,属于那种“先别激动但值得马上看”的更新。

Hacker News 首页

Qwen3.6-35B-A3B 在我笔记本上画的鹈鹕,比 Claude Opus 4.7 画的还好

Simon Willison 在他的 MacBook Pro M5 上跑了一个 20.9GB 的 Qwen3.6-35B-A3B 量化版模型,让它和 Anthropic 刚发的 Claude Opus 4.7 比画 SVG 鹈鹕。结果 Qwen 画的自行车骨架是对的,Opus 却把车架画错了,连试两次都没救回来。作者怕大家说模型厂商专门练过他的鹈鹕题,...

推荐理由:Simon Willison 自己做了个主观测试,用 Qwen3.6-35B-A3B 的量化版在笔记本上生成 SVG 鹈鹕图,然后说比 Claude Opus 4.7 画得好。他特意补了一句:这个玩笑基准跟模型整体实力的相关性,这次已经破了。所以别当通用结论看,就是个有趣的单点对比。文章给了具体配置和复现方法,信息够用,但没做系统评测,判断就挂在主观偏好上。

X · @dotey(宝玉)

browser-use 开源 video-use:对着摄像头录完素材,跟 Claude Code 聊两句就能拿到剪好的视频

browser-use 团队把 video-use 开源了,这是一个 Claude Code 技能,你把录好的素材丢进文件夹,告诉 Claude 要剪成什么样,它就能自动裁掉“嗯”“呃”和空白段、调色、加字幕,还能用 Manim 或 Remotion 生成动画叠加层,最后输出 final.mp4。它不直接“看”视频,而是把 ElevenLabs 转写出...

推荐理由:这条更新对开发者来说够新鲜,hook 清晰、有可复用的架构细节和成本对比。我会先打个折:它只是 Claude Code 的一个技能,不是平台级发布,所以重要性停在 77 合理。正文没披露 ElevenLabs 转写成本和多轮自检的实际成功率,这点先别太激动。

4月16日星期四

X · @dotey(宝玉)

Anthropic 发布 Claude Opus 4.7,定价没变,但账单可能因为新分词器微涨

Claude Opus 4.7 上线了,API 名叫 claude-opus-4-7,输入每百万 token 5 美元、输出 25 美元,价格和 4.6 一样。这次主要升级了自主编程能力,能独立跑完更复杂的任务,还会自己验证结果再汇报。视觉方面,长边支持到 2576 像素,是之前的三倍多,截图不用再压缩了。不过有个背景:Anthropic 手里有个更强...

推荐理由:Anthropic 发新模型,不是改个名那种。2576 像素的视觉上限和 tokenizer 的 1.0–1.35 倍变化,直接影响到迁移测试和实际开销。标价没变但 token 消耗可能涨,这个信息对开发者比跑分重要。HKR 三项都踩实了,放 p1 没问题。

X · @op7418(歸藏)

Anthropic 发了 Claude Opus 4.7,加了自我验证和更细的视觉能力,价格没涨

Claude Opus 4.7 已经在所有产品和 API 上线,价格跟 Opus 4.6 一样。这次主要让模型能干更长时间的活,指令跟得更紧,汇报前会自己先检查一遍输出,减少人工盯着。视觉方面能看清长边最长 2,576 像素的图,比之前精细不少。Claude Code 里多了个 Ultra Review 命令专门做审查,思考等级加了 xhigh 档位,...

推荐理由:Anthropic 这次把 Opus 4.7 铺到了所有 Claude 产品和 API 上,价格没变,这点先别太激动,但确实降低了升级门槛。正文列出的更新比较实在:长任务处理更稳、指令执行更准、输出前会自己检查一遍,相当于模型多了个校对环节。视觉输入把长边限制提到了 2,576 像素,能塞进更清晰的图。配套的 Claude Code 加了 Ultra Review 命令和 xhigh 思考等级,Max 用户还能开自动审批,适合把模型放进业务流程里跑。整体看,这是一次偏可靠性和工作流适配的更新,没有吹新 benchmark,但信息量够,对从业者有参考价值。

Hacker News 首页

Anthropic 发布 Claude Opus 4.7,首次在较弱模型上部署网络安全拦截

Anthropic 在 4 月 16 日上线了 Claude Opus 4.7,价格和上一代 Opus 4.6 一样,输入每百万 token 5 美元,输出每百万 token 25 美元。这次更新主要强化了复杂软件工程任务和长流程工作的稳定性,模型会自己检查输出再汇报,视觉分辨率也更高了。官方给出的基准测试分数比 Opus 4.6 好看,但正文没有把所...

推荐理由:Anthropic 把 Claude Opus 4.7 推成正式版,价格没动,上线渠道覆盖了 API 和三大云平台,对实际工作流有直接影响。我会先打个折:正文说编程、长任务和视觉有提升,但具体跑分没全放出来,这点先别太激动。真正值得盯的是网络安全防护先在这个模型落地,安全策略有变化。整体信息够用,但缺完整数据支撑。

Hacker News 首页

通义千问开源 Qwen3.6-35B-A3B:总参数 350 亿,每次推理只激活 30 亿,主打编程智能体

Qwen 放出了一个新开源模型 Qwen3.6-35B-A3B,用的是混合专家架构,总参数量 350 亿,但实际干活时只调用 30 亿参数,跑起来很省资源。它的核心卖点是编程智能体能力,在 SWE-bench Verified 上拿了 73.4 分,Terminal-Bench 2.0 上 51.5 分,直接超过了自家上一代 270 亿参数的密集模型 ...

推荐理由:这是 Qwen 正经发模型,不是套壳功能更新。HKR 三条全中:低激活参数做代理编程是钩子,基准分数给了具体数字,开源权重加 30 亿激活直接戳部署成本和竞争焦虑。没给 p1 是因为目前只有一篇博客,还没看到第三方复现和更多消融实验。

r/LocalLLaMA

Qwen 放出 Qwen3.6-35B-A3B,35B 总参数只激活 3B,开源可商用

Qwen 发了个新模型,叫 Qwen3.6-35B-A3B,用的是稀疏 MoE 架构,总参数量 35B,但每次推理只激活其中 3B 参数,跑起来会比较省资源。采用 Apache 2.0 协议,可以商用。官方说法是它在写代码、处理多模态任务上表现不错,还支持“思考”和“不思考”两种模式,能直接塞进业务流程里干活。不过这篇帖子没给出具体的跑分、上下文窗口长...

推荐理由:这条帖子是个发布通告,信息量有限但钩子够硬。35B 总量、3B 激活的稀疏 MoE 听着省算力,但正文没放基准和上下文窗口,我会先打个折。Apache 2.0 开源是实锤,对想自己部署的人有吸引力;agentic coding 和多模态推理的说法先别太激动,等实测数据出来再看。

Hacker News 首页

Darkbloom:用闲置 Mac 跑加密推理,号称比 OpenRouter 便宜七成

Eigen Labs 搞了个叫 Darkbloom 的去中心化推理网络,把一亿多台苹果芯片 Mac 的闲置算力攒起来卖。它提供兼容 OpenAI 的 API,主打端到端加密和硬件验证,说操作节点的人看不到你的数据。价格表上列出的 token 费用比 OpenRouter 低 50%,不是标题里的 70%,这点先打个折。正文没披露独立安全审计的具体范围,...

推荐理由:HKR 三条全中:闲置 Mac 组网做推理的玩法有新鲜感,文章也把规模、接口、加密和价格都摆出来了。我先打个折,维持在 80 分——这还只是团队自己发的预览,审计范围、网络稳定性、攻击面边界都没经过第三方验证,论文出来之前别太激动。

TechCrunch · AI

谷歌给 Mac 做了个原生 Gemini 应用,快捷键一按就能用

谷歌在 4 月 15 日上线了 Gemini 的 Mac 原生应用,要求 macOS 15 以上系统。跟之前用网页版不同,现在按 Option + 空格就能在任何界面呼出它,不用切窗口。你可以把当前屏幕内容或本地文件直接丢给它,让它帮你总结图表、核对日期或写公式。应用还内置了 Nano Banana 生图和 Veo 生成视频的功能。简单说,谷歌终于追上...

推荐理由:Google 给 Mac 发了个原生 Gemini 应用,快捷键一按就能呼出,还能直接把整个屏幕或本地文件丢给它看。我会先打个折:这不算模型能力飞跃,更像在抢桌面入口和用户上下文。正文没提和网页版在回答质量上有没有区别,也没给延迟或资源占用数据,所以别急着说体验一定更好。但能共享屏幕和文件,意味着它想当个看得见你桌面的助手,这点比多一个客户端重要。整体是中等体量的产品更新,放在 featured 低位合适。

4月14日星期二

最佳拍档

H100 租赁价五个月涨近 40%,全球 GPU 算力全面断供

SemiAnalysis 的报告显示,从 2025 年 10 月到 2026 年 3 月,英伟达 H100 的一年期租赁价格从每小时每 GPU 1.70 美元涨到了 2.35 美元,涨幅接近 40%。现在想租一个 64 块 GPU 的小集群都很难,现货市场基本无货可租。需求端主要被几件事同时推着走:Anthropic 的 Claude 产品收入一个季度...

推荐理由:我会先打个折:这是对 SemiAnalysis 报告的二次视频解读,不是一手厂商公告,所以没给 P1。但内容本身够硬——H100 租金五个月涨 40%,背后是 Anthropic 需求拉升、多智能体工作流和音视频生成把 token 消耗推高,加上内存价格翻倍涨,供给端根本接不住。正文没披露具体调研方法,但 100 多家供应商的样本量和现货 14 美元的极端报价,让判断有底。对正在做模型或搭 agent 的团队来说,这比换代传闻更肉疼,所以 HKR 全中。

4月11日星期六

量子位 · 公众号

上海AI实验室把OpenClaw那套方法搬到了多模态生成上,6B小模型在部分任务跑赢了Nano Banana 2

上海AI实验室的团队搞了个叫GEMS的方法,给多模态生成模型加上了Agent循环、记忆和技能模块,相当于让模型在生成图片时能自己规划步骤、记住中间结果。他们用6B参数的Z-Image-Turbo做实验,在5个主流任务上平均提升14.22分,在4个下游任务上比之前最好的基线又高了8.92分,部分指标超过了Nano Banana 2。论文和代码都公开了,但...

推荐理由:这条的钩子很直接——6B 模型在多模态生成上叫板 Nano Banana 2。文章把做法讲清楚了:不是单纯换模型,而是把 agent 循环、记忆和技能模块塞进生成流程,相当于让模型边画边改、边查资料。给出的数字也具体,5 个任务平均涨 14.22,下游再涨 8.92,论文和代码都有,可以自己验。我会先打个折,因为正文没披露 Nano Banana 2 的完整对比设置,不知道对方有没有用同样的 agent 套路,所以不能直接当碾压局看。但方向本身值得关注,小模型靠推理时多跑几步来追大模型,这条路如果走通,部署成本会友好很多。

量子位 · 公众号

刘壮陈丹琦团队开源Vero:一个通用视觉推理强化学习框架,没用到任何思考数据就刷新了SOTA

普林斯顿刘壮和陈丹琦团队开源了Vero,一个用强化学习训练视觉推理模型的通用框架。它从59个数据集里筛出60万条样本,按六类任务分别给奖励,单阶段RL训练后,在30个基准里有23个超过了Qwen3-VL-8B-Thinking。最值得看的是它没用到任何私有的思考数据,纯靠任务路由奖励机制让模型学会推理。不过正文没披露训练成本和基座模型的具体配置,这点先...

推荐理由:我会先打个折:正文没披露训练成本和基座模型配置,复现条件还不清楚。但“零思考数据”这个说法本身就有冲击力,加上23/30的基准成绩和明确的方法细节,对从业者来说是个值得关注的开源信号。所以给featured、82分,不往上拉是因为关键复现信息还缺着。

量子位 · 公众号

中国具身模型在 MolmoSpace 基准上拿了第一,同时开源了 10 万小时人类操作数据集

Psibot 说他们的 Psi-R2 模型在 AllenAI 的 MolmoSpace 基准上排到了第一,但正文没披露具体任务设置和完整对比基线,所以这个“第一”的含金量得先打个折。他们同时放出了一个 100,889 小时的操作数据集,其中 95,472 小时是人类数据,5,417 小时是机器人数据,目前只开源了 1,000 小时。数据覆盖 294 个...

推荐理由:我会先打个折:正文说“成功率高近10倍”,但没交代任务设置、基线模型全名和统计细节,这个第一的含金量暂时没法核实。不过数据集的规模和构成是实打实的——近10万小时人类数据加真机数据,还混了失败样本进去,这对训练机器人操作模型是个值得跟的信号。推理延迟压到100毫秒内,说明工程上做了不少优化。整体看,信息量够、有讨论空间,但榜单那部分先别太激动,等更多细节放出来再说。

4月10日星期五

量子位 · 公众号

腾讯开源3B模型HiVG,用“分段打包”把SVG序列缩短六成,生成质量对标GPT和Claude

腾讯混元放出了一个30亿参数的开源模型HiVG,专门把图片转成SVG矢量图。它的核心思路是把绘图指令和坐标打包成“段token”,再用一个叫HMN的模块给坐标编码做初始化,让模型更懂几何关系。这样生成的SVG代码序列比传统方法短了62.7%到63.8%,省token就是省钱。在Image-to-SVG任务上,它的SSIM达到0.896、LPIPS低到0...

推荐理由:腾讯混元把 3B 小模型做到 SVG 指标能跟 GPT-5.2、Claude-4.5-Sonnet 掰手腕,靠的不是堆参数,而是把绘图命令和坐标打包成 segment token,再用 HMN 初始化坐标 embedding,序列长度直接砍掉六成多。文章给了 SSIM、LPIPS、CLIP-S 三组数,信息量够,不是空口说白话。不过 SVG 生成本身偏小众,离多数人的业务场景还有点距离,所以 novelty 和 knowledge 都到位,但 relevance 只能算一般。

4月9日星期四

量子位 · 公众号

腾讯推出MoT架构,2B参数的具身模型在22项评测里拿了16项第一

腾讯混元与Robotics X联合发布了HY-Embodied-0.5,核心是一个叫MoT-2B的模型。它总参数量4B,实际干活时只激活2B,在22项具身智能评测中拿了16项第一。训练数据量不小:用了超过1亿条具身数据、600B以上的预训练token、3000多万条中期训练样本,还引入了视觉隐空间token、双向注意力、RFT、强化学习和在线蒸馏。这模...

推荐理由:我会先打个折:这还是一次模型发布,不是那种当天就改变行业格局的大事,所以分数没拉到 85 以上。但它的钩子够强——腾讯说 MoT 比 MoE 更适合具身,而且一个激活参数只有 2B 的模型在 22 项评测里赢了 16 项,数字和训练细节也给得实在。对做端侧机器人的从业者来说,这套专门为具身重做的架构和训练链路比通用模型微调有意思得多,所以 H、K、R 都站得住。

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。