跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 401–420 条 · 共 514 条

4月22日星期三

The Verge · AI

OpenAI 更新图片生成器,现在能联网搜资料来画图了

ChatGPT Images 2.0 这次最大的变化不是画质,而是能上网查资料。你选一个会思考的模型,它就能根据一个提示词生成一组图片,比如直接搜网页信息来画一本杂志封面。背后跑的是 GPT Image 2 模型,目前 Plus、Pro、Business 和 Enterprise 用户能用。正文没提什么时候全面推送、有没有用量限制、价格会不会变,这点先...

推荐理由:我会先打个折:正文没写具体上线时间、调用上限和价格变动,所以别急着算成本。但这次更新把“联网取数”和“多图生成”塞进一个工作流,等于让模型先查资料再画图,还能一次出好几张。对需要快速配图、做素材的人,这比单张生成实用得多。不过实际效果还得看联网检索准不准、多图一致性怎么样,这点先别太激动。

TechCrunch · AI

Clarifai 删掉了从 OkCupid 拿来的 300 万张用户照片,这些照片曾被用来训练人脸识别模型

Clarifai 跟 FTC 和解后,删了 300 万张照片和用这些数据训出来的模型。照片是 2014 年从约会软件 OkCupid 要来的,当时 OkCupid 的高管还投了 Clarifai。说白了就是投资人和被投公司之间私下传了用户数据,拿去训人脸识别 AI。正文没披露和解的具体条款、怎么验证删除是否彻底,也没说删模型对现有产品性能有多大影响。

推荐理由:故事钩子强,事实也扎实,合规链条是AI团队现在真得盯的事。Featured合适,但正文没写和解条款、怎么验证删除、模型受影响多大,这些缺口把分数压在70多分。

4月21日星期二

Ben's Bites

Claude 新增设计面板,问几个问题就能出原型图

Anthropic 给 Claude 加了一个“设计”标签页,会先弹出 5 到 10 个问题跟你互动,然后直接生成线框图或高保真原型。作者实测发现,传图片转设计的流程在原型模式下效果不错。目前这个功能还在研究预览阶段,有独立的使用额度,20 美元月费套餐一周大概只能跑两三次大尺寸生成。文章更尖锐的吐槽在可用性上:Claude Cowork 很多能力依赖...

推荐理由:Anthropic 给 Claude 加了个 Design 标签页,对天天用 Claude 的人是个明确的信号。文章有实测细节——5-10 轮交互出原型、图像转设计流程可用、20 美元套餐每周只够跑两三次大生成——所以 HKR 三项都站得住。但这仍然是个单功能更新,不是平台级变化,我会先打个折。真正值得盯的是产品可用性:作者点名 Claude Cowork 依赖 connectors 和 plugins,但入口藏太深,这点先别太激动,等更多用户反馈再说。

机器之心 · 公众号

Monet:让多模态模型在脑子里直接画图推理,不用每次都调外部工具

Monet 把 Qwen2.5-VL-7B 改造成 Monet-7B,核心是让模型在连续的视觉潜空间里做抽象推理,而不是每次都去调用外部画图或识别工具。训练分三步:先用 12.5 万条数据做监督微调,再用 VLPO 强化学习对齐偏好。在分布内任务上比原版模型提升 3% 到 9.75%,在分布外的抽象视觉推理上提升 2.31%。论文被 CVPR 2026...

推荐理由:这篇讲的是Monet,基于Qwen2.5-VL-7B做的一个模型,核心是让多模态模型像人一样做抽象视觉思考。它不用外部工具,而是用连续隐式视觉嵌入来搞定,这点我会先打个折——思路不新,但工程上做得扎实。论文已被CVPR 2026接收,代码、模型和125K条SFT数据都开源了,对想复现的人友好。方法分三阶段SFT加一个叫VLPO的强化学习,用偏好样本教模型学回答风格。文中说分布内任务比基座好3%到9.75%,分布外抽象视觉推理提升2.31%,数字看着还行,但别太激动,因为没披露统一榜单的完整绝对分数,不知道跟其他模型比到底排第几。真正值得盯的是它把V...

OpenAI News

OpenAI 发了 ChatGPT Images 2.0,主打文字渲染、多语言和视觉推理

OpenAI 在 4 月 21 日官宣了 ChatGPT Images 2.0,说新模型在三个地方有提升:画面里的文字更准、多语言排版更稳、能根据复杂指令做视觉推理。官方放了一堆样图,从海报、漫画到杂志内页都有,看着确实比上一代强。但正文没披露模型架构、出图分辨率、价格、延迟和具体上线时间,也没给对比数据。文字渲染和多语言到底稳不稳,还得等实际用起来再...

推荐理由:OpenAI 自己发的图像模型更新,版本号直接叫 2.0,文字渲染又是老痛点,所以热度和落地价值都够。但我会先打个折:正文只给了三项改进的标题级信息,分辨率、价格、延迟、架构和可用范围全都没披露,现在只能当个预告看。真正该盯的是文字可读性和多语一致性有没有实测提升,这点先别太激动。

Latent Space

月之暗面发布 Kimi K2.6 开源模型,在长任务执行上对标 Claude Opus 4.6

月之暗面推出了 Kimi K2.6,一个总参数 1 万亿的混合专家模型,每次推理激活 320 亿参数,支持 25.6 万 token 的上下文窗口。它主打的是长时间、多步骤的智能体任务,官方宣称能连续跑 12 小时以上、调用超 4000 次工具、并行管理 300 个子智能体。在 SWE-Bench Pro 编程基准上得分 58.6,HLE 带工具得分 ...

推荐理由:我会先打个折:SWE-Bench Pro 58.6 这个数正文没给对比基线,不知道和 Opus 4.6 的差距到底多大,这点先别太激动。但 Kimi K2.6 真正值得盯的不是基座跑分,而是它把 agent 执行时长拉到 12 小时、能并行跑 300 个子代理,这在开源模型里算往前拱了一步。国内大模型旗舰发布本身就自带信号,加上抢在 DeepSeek v4 前出牌,对关注开源模型进展的人有信息差价值,所以给到 P1。

Hacker News 首页

膨胀伪影:大模型输出的瑕疵不是压缩痕迹,而是解压时脑补过头的证据

Matt Ström-Awn 把大模型生成内容里的毛病叫做“膨胀伪影”,而不是压缩伪影。他的逻辑是:模型从模糊的训练数据里往外“解压”时,会在信心不足的地方用训练分布里的高频模式硬填,于是就有了那些套话、过度注释的代码、六指手和穿模视频。这些痕迹能当法医线索用——斯坦福的研究人员靠追踪 ChatGPT 发布后词频飙升的词(比如 commendable、...

推荐理由:我会先打个折,这是个人博客评论,不是一手研究或产品发布,所以分数停在 73。但它的钩子很巧,把 LLM 的毛病重新包装成“扩展伪影”,一下就把审美收敛和生成路径暴露的问题串起来了。文章给的数字也实在,17.5% 的论文和 16.9% 的审稿有 AI 起草痕迹,说明这已经不是小范围现象。JPG 压缩 10000 次后 PSNR 掉到 14.59 的类比虽然不算严谨实验,但直观地让人感受到反复生成带来的退化。真正值得盯的是取证价值:这些伪影不光是风格问题,还可能成为追踪生成路径的线索,这对审稿信任和内容溯源都挺要命的。

Latent Space

用 Transformer 解决癌症临床试验 95% 的失败率——Noetik 的 Ron Alfa 和 Daniel Bear

95% 的癌症疗法通不过临床试验,Noetik 认为这主要是个配对问题:没搞清楚哪个病人、哪种肿瘤、该用哪种已有的药。他们训练了一个叫 TARIO-2 的自回归 Transformer,能从每个病人都会做的常规 H&E 染色切片里,直接预测出约 19,000 个基因的空间表达图谱。这种空间转录组数据原本是读肿瘤最丰富的方式,但标准治疗里几乎没有病人会做...

推荐理由:我会先打个折:正文没披露 TARIO-2 在独立验证集上的具体性能指标,也没说 5000 万协议是里程碑付款还是一次性,这点先别太激动。但这条消息的钩子很准——它没吹“AI 治愈癌症”,而是把 95% 的失败率解释成患者、肿瘤和疗法没对上号,然后用 transformer 从常规病理切片里预测近两万个基因的空间分布,相当于给肿瘤微环境画了一张高维地图。GSK 愿意掏钱,说明至少内部验证过了门槛。对从业者来说,值得盯的是这种“从便宜影像出昂贵组学数据”的省钱逻辑能不能复制到其他癌种,以及模型泛化到不同医院染色标准时会不会崩。

4月20日星期一

r/LocalLLaMA

TRELLIS.2 图片转 3D 模型现在能在苹果芯片 Mac 上跑了,不用 NVIDIA 显卡

有开发者把微软的 TRELLIS.2 移植到了 Apple Silicon 上,用一张照片就能生成约 40 万个顶点的 3D 网格。在 24GB 内存的 M4 Pro 上跑一次大概 3 分半钟,其中贴图烘焙只要 18 秒。这次移植把原来五个依赖 CUDA 的扩展换成了 PyTorch MPS 和自定义后端,不再需要 NVIDIA 显卡或云端算力。不过正...

推荐理由:这是社区移植,不是微软官方发布,但三个点都站得住:不用 NVIDIA 就能在 Mac 上做图生 3D,给了 M4 Pro 24GB 的具体跑分,而且重写 5 个 CUDA 扩展这件事本身就说明工作量。来源是 Reddit 帖子,权威性一般,但信息够具体,先按 featured 处理。

量子位 · 公众号

苏度科技估值超20亿美元,发布具身模型Sudo R1:零真实机器人数据训练,首次抓取成功率约98%

苏度科技放出了他们的具身智能首秀Sudo R1,说是在完全没有用真实机器人数据训练的情况下,直接零样本测试了200多次,对100多种没见过的物体(包括透明、金属、软的和反光的东西)首次抓取成功率约98%,试两次基本能到100%。整个演示跑了60分钟。他们用的方法是在高保真模拟器里结合世界模型和强化学习来训练,相当于先在虚拟世界里把技能练好再搬到真机上。...

推荐理由:这条我会先打个折,因为所有指标都是自报的,没第三方验证。但零真机数据、zero-shot 直接上真机抓出 98% 首次成功率,这个说法本身就够硬,而且给了 200 多次测试、100 多个没见过的物体、60 分钟连续跑,数字具体,不是空口号。它正好打在机器人行业最疼的地方:真实数据又贵又慢,仿真到真机迁移一直是个坑。正文没披露融资金额、基准怎么定义的、谁做的第三方验证,所以分数没给更高。

机器之心 · 公众号

智元机器人把2026年叫“部署态”元年,一口气甩出7套落地方案

智元在4月17号上海的活动上发了4款机器人、6个AI模型和7套标准化部署方案,把2026年定义为具身智能的“部署态”元年。远征A3续航标称8到10小时,WITA Omni 1.0的交互延迟目标是500毫秒以内,BFM模型用了一亿多帧图像和700小时动捕数据训练。他们还提到2025年出货超5100台、市占率39%,第1万台在今年3月下线。对从业者来说,重...

推荐理由:HKR三项都成立:文章开头就拿七套标准化方案说事,后面用出货量、市占率、延迟和训练数据做支撑。分数停在76,因为关键效果数据全是公司自己说的,客户侧的实际表现和独立验证正文没披露,我会先打个折。

Hacker News 首页

TRELLIS.2 图生 3D 模型现在能在 Mac 上跑了,不用 Nvidia 显卡

开发者 shivampkumar 把微软那个 40 亿参数的 TRELLIS.2 模型移植到了苹果芯片上,靠 PyTorch 的 MPS 后端驱动,一张图就能生成 3D 模型。他把原本依赖 Nvidia 硬件的 flash_attn、nvdiffrast 和自定义稀疏卷积算子全换成了纯 PyTorch 实现,包括稀疏 3D 卷积、SDPA 注意力机制和...

推荐理由:这不是微软官方模型发布,而是一个可复现的本地移植,对实际干活的人有参考价值。我会先打个折:3.5 分钟生成一个网格不算快,但考虑到不用联网、不用 Nvidia,这个结果挺实在。正文把替换掉的组件和替代方案都列清楚了,信息量够,所以放在 featured 而不是 p1。

4月19日星期日

量子位 · 公众号

马斯克在抖音卖老干妈?其实是 OpenAI 新模型生成的假图

这篇文章展示了用 OpenAI GPT Image 2 生成的几张假图,包括“马斯克抖音直播卖老干妈”和“GTA-6 联动海报”,画面里还伪造了 10 万+ 的在线观看人数。文章说 Image 2 现在能画出很逼真的海报、游戏截图,还能在图上写出可读的长文字,背后可能用了类似 Codex 的界面生成流程。但正文没提这个模型的定价、推送范围和具体上线时间...

推荐理由:HKR 三项全中:钩子够抓人,能力展示很具体,信任崩塌这个点从业者都会关心。没给 p1 是因为正文没披露开放范围、价格和正式发布时间,信息有缺口,我会先打个折。

量子位 · 公众号

高德发布全栈具身智能体系 ABot,号称在 15 项指标上拿了最优

高德这次公开的 ABot 是一套想让机器人真正干活的全栈技术体系,分视觉感知、物理世界模型和视觉语言动作模型几块。ABot-3DGS 能用厘米级地图数据重建上万平米的三维场景,ABot-PhysWorld 则是一个 140 亿参数的扩散模型,用 300 万条真实机械臂操作视频训练,让机器人先在大脑里模拟动作再执行。文章说横扫 15 项 SOTA,但具体...

推荐理由:高德这次公开的 ABot 体系,我会先打个折——15 项 SOTA 具体是哪些基准、跟谁比,正文没列,挑战赛名称也没给,这点先别太激动。但能聊的东西确实有:ABot-3DGS 拿厘米级地图和轨迹数据生成了上万组 3D 场景,号称覆盖率 99%,如果属实,等于用地图老本行给具身训练铺了一条低成本数据管道;ABot-PhysWorld 用 14B 的 DiT 加 300 万条真实操作视频做物理判别训练,规模不小。真正该盯的是他们把世界模型和 VLA 闭环绑在一起做的思路,不是单点炫技。开源范围和时间表都没披露,落地成色还得等。

4月18日星期六

机器之心 · 公众号

Anthropic 给 Claude 加了个设计功能,能直接出线框图、原型和幻灯片

Anthropic 在 Claude Pro、Max、Team 和 Enterprise 账号里上线了 Claude Design 的研究预览版,背后跑的是 Claude Opus 4.7。它能吃代码库、图片、DOCX、PPTX、XLSX 和网页截图,吐出来的东西可以导出到 Canva、PDF、PPTX 和 HTML。标题说 Figma 和 Adobe...

推荐理由:我会先打个折:标题说 Figma、Adobe 股价重挫,但正文没给出具体跌幅,这点先别太激动。真正值得看的是 Anthropic 把设计稿生成、设计系统读取、多人协作编辑和向 Claude Code 交接串成了一条线,这比单出一个画图工具要狠。不过目前还是研究预览版,没有用户测试数据、定价和实际落地案例,能不能真革了设计行业的命还得看后续。

彭博科技

OpenAI 前产品负责人和 Sora 主管双双离职

OpenAI 一下子走了两位高管:一位是前产品负责人,另一位是 Sora 视频模型的主管。标题确认是两个人,但正文没披露他们具体是谁、什么时候走的、为什么走,也没说谁来接任。值得留意的是 Sora 团队会不会跟着调整,不过目前没有任何细节。

推荐理由:标题给了人数和角色,但正文是空的,所以只能按现有信息判断。我会先打个折:因为离职原因和继任安排完全没披露,这条消息的冲击力还到不了顶。真正值得盯的是 Sora 业务线——负责人走了,后续产品节奏和资源会不会调整,这点先别太激动,但得持续关注。

X · @dotey(宝玉)

Anthropic 发布 Claude Design,用对话代替拖拽生成设计稿

Anthropic 推出了 Claude Design,一个靠聊天就能出设计稿的工具,背后跑的是新模型 Claude Opus 4.7。你描述需求,它直接生成图片,然后通过对话、批注、直接编辑或拖拽滑块反复改。团队第一次用的时候,它会读你的代码库和设计文件,自动生成一套设计系统(品牌色、字体、组件),后续项目自动套用。支持从文字、图片、文档或网页截取起...

推荐理由:Anthropic 把 Claude 塞进了设计环节,HKR 三项都站得住。文章给了开放节奏、底层模型和导出目标,信息量够上 featured。不过目前还是研究预览,不是模型级大更新,我会先打个折,重要性给 84。

4月17日星期五

Hacker News 首页

Anthropic 实验室推出 Claude Design,用对话就能生成设计稿

Anthropic 在 4 月 17 日上线了 Claude Design,目前是研究预览版,Pro、Max、Team 和 Enterprise 用户都能用。它基于 Claude Opus 4.7,你给它文字描述、图片、文档(DOCX、PPTX、XLSX)甚至代码库,它就能生成设计稿、原型、幻灯片或单页宣传页。比较特别的是,它能直接读取你团队的代码和设...

推荐理由:这是 Anthropic 一次有分量的产品发布,不是小功能补丁。HKR 三项都站得住:形态新、部署细节够、工作流共鸣强。但研究预览的身份和没单列的价格让我把分控在 84,没给更高。真正值得盯的是它和 Claude Code 的交接链路,如果跑通,设计到代码的流转会变短。

X · @claudeai

Anthropic 实验室推出 Claude Design,用对话就能生成原型、幻灯片和单页文档

Claude Design 是 Anthropic 实验室放出的研究预览功能,Pro、Max、Team 和 Enterprise 用户今天开始陆续能用。它跑在 Claude Opus 4.7 上,官方说这是他们目前最强的视觉模型。用法很简单:你跟 Claude 聊需求,它直接出原型、幻灯片或单页文档。正文没提价格、输出限制和详细推送时间表。我会先打个折...

推荐理由:Anthropic 自己下场做设计生成,Claude 从纯文本助手变成能出视觉稿的工具,这个转向本身就值得关注。我会先打个折:帖子说 Opus 4.7 是“最强视觉模型”,但没给对比数据,也没说生成的文件能不能直接导出编辑。如果是真的,对快速出原型和汇报材料挺省钱,但别急着当生产工具用——格式限制和付费墙都没讲清楚。

新智元 · 公众号

智元机器人说已进入“部署态”,在工厂产线连续干了8小时没停

智元在4月17日的APC 2026上把2026年定义为“部署态元年”,核心案例是龙旗南昌工厂的Genie G2机器人:完成2283次上料任务,成功率超99.5%,单次节拍18到20秒,连续运行8小时。这些数字是公司自己公布的,正文没提有没有第三方审计。更值得看的信号是规模:智元称2025年出货超5100台,到2026年3月累计出货1万台,龙旗那边计划部...

推荐理由:HKR三条都踩中了。'Demo秀终结'这个角度有传播力,文章给出了工厂实测数据——8小时连续运行、2283次上下料、成功率超99.5%、单工序18-20秒,不是实验室摆拍。没给P1是因为这些数据全来自企业自报,正文没披露第三方审计或跨厂复现结果,我会先打个折。真正值得盯的是量产条件:2025年出货超5100台、2026年3月累计下线1万台,龙旗计划近千台部署,这些数字如果兑现,比单次Demo有分量得多。