跳到正文

#多模态

今日 0 条

6月5日星期五

量子位 · 公众号

姚顺雨现身腾讯云大会,回应腾讯 AI 落后质疑

姚顺雨在腾讯云 AI 产业应用大会上说,混元 3 把预训练和强化学习的基础设施重做了一遍,数据和评估方式也换了,还把最强的后训练人员先调去改进元宝。他点名代码 agent、多模态和具身智能是腾讯接下来的重点方向。

推荐理由:这是一篇大会发言和路线图信号,不是带规格、跑分或上线日期的新模型发布。信息增量在于腾讯把后训练精锐先押在元宝上,以及重做基础设施这个表态,但缺少可验证的指标。放在 featured 低位,是因为它给中国大厂 AI 战略更新提供了一个有争议锚点的注脚,而不是一个硬核技术首发。

5月29日星期五

AI HOT 精选

谷歌 DeepMind 老大说 AGI 可能三年内到,但社会还没准备好

哈萨比斯判断,通用人工智能(AGI)最快 2029 到 2030 年就会出现,比之前想的快很多。他说的 AGI 不是只会干一件活的专用 AI,而是能像人一样跨领域学习、推理和创造的系统。现在那些能独立干活的 AI 智能体,在他看来就是 AGI 的预演。不过他也把话说得很清楚:AGI 不会突然蹦出来,而是一段持续加速的升级过程。他更担心的是,各国政府和社...

推荐理由:哈萨比斯这次把 AGI 时间线压到 2029-2030,比很多人的预期要快。他点出多模态和自主决策是硬指标,但正文没展开讲现在卡在哪、验证标准是什么,所以这个预测更像个人判断而非有数据支撑的路线图。我会先打个折:方向值得关注,但别当倒计时看。

5月22日星期五

AI HOT 精选

可塑界面:AI 让软件界面按需变形,不再只有一种固定样子

Salesforce 已经“砍掉”了传统界面,销售不用登录网站就能通过 AI 更新交易记录。作者把这种趋势叫做“可塑界面”——AI 能根据你当下在干嘛,动态生成最适合的交互形式,比如开车时给你念邮件摘要、审文案时弹出网页应用、做预算时直接给个带图表的表格。文章引用了 Airbnb CEO 和 Anthropic 工程师的观点,认为纯文本对话不够用,电商...

推荐理由:我会先打个折:这篇是软件形态的展望,没有上线时间、用户数据或可复现的测试,所以放在评论类里刚好。正文说 Salesforce 已经用无头架构让销售靠 AI 直接改数据,界面不再写死,而是按场景动态生成 HTML、音频甚至网页。这点先别太激动——正文没披露这套动态生成在 Salesforce 里的实际覆盖范围、延迟和出错率,也没说 MCP 具体怎么接。但思路本身对做 B 端产品的人有用,因为它把“界面”从设计稿变成了模型输出,省不省开发成本另说,至少交互逻辑要重想。

5月18日星期一

Latent Space

无人机自主技术栈与经济学:从宠物摄像头到 AI 制导炸弹

Yaroslav Azhnyuk 是 The Fourth Law 的创始人,这家公司做 AI 制导无人机。他之前创办了 Petcube,卖的是给宠物扔零食的摄像头,现在做的是给占领军扔炸药的摄像头。这期播客他和 Noah Smith 聊了两个小时,核心是 FPV 穿越机怎么成了战场上的新杀器——前线 70% 到 80% 的伤亡都是它造成的。他提出无人...

推荐理由:这是一期播客对谈,不是产品发布或论文,所以别当硬核技术报告看。我会先打个折:它给的是行业判断和框架,不是实测数据。但聊得挺实在,把无人机从遥控到全自主拆成了5个等级,又用8个维度讲战场怎么用、成本怎么算,还专门分析了中国制造为什么能把价格打下来。对想快速理解无人机产业和自主化路线的人,这期信息密度够,值得放进精选。

5月17日星期日

FT · 科技

FT 称中国 AI 公司在视频生成上反超美国对手,但正文被付费墙挡住,没看到具体模型和评测数据

FT 这篇文章的标题说字节跳动和快手等中国 AI 公司在视频生成领域已经领先美国对手,在广告和娱乐场景里效果更好。但点进去只看到安全验证页面,正文完全没加载出来,所以不知道他们拿什么模型比的、用的什么评测标准、样本量多大、延迟和成本怎么样。我会先打个折——标题里的“领先”目前只能当个信号看,等看到具体数据再下判断。

推荐理由:FT 这篇标题很猛,说中国公司在视频生成上反超美国,但正文信息很薄。只提到字节和快手在广告、娱乐视频质量上领先西方对手,具体怎么比、用什么标准、样本多少全没写。我会先打个折:标题的“领先”目前只能当个信号看,别急着当定论。不过视频生成确实是现在中美模型竞赛里最卷的一条线,这条消息对关注多模态落地的人有提醒价值,所以给了 featured 门槛分。

机器之心 · 公众号

世界模型的两条路线和一场百亿赌局

这篇文章是机器之心编译自 MoE Capital 的一篇博客,梳理了“世界模型”这个概念的两条发展脉络。一条是 AI 学术圈常说的,让模型在脑子里推演环境变化、做规划;另一条来自游戏和影视工业,追求用模型直接生成逼真的 3D 世界。文章提到,过去一年半里,有超过 100 亿美元的资金涌入了这个方向。里面举了一个具体例子:DreamDojo 这个项目用 ...

推荐理由:这篇是编译的科普+评论,不是一手发布,但把世界模型两条路线讲得清楚,还给了百亿美元和44711小时视频这些具体数字。我会先打个折,因为信息密度集中在解释概念,新事实不多。不过对想快速理解世界模型热度和技术现状的人来说,读这一篇比翻论文省时间。

5月12日星期二

AI HOT 精选

Karpathy 聊人机交互下一步:别只让模型吐 Markdown,试试让它直接写 HTML

Karpathy 觉得现在大模型默认输出 Markdown 太简陋了,他建议直接让模型生成带排版、图形和交互的 HTML,界面会好用很多。更远的想法是“交互式神经视频”——用扩散模型实时生成能操作的画面,但他也承认这玩意儿怎么跟精确的传统软件配合还是个没解的问题。输入这边,光靠语音、文字或视频不够,得加上手势指点这类更自然的交互。在脑机接口到来之前,输...

推荐理由:Karpathy 这条推文没给数据,就是个人判断,所以重要性只能打到 featured 的及格线。但他把 LLM 输出形态的变化串成了一条线:从纯文本到带格式的 Markdown,再到能直接渲染的 HTML,最后抛出“交互式神经视频”这个方向。我会先打个折——神经视频现在连跟传统软件精确配合都做不到,正文也没说怎么解决,这点先别太激动。不过对做 AI 产品的人来说,这个框架确实能帮他们想清楚下一步该把界面做成什么样。

5月10日星期日

机器之心 · 公众号

谷歌 Ted Xiao 把近十年机器人学习分成三个时代,从 RT-1 到 RT-2 再到规模化

这篇文章的正文被微信环境异常拦截了,实际内容无法读取。从标题和已有英文摘要看,Ted Xiao 的复盘主要讲谷歌机器人团队怎么从 RT-1 用 8.7 万条遥操作轨迹训练,走到 RT-2 把 50 亿到 550 亿参数的视觉语言模型改造成视觉-语言-动作策略。具体三个时代怎么划分、每个阶段踩了什么坑、规模化后效果到底提升多少,正文没披露,没法展开。

推荐理由:我会先打个折:这不是新发布,是一篇回顾性梳理,所以分数没往 80 以上走。但作者身份和内部数字让它值得上推荐位。Ted Xiao 把谷歌机器人学习拆成三个阶段,从遥操作采数据到把大模型当机器人脑子用,脉络清楚。RT-1 的 8.7 万条轨迹说明早期靠人工遥控攒数据的笨功夫,RT-2 用 5B 到 55B 的 VLM 改策略,点出了现在大家纠结的核心——模型大了能不能直接控硬件。正文没披露 RT-2 在真实场景的失败率或延迟数据,这点先别太激动。整体适合给做具身智能的人当路线图看。

4月25日星期六

The Verge · AI

一本新书复盘了 Maven 项目:美军是怎么从嫌弃 AI 到离不开它的

Katrina Manson 的新书梳理了 Maven 项目从 2017 年用计算机视觉分析无人机视频起步,到后来演变成 Maven Smart System 的全过程。书里最抓眼球的一个数字是:在对伊朗行动的头 24 小时里,美军靠这套 AI 系统辅助打了一千多个目标,规模差不多是二十年前伊拉克“震慑”行动的两倍。不过这篇采访没提现在用的是哪家公司的...

推荐理由:这篇讲的是美军怎么从 2017 年用 Project Maven 看无人机画面,走到今天靠 AI 系统加速生成打击目标。我会先打个折:正文没披露当前用的模型、供应商换过没有、部署范围多大,所以分数停在 74。但 24 小时打 1000 多个目标这个数字很直观,差不多是 20 多年前伊拉克“震慑行动”的近两倍,能让人立刻感受到 AI 在实战里的介入程度。Katrina Manson 的新书追溯了这段历史,不过细节缺口明显,这点先别太激动。

4月24日星期五

机器之心 · 公众号

机器人跑赢人类马拉松后,资本开始从硬件转向“大脑”

荣耀的人形机器人“闪电”在北京亦庄半马跑出50分26秒,比人类男子世界纪录57分20秒还快。宇树H1在1.9公里弯道赛段也跑出4分13秒。文章说2026年一季度具身智能融资近200笔、总额超300亿元,4月16日灵初智能又拿了4.55亿美元Pre-A轮。信号很直接:钱正从机器人本体流向模型和智能系统,硬件能卷的差不多到头了。

推荐理由:文章用一个直观的比赛成绩开场,然后落到融资数据和行业判断上,没有空谈概念。我会先打个折:正文没交代机器人是在什么规则、什么路况下跑的,和人类纪录的直接对比要谨慎看。但Q1融资规模和它石智航那笔大额Pre-A轮是实打实的新信息,加上“硬件护城河变浅、大脑才是下半场”这个判断,对关注具身智能方向的人有提醒作用。整体是评论性质,不是一手产品发布或论文,所以放在featured。

4月21日星期二

Hacker News 首页

膨胀伪影:大模型输出的瑕疵不是压缩痕迹,而是解压时脑补过头的证据

Matt Ström-Awn 把大模型生成内容里的毛病叫做“膨胀伪影”,而不是压缩伪影。他的逻辑是:模型从模糊的训练数据里往外“解压”时,会在信心不足的地方用训练分布里的高频模式硬填,于是就有了那些套话、过度注释的代码、六指手和穿模视频。这些痕迹能当法医线索用——斯坦福的研究人员靠追踪 ChatGPT 发布后词频飙升的词(比如 commendable、...

推荐理由:我会先打个折,这是个人博客评论,不是一手研究或产品发布,所以分数停在 73。但它的钩子很巧,把 LLM 的毛病重新包装成“扩展伪影”,一下就把审美收敛和生成路径暴露的问题串起来了。文章给的数字也实在,17.5% 的论文和 16.9% 的审稿有 AI 起草痕迹,说明这已经不是小范围现象。JPG 压缩 10000 次后 PSNR 掉到 14.59 的类比虽然不算严谨实验,但直观地让人感受到反复生成带来的退化。真正值得盯的是取证价值:这些伪影不光是风格问题,还可能成为追踪生成路径的线索,这对审稿信任和内容溯源都挺要命的。

4月19日星期日

量子位 · 公众号

马斯克在抖音卖老干妈?其实是 OpenAI 新模型生成的假图

这篇文章展示了用 OpenAI GPT Image 2 生成的几张假图,包括“马斯克抖音直播卖老干妈”和“GTA-6 联动海报”,画面里还伪造了 10 万+ 的在线观看人数。文章说 Image 2 现在能画出很逼真的海报、游戏截图,还能在图上写出可读的长文字,背后可能用了类似 Codex 的界面生成流程。但正文没提这个模型的定价、推送范围和具体上线时间...

推荐理由:HKR 三项全中:钩子够抓人,能力展示很具体,信任崩塌这个点从业者都会关心。没给 p1 是因为正文没披露开放范围、价格和正式发布时间,信息有缺口,我会先打个折。

4月17日星期五

MIT Technology Review · AI

机器人是怎么学会干活的:一段当代简史

2025年人形机器人拿到的投资是61亿美元,是2024年的4倍。钱突然涌进来,不是因为造出了C-3PO,而是机器人学习的方式彻底变了。以前靠人手写规则,比如叠衣服要定义领口、袖口、折叠角度,情况一多规则就爆炸。2015年前后,前沿做法改成在仿真里用奖励信号让机器自己试错,跑几百万次来学会一个动作。2022年ChatGPT出来后,思路又跳了一步:把大模型...

推荐理由:这篇不是新发布,更像一篇梳理,所以放在 featured 偏低的档位。我会先打个折:正文在案例部分被截断了,后续公司细节没披露,这点先别太激动。但它的价值在于把 61 亿美元的热钱和两条技术路线讲清楚了——仿真试错那套从 2015 年就在跑,2022 年后多模态动作模型开始让机器人直接输出动作,本质是用数据换掉手写规则。对做具身智能的人来说,这个框架比单点新闻更有用。

4月14日星期二

最佳拍档

H100 租赁价五个月涨近 40%,全球 GPU 算力全面断供

SemiAnalysis 的报告显示,从 2025 年 10 月到 2026 年 3 月,英伟达 H100 的一年期租赁价格从每小时每 GPU 1.70 美元涨到了 2.35 美元,涨幅接近 40%。现在想租一个 64 块 GPU 的小集群都很难,现货市场基本无货可租。需求端主要被几件事同时推着走:Anthropic 的 Claude 产品收入一个季度...

推荐理由:我会先打个折:这是对 SemiAnalysis 报告的二次视频解读,不是一手厂商公告,所以没给 P1。但内容本身够硬——H100 租金五个月涨 40%,背后是 Anthropic 需求拉升、多智能体工作流和音视频生成把 token 消耗推高,加上内存价格翻倍涨,供给端根本接不住。正文没披露具体调研方法,但 100 多家供应商的样本量和现货 14 美元的极端报价,让判断有底。对正在做模型或搭 agent 的团队来说,这比换代传闻更肉疼,所以 HKR 全中。

4月3日星期五

X · @dotey(宝玉)

晚点发了一篇 DeepSeek 深度报道,讲 V4 发布前的人员变动、路线选择和梁文锋的管理逻辑

晚点 LatePost 这篇报道卡在 V4 发布前夕,信息量不小。先说人员:DeepSeek 确认走了四位核心成员,包括 R1 核心作者郭达雅(近期离职,可能去大厂)、第一代 LLM 作者王炳宣(去年底被腾讯挖走),以及 OCR 和多模态方向的两位。猎头开价翻 2 到 3 倍,有的公司直接给 8 位数总包,而 DeepSeek 的期权没标价,让一些人心...

推荐理由:这不是 V4 发布,但信息量够硬:4 人离职确认、发布推迟到 4 月、100 多人的研究团队规模、猎头报价翻倍,还有算子库迁移到 TileLang 的路线变化。HKR 三项都站得住。正文没给 V4 的参数、价格和基准成绩,所以到不了发布级或 p1,但作为 V4 前的信号已经够看了。

4月1日星期三

MIT Technology Review · AI

在家训练人形机器人的零工:尼日利亚医学生头顶 iPhone 拍做家务

Micro1 这家公司雇了 50 多个国家的几千名零工,让他们把 iPhone 绑在头上,拍自己叠被子、洗碗、做饭的视频,再把这些真实动作数据卖给做人形机器人的公司。一个尼日利亚的医学生时薪 15 美元,在当地算高收入,但他觉得每天重复熨衣服很无聊。文章说 2025 年人形机器人拿到的投资超过 60 亿美元,机器人公司每年花在买这类数据上的钱超过 1 ...

推荐理由:这篇我会放进 featured。在家拍家务视频这个画面本身就够抓人,而且文章给出了规模、薪酬和支出的具体数字,不是空谈。更值得盯的是它把一条隐藏的数据管线摊开了:工人知道视频是给机器人训练用的,但正文没披露这些数据怎么存、跟谁共享、能不能删。这种治理上的模糊,比融资数字更说明行业现在还处在野蛮生长阶段。

硅谷101 播客

E231|从B2B到A2A:阿里国际张阔谈AI如何把采购沟通从一周压到一天

阿里国际总裁张阔在访谈里给了个很具体的数字:他们的采购AI产品Accio,能把跨境采购的沟通时间砍到原来的五分之一,从大概一周变成一天。怎么做到的?就是把市场调研、设计稿生成、跨语言沟通、供应商筛选这些环节串成一条AI工作流,让买家带着专业的设计包去跟卖家谈,而不是从零开始比划。Accio今年3月月活到了1000万,还在逐月快速增长。张阔的核心判断是B...

推荐理由:这不是一次大版本发布,但它是高管一手访谈,有 1000 万月活和采购周期压缩到五分之一这两个硬数字。HKR 三项都踩中了,不过事件分量还够不上模型发布或重大产品更新,所以放在 featured 而不是 p1。正文把 A2A 解释成买卖双方和平台流程都由 Agent 重构,这点比单个产品数据更有看头,但具体技术细节和验证方式没展开,我会先打个折。

3月17日星期二

MIT Technology Review · AI

OpenAI 的技术可能出现在伊朗冲突的哪些环节

OpenAI 跟五角大楼签了涉密协议刚过两周,MIT Technology Review 就划出了三个可能用到它家技术的场景。一是目标排序:分析师把潜在目标清单丢给模型,让它结合后勤、情报等数据排出优先打击顺序,但正文没解释人工复核到底怎么提速。二是反无人机分析:OpenAI 之前跟 Anduril 合作,用模型做实时威胁识别和拦截建议,不过两家都没更...

推荐理由:MIT Technology Review 把 OpenAI 的涉密国防合作往伊朗冲突上套,列出目标排序、反无人机分析和行政支持三个可能落点。我会先打个折:文章没给出部署时间表,也没实锤任何战场使用,所以判断要收着点。但选题本身踩在军事 AI 的敏感线上,加上 OpenAI 刚进涉密圈,这个时间点发出来,话题性够强。

3月9日星期一

MIT Technology Review · AI

AI 正把伊朗冲突变成一场实时观战秀

作者一周内看了十几个伊朗战争仪表盘,它们把卫星图、船舶追踪、AI 摘要和赌盘链接拼在一起,把战争变成了可以边吃爆米花边看的实时界面。一个由 a16z 员工搭建的仪表盘直接接入了 Kalshi 的下注数据,而调查记者 Craig Silverman 已经记录了 20 个类似的工具。问题出在信息质量上:英国《金融时报》报道过 AI 生成的虚假卫星图正在网上...

推荐理由:我会先打个折:这不是产品发布或模型突破,而是一篇有事实支撑的评论。H 靠战争面板加博彩这个钩子立住了,K 靠具体案例和数字撑起来,R 打中了从业者对 AI 信息质量和伦理的敏感神经。文章没给解决方案,但把问题摆得很清楚,所以放在 featured 合适。

2月26日星期四

纽约时报中文网

美国在 AI 上“输”给中国的不是模型,是工厂

这篇文章的核心判断是:中国把 AI 用进了工厂车间,美国还在把 AI 当实验室项目。中国已建成 3 万多家智能工厂,2024 年全球新装的工业机器人超过一半进了中国工厂。极氪宁波工厂用了 800 多台机器人,小米北京工厂每 76 秒就能产一辆车,美的荆州工厂用 AI 把产线响应时间从几小时压到几秒。这些 AI 不是写诗画画,而是做视觉质检、生产调度和预...

推荐理由:这篇不是讲模型,是讲工厂里机器人、调度和质检的落地差距。我会先打个折:正文没披露3万多家智能工厂的具体认定标准,也没说美国18%这个数字的样本来源,所以数据力度要留个心眼。但极氪800多台机器人、小米76秒节拍这些车间数字是实的,对比美国三分之二试点推不向量产,差距感很直观。对看产线落地的人,这篇比模型跑分更有参考价值。

2月12日星期四

MIT Technology Review · AI

AI 让线上诈骗更容易了,而且可能还会更糟

微软说截至 2025 年 4 月的一年里,他们拦下了 40 亿美元的诈骗和欺诈交易,其中很多可能靠 AI 生成内容帮忙。研究人员估计现在至少一半的垃圾邮件是用大语言模型写的,用大模型搞针对性邮件攻击的比例也从 2024 年 4 月的 7.6% 涨到了 2025 年 4 月的 14%。先别急着脑补“全自动 AI 黑客”,眼下真正的问题是 AI 把钓鱼、换...

推荐理由:这篇不是那种“全自动 AI 黑客来了”的标题党,它把焦点拉回到已经发生的事:钓鱼邮件、深伪、恶意代码生成,AI 在降低犯罪成本。数字有,但正文没披露这些攻击的总体增幅,所以判断要收着点。适合放进精选,因为它是一份有数据支撑的趋势报告,不是当天炸出来的事件或产品发布。

2月3日星期二

MIT Technology Review · AI

我们一直搞错了 AI 的真相危机:就算知道是假的,人还是会信

MIT Technology Review 的这篇文章直接点出一个反直觉的发现:我们过去对 AI 造假危机的想象,可能全偏了。作者拿自己上周的报道举例——美国国土安全部首次被确认在用 Google 和 Adobe 的 AI 视频工具做面向公众的宣传内容,配合特朗普政府的移民执法造势。文章指出,我们原本指望靠 Adobe 的“内容真实性倡议”这类标签工具...

推荐理由:这篇不是空对空的评论。它先拿国土安全部用 Google 和 Adobe 视频生成器做公开内容这件事当引子,然后拆了两个标签系统的实际漏洞,最后用 Communications Psychology 的论文把问题钉死:受试者明知认罪视频是 deepfake,还是会据此判断有罪。信息链条完整,判断都挂在事实和论文上,没有补设定。我会先打个折,因为它本质还是评论加一篇论文,不是当天能震动行业的硬事件,但对正在搭安全流程的团队来说,这篇值得一看。

1月16日星期五

阮一峰的网络日志

中国 AI 大模型领导者在想什么

阮一峰记录了1月10日北京一场闭门会上几位大模型负责人的发言。智谱唐杰说,对话式AI的范式基本到头了,下一步是让模型真正做事,他们把编程、智能体和推理能力整合在一起。阿里林俊旸坦言,美国可用的算力比国内大一到两个数量级,人家拿算力搞下一代研究,我们光交付就占掉绝大部分资源;他判断三到五年后全球最领先的AI公司是中国团队的概率只有20%。腾讯姚顺雨观察到...

推荐理由:这篇周刊摘录了一场闭门峰会的发言,把智谱、阿里 Qwen 和腾讯 AI 负责人对中国大模型路线的判断摆在一起。我会先打个折:它不是一手发布,是二手整理,所以分数没往更高走。但它的好处是给了具体数字和分歧点——唐杰押注 2025 年是 RLVR 爆发年,林俊旸押多模态基础智能体,姚顺雨强调企业愿意为强模型付 200 美元月费,林俊旸还给出中国团队 20% 概率诞生全球最领先 AI 公司。这些判断有可验证的时效,不是公关口径,对从业者判断方向有参考价值。

1月13日星期二

MIT Technology Review · AI

CES 2026 逛完,我理解了为什么中国科技公司这么乐观

今年 CES 来了超过 14.8 万人、4100 多家参展商,中国公司占了将近四分之一,在 AI 硬件和机器人区域尤其扎堆。作者临时决定去现场,结果发现中国厂商已经不只是“便宜量大”的路子——家用清洁机器人在美国市场把 Dyson 和 Shark 的份额抢得很凶,庭院设备也大多来自深圳,外观做得让人看不出是中国品牌。人形机器人展台围满了人,宇树甚至搭了...

推荐理由:这篇是 CES 现场观察,核心判断是:中国科技公司的乐观来自制造和供应链的迭代速度,不是单点技术突破。文章用 14.8 万参会者、4100 多家参展商、中国展商近四分之一这些数字撑住了场面感,也把联想 Qira、Nvidia Vera Rubin、AMD Helios 这些产品拉出来,说明竞争焦点正转向云端和混合 AI。我会先打个折:正文没给出货量、营收或订单数据,所以判断还停在趋势信号层面,但作为行业风向标,这篇值得一看。