跳到正文

全部动态

今日 8 条

7月23日星期四

Latent Space

Poolside 联创自述:70 人团队如何在 8 周内训出 118B 的 MoE 模型

Poolside 的联合 CEO Eiso Kant 在播客里拆解了他们的“模型工厂”。一个不到 70 人的研究团队,每月跑 1 万到 2 万次实验,把模型迭代周期从半年压缩到了 5 到 8 周。他们刚发的 Laguna S 2.1 是个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,支持 100 万 token 的上下文窗口,还有思...

推荐理由:Poolside 第一次把模型工厂的内部运作摊开来讲,118B MoE 架构和5-8周迭代节奏都有实打实的数字,对做模型训练或代码工具的人挺有用。没给更高分是因为 Poolside 的盘子还集中在代码领域,这篇对非代码方向的从业者触动有限。

7月21日星期二

Google DeepMind

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。

推荐理由:原文给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型变化。

7月20日星期一

AI HOT 精选

小红书和北大开源 UltraEP,给 MoE 模型做实时负载均衡

MoE 模型里专家负载不均会让 GPU 空等,UltraEP 的做法是在每个 microbatch 和每一层动态复制热门专家,用精确路由信息实时调度。在 Qwen3-235B 上训练吞吐达到理想性能的 94.6%,比 Megatron-LM 高 42%;推理 prefill 吞吐是 SGLang 的 1.56 倍。正文没披露开源协议和部署条件。

推荐理由:小红书和北大联合开源的这个方案,解决的是 MoE 训推里 GPU 空等的实际问题,给出的性能数字很强:训练吞吐达到理想的 94.6%,推理比 SGLang 快 56%。技术路线也讲得明白,是逐层、逐 microbatch 的实时动态复制,不是事后补救。我会先打个折,因为正文没提开源协议和部署条件,这两个缺口会卡住很多想落地的人。整体上对做大规模训推基础设施的团队很有用,但对普通 AI 从业者来说场景偏窄。

Hacker News 首页

小米开源机器人基础模型 XR-1:用 10 万小时无实机视频预训练,新任务学不到 10 小时成功率 75%

小米机器人团队放出了一个开箱即用的机器人基础模型 XR-1,代码、权重和论文都公开了。它的思路分两步:先用 10 万小时不带真实机器人的操作视频做预训练,覆盖 1700 多个场景,让模型学会“看到画面变化该输出什么动作”;再用 7200 小时真机数据做后训练,把动作能力对齐到具体机器人上,并让模型能听懂自然语言指令。预训练阶段出现了干净的缩放规律——数...

推荐理由:小米机器人开源了 XR-1,一个带代码和权重的机器人基础模型。两阶段训练路线(10 万小时无真机预训练 + 7200 小时真机后训练)和预训练缩放规律是硬信号,直接对标 π 0.5。我会先打个折:正文没披露真机后训练的具体任务成功率和泛化测试细节,这点先别太激动。但开源全套这个动作本身,对行业来说比发一篇论文管用。

7月19日星期日

Computing Life · Share · 鸭哥调研

Grok Build 开源了客户端执行层,模型和云端没开

xAI 把 Grok Build 在本地管理文件、命令和权限的客户端 harness 用 Apache-2.0 协议公开了,代码可以看、可以自己编译。但 Grok 模型、云端服务以及官方安装包的构建链还是闭源的。仓库不接受外部 PR,官方二进制用的内部 commit 也不在公开历史里,所以下载到的程序不一定对应公开的源码。7 月初的上传争议发生在旧版,...

推荐理由:xAI 把 Grok Build 的客户端 harness 用 Apache-2.0 放出来,支持无头模式和 ACP,不算纯作秀。但模型和构建链还是闭源,仓库也不接外部 PR,所以上限到不了 85。三个 HKR 维度都踩中了,放 featured 合适。

7月17日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

推荐理由:原文给出轻量安全模型在多个基准和 Google 内部代码库的实测结果,可据此判断专用小模型在漏洞发现上的性价比。

Hacker News 首页

月之暗面发布 2.8 万亿参数 Kimi K3,自称首个开源 3T 级模型,API 定价看齐 Claude Sonnet

月之暗面推出了 Kimi K3,一个 2.8 万亿参数的模型,他们把它四舍五入叫成“首个开源 3T 级模型”。这个模型 API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。它自己公布的跑分大多超过了 Claude Opus 4.8 和...

推荐理由:月之暗面发了 Kimi K3,一个 2.8 万亿参数的模型,他们管它叫“首个开源 3T 级模型”,API 定价输入每百万 token 3 美元、输出 15 美元,跟 Claude Sonnet 一个价,是目前中国 AI 实验室里最贵的。自己公布的跑分大多超过 Claude Opus 4.8 和 GPT-5.5 high,但输给 Claude Fable 5 和 GPT-5.6 Sol。Simon Willison 的测试里 K3 在长周期知识任务上比前代 K2.6 涨了 732 Elo,输出 token 数少了 21%,成本降了 27%,说明模型在...

AI HOT 精选

Kimi K3 前端编码跑分登顶,2.8 万亿参数模型 7 月 27 日开放权重

Kimi K3 在 Frontend Code Arena 拿了 1679 分,7 个前端子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型本身是个 2.8 万亿参数的 MoE 架构,上下文窗口能塞进 100 万 token,大概是一套《三体》三部曲的量。7 月 27 日会开放权重,到时候可以自己部署。API ...

推荐理由:Kimi K3 在 Frontend Code Arena 前端编码榜拿了 1679 分,7 个子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型是 2.8 万亿参数的 MoE 架构,上下文窗口能塞 100 万 token,7 月 27 日开放权重。这是国产旗舰模型在一个具体编码榜单上直接挑战闭源双巨头,而且马上能自己部署,对前端圈和国内开发者来说是个实打实可验证的信号。

7月16日星期四

Hacker News 首页

批评大模型的人说得都对,但我还是在用

作者在柏林 Local-First Conf 上发现一种普遍的矛盾:台上演讲者批评大模型,台下观众一边鼓掌一边开着 Claude Code。他承认所有批评都成立——产出大量信息垃圾、破坏开源社区的信任基础、打乱资深与初级工程师之间的带教循环、存在地缘政治断供风险——但自己依然重度使用。文章没有试图化解这种矛盾,而是把这种集体性的别扭感摊开来讲,并邀请大...

推荐理由:这篇文章没打算讲道理,就是把开发者圈子里那种'边骂边用'的集体拧巴摊开给你看。柏林会议上 Armin Ronacher 的回复是个好钩子,但全文没有数据支撑,也没有解决方案,就是一次诚实的自我暴露。我会给 featured,因为共鸣够强、传播力够好,但别指望从这里学到什么新东西。

Hugging Face 博客

Ai2 公开 Shippy 海事 AI 助手的工程经验:把不可靠的模型装进确定性的工具里

Ai2 的 Skylight 团队做了一个叫 Shippy 的海事 AI 助手,帮分析师查渔船活动、专属经济区边界和船只轨迹。他们把架构拆成三块:灵魂(系统提示词,定人设和行为边界)、技能(用 Markdown 文件教它调 API 和解读轨迹数据)、配置(运行时设置,目前用 Claude Opus 4.6 加 OpenClaw 框架)。核心思路是用确定...

推荐理由:Ai2 的三层 Agent 架构和用 Markdown 当技能说明书是能直接拿来用的工程思路,但渔船监控这个领域太小众,普通读者代入感弱,刚好卡在 featured 门槛上。

Hacker News 首页

MLOps 还没解决的几个硬问题

ACM Queue 这篇文章把现在 MLOps 的尴尬摊开了:传统运维那套靠确定性响应做健康检查、灰度发布、告警的方法,在 ML 系统上基本失灵。核心矛盾就两条——模型输出不是确定的,以及数据跟代码一样在驱动系统行为。文章举了几个扎心的例子:微软 Azure 验证新模型好不好用,居然是让另一批大模型当裁判,再靠内部员工点“赞”来兜底,SRECon 现场...

推荐理由:这篇 ACM Queue 文章把 MLOps 的核心矛盾讲得很透:传统运维靠确定性响应做健康检查和灰度发布,但 ML 系统输出不确定,数据跟代码一样在改变系统行为。微软 Azure 的例子尤其扎心——用大模型当裁判验证新模型,再靠员工点赞兜底,说明行业连“模型好不好用”都没个靠谱的自动化标准。对正在把模型往生产环境塞的工程师来说,这篇文章不是给答案,是把问题清单列出来了,实用价值很高。

7月15日星期三

Computing Life · Share · 鸭哥调研

AI 训练 AI:一次公开实验把自我改进的闭环走到了哪一步

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案,内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练,隐藏评分再作为奖励反馈给外层。54 步下来,智能体先学会少交无效作业,然后把 1.7B 模型的使用比例从 42% 拉到了 95%,并开始主动调整温度、优化器等超参数。训练后...

推荐理由:我会先打个折:这只是一个公开实验,不是产品,规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案,内层 Qwen3-0.6B 和 1.7B 真跑训练,隐藏评分当奖励。54 步后,智能体先学会别交无效作业,然后主动把 1.7B 模型的使用比例从 42% 拉到 95%,还开始调温度、优化器这些超参数。这说明在小规模下,AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数,所以别急着说“超越人类调参”,但流程本身对做模型训练自动化的团队很有参考价值。

7月14日星期二

AI HOT 精选

腾讯混元把295B大模型压到单GPU能跑,发了1-bit和4-bit量化版

混元Hy3是个2950亿参数的MoE模型,现在出了1-bit和4-bit两个压缩版,用llama.cpp就能在单张显卡上跑,还支持MTP加速推理。官方说这个尺寸下它表现最好,能跟万亿参数的大模型掰手腕,适合让模型进业务流程干活。模型走Apache 2.0协议,可以商用,OpenRouter上还给了两周免费API。不过正文没披露量化后精度掉了多少,也没说...

推荐理由:腾讯混元把2950亿参数的Hy3模型压到单GPU能跑,对本地部署和做agent的人很实用。Apache 2.0协议加两周免费API,试错成本低。没给85分以上,是因为正文没披露量化后精度掉了多少,这点先别太激动。

7月13日星期一

AI HOT 精选

腾讯混元开源 HyOCR-1.5:1B 参数的端到端 OCR 模型,推理速度提升 6.37 倍

腾讯混元把 HyOCR-1.5 的训练代码、推理代码和模型权重全开源了,这在端到端 OCR 大模型里是头一个。模型只有 1B 参数,能处理文档解析、公式识别、表格还原等 8 种以上的文字任务。在 OmniDocBench v1.6 上拿了 94.74 分,排在端到端模型的第一名。推理速度这块,它用了一个叫 DFlash 的投机解码方法,在 Transf...

推荐理由:腾讯混元把一个端到端 OCR 模型从训练到推理全开源了,不是只放权重。1B 参数在 OmniDocBench v1.6 上拿了 94.74 分,端到端模型里排第一,还靠 DFlash 把推理速度提了 6.37 倍。这对做文档解析或 RAG 的人来说,是个能直接上手试、省训练成本的开源选项。我会先打个折:正文没提模型在复杂版面、手写体或噪声场景下的具体表现,也没说 6.37 倍提速是在什么硬件和 batch size 下测的,这点先别太激动。但整体看,这是国内大厂一次实打实的全栈开源,不是公关稿。

7月10日星期五

Computing Life · Share · 鸭哥调研

别再往大模型窗口里塞几百万字了:用 RLM 像跑代码一样查 Context

Alex Zhang 提出的递归大语言模型(RLM)换了个思路处理长文本:不把资料塞进模型窗口,而是留在外部当数据,让模型自己写代码去查。在 depth=1 配置下,RLM 带着 GPT-5-mini 把 OOLONG-Pairs 的 F1 从 0.04% 拉到了 58.0%,BrowseComp-Plus 准确率从 0% 拉到 91.3%。但我会先打...

推荐理由:Alex Zhang 的 RLM 把长文本处理从“全塞进窗口”改成“当外部数据查”,用 GPT-5-mini 在 depth=1 时把两个硬骨头基准的分数从几乎为零拉到 58.0% 和 91.3%,效果摆在那。作者自己先打了折,说多层递归会失败,这种不吹牛的态度反而让人更信。分数卡在 78 是因为目前只绑定了 GPT-5-mini,换别的模型行不行还没验证,而且方法本身还在早期,先别太激动。

7月9日星期四

AI HOT 精选

蚂蚁灵波开源 LingBot-Video:一个专为机器人设计的视频生成模型,用 MoE 架构把推理成本打下来

蚂蚁灵波发布了 LingBot-Video,一个专门给具身智能用的视频生成模型,代码已开源。它用 MoE 架构(混合专家)替代了传统的密集模型,总参数量 30B,但生成视频时只激活约 3B 参数,推理速度比同规模的密集模型快 3 倍左右。训练数据是 7 万小时的机器人相关视频,包括灵巧操作、导航和第一人称视角交互,不是网上随便扒的风景片。为了让生成的动...

推荐理由:蚂蚁灵波开源了 LingBot-Video,一个用 MoE 架构做的具身智能视频基模。我会先打个折:这是刚发布的新东西,还没有外部复现报告,效果别急着全信。但亮点挺实在——30B 参数只激活 3B,推理快 3 倍,意味着本地跑或上机器人端成本低不少。训练数据是 7 万小时机器人相关视频,不是网上扒的通用素材,这点比很多视频模型更对口。代码已开源,做这行的人可以直接拉下来试。

7月8日星期三

OpenAI News

OpenAI 审计 SWE-Bench Pro,发现约三成题目本身有毛病

OpenAI 对编程评测集 SWE-Bench Pro 做了一次质量审查,估计里面大约 30% 的题目是坏的。他们先用自动管线筛出 286 道可疑题目,再让基于 Codex 的调查 agent 和五位资深工程师分别复核。工程师最终标记出 249 道(34.1%)有缺陷的题目,主要毛病是测试太死板、题目描述漏要求、测试覆盖不足,以及题目描述误导模型。Op...

推荐理由:OpenAI 对 SWE-Bench Pro 做了一次质量审计,发现约 34% 的题目有缺陷,这个比例逼着行业重新审视编程评测的可靠性。文章给出了具体的缺陷分类和一套人机结合的复核流程,不是空喊评测有问题。没给更高分是因为这本质上是一份基准质量报告,不是模型能力突破或产品发布,但它的警示作用对从业者很实在。

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

7月5日星期日

AI HOT 精选

美团 LongCat-2.0 完全开源,1.6T 参数的 MoE 模型,权重和推理代码都放出来了

美团把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。它用了三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 ...

推荐理由:美团把 LongCat-2.0 完整开源,MIT 协议放权重和代码,在国内大厂里算动作很大。1.6T 总参数、每次只激活 48B、100 万 token 上下文,这几个数字说明它在长文本和推理成本上都做了针对性设计,不是纯刷参数量。对从业者来说,能直接拿到权重和推理代码,比只发论文或给 API 实用得多。重要性给 82 分合理,featured 也站得住,因为这件事既有技术细节可聊,又有开源生态层面的信号意义。

7月2日星期四

Ben's Bites

Fable 5 重新上线,同时来了个新的 Claude Sonnet 5

Anthropic 把 Fable 5 又放出来了,付费用户能用,但只到 7 月 7 号,而且用量上限砍半。官方说这次加了更强的安全护栏。Scale 的跑分显示它能完成 16% 的远程工作任务,是 Opus 4.8 的两倍。同时发布的 Claude Sonnet 5 跑分接近 Opus 4.8,单 token 价格更低,但实际跑一个任务的总花费差不多,...

推荐理由:Anthropic 同时放出 Fable 5 的限时回归和 Sonnet 5,两条消息叠在一起。Scale 的跑分给了可对比的硬数字,不是纯宣传稿。Fable 5 的 16% 任务完成率虽然翻倍但绝对值还低,所以重要性没推到 90 以上。

Hacker News 首页

Cursor 发布 CursorBench 3.1,用真实用户的多文件编程任务给代码智能体打分

Cursor 新出的这个评测基准,题目不是人造的,而是直接从真实用户会话里扒出来的——需求模糊、要改多个文件的那种。3.1 版还加了理解代码库、找 bug、做计划和代码审查这几类题。目前榜首是 Fable 5 Max,得分 72.9%,但每跑一个任务平均要花 18 美元、用掉 6.3 万个 token、执行 76 步,成本不低。GPT-5.5 High...

推荐理由:Cursor 把基准从人造题换成了真实用户会话,3.1 版还加了读代码库、找 bug、做计划这些题型,更贴近日常开发。Fable 5 Max 目前得分最高 72.9%,但跑一次任务平均花 18 美元、烧 6.3 万个 token、执行 76 步,成本不低。GPT-5.5 High 得分 64.3%,正文没给它的具体花费,这点先别急着比。整体信息量够从业者直接做选型参考,但没披露样本量和任务难度分布,验证强度要打个折。

AI HOT 精选

腾讯混元发布 Hy3 模型,参数量只有旗舰模型的 1/5 到 1/2,但效果能打平甚至超过

腾讯正式开源了 Hy3 模型,采用 Apache 2.0 协议。这个模型最狠的地方在于,它的参数量只有其他家旗舰模型的 1/5 到 1/2,但在推理、智能体(让模型进业务流程干活)和长文本任务上的跑分却能打平甚至超过。在内部 270 人的盲测里,Hy3 均分 2.67 分,赢了 GLM5.1 的 2.51 分。产品体验上修了几个硬伤:幻觉率从 12.5...

推荐理由:腾讯混元发Hy3,用更小参数量打平甚至超过更大模型,还直接Apache 2.0开源。我会先打个折,因为内部盲测和跑分不能完全代表真实场景,但参数量小、幻觉率降低、协议友好这三点组合在一起,对想省钱又想用强模型的团队来说,值得立刻关注。

7月1日星期三

AI HOT 精选

美团开源 LongCat-2.0:1.6 万亿参数,用五万张国产卡训练,月调用量已冲到 OpenRouter 全球前三

LongCat-2.0 是个总参数 1.6 万亿、每次推理只激活约 480 亿参数的大模型,原生支持 100 万 token 上下文。它全程在五万张国产 GPU 集群上训练和跑推理,架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分...

推荐理由:美团不是一线模型厂,突然掏出万亿参数模型,而且全程国产 GPU,这个反差是最大的新闻点。代码评测分数不低,但正文没披露更多推理成本和实际部署细节,所以我会先打个折。分数没给更高,是因为美团在模型圈还没建立起持续交付的信用,真实可用性要看开源后的社区反馈。

6月30日星期二

Hacker News 首页

美团开源 LongCat-2.0:1.6 万亿参数 MoE 模型,48B 激活,全程用自研 AI ASIC 训练

美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...

推荐理由:美团开源了一个总参数 1.6 万亿、每次激活约 480 亿参数的 MoE 模型,全程用自研 AI ASIC 训练,5 万多张卡零回滚跑完,预训练数据量超过 35 万亿 token。模型专门为长上下文和智能体场景做了优化,引入了 LongCat 稀疏注意力来加速百万 token 级处理。我会先打个折:目前只有官方博客,没有第三方评测或真实业务反馈,所以分数停在 82 而不是更高。如果是真的,这套非 GPU 训练方案挺省钱,但稳定性和性能还需要更多证据。

6月28日星期日

AI HOT 精选

四大AI打《文明VI》:Claude造核弹炸了法国,结果还是输了

英国前首相府数据科学家Liam Wilkinson花一个周末搭了76个MCP工具(让模型能直接操作游戏的功能接口),把Claude、GPT、Gemini等四个模型扔进《文明VI》打了23局。最戏剧性的一局,Claude玩的葡萄牙离外交胜利只差2分,看到法国文化胜利进度猛涨,慌了,花50回合全力研发核弹,把法国城市图卢兹夷为平地——然后法国靠外交胜利赢了...

推荐理由:76 个 MCP 工具、23 局对战、一场核弹外交惨案,HKR 全中。因为是周末实验不是正式研究,分数压到 82,但故事和洞察够上 featured。

Computing Life · Share · 鸭哥调研

AI 补贴退潮后,agent 开始按每美元智能计价

大模型 token 的隐性补贴正在退场。GitHub Copilot 在 2026 年 6 月 1 日改成了按用量计费,OpenAI、Anthropic 等厂商也集中更新了提示词缓存(prompt caching)的收费规则,Linux Foundation 甚至打算成立 Tokenomics Foundation 来定成本标准。这不是 token 单...

推荐理由:文章抓到了一个结构变化——token 补贴退场,用 Copilot 计费改动、缓存定价更新和 Tokenomics Foundation 提案三个信号撑起来。没给更高分是因为它属于趋势分析而非硬消息,正文也没披露具体价格数字或缓存命中率数据,判断只能停在信号层面。

6月26日星期五

纽约时报中文网

智谱 GLM-5.2 冲进全球前十,中国模型与 OpenAI、Anthropic 的差距只剩不到半年

智谱的新模型 GLM-5.2 在 Anthropic 限制 Fable 和 Mythos 访问后迅速走红,登上了 OpenRouter 排行榜前十。它处理某些任务的成本只有 Claude Opus 4.8 的八分之一,而且完全开源。有专家估计,中国 AI 落后美国的时间差已经缩短到六个月甚至更短。不过,智谱 2025 年上半年的算力支出超过了营收的七倍...

推荐理由:智谱 GLM-5.2 在 Anthropic 限制访问后迅速补位,成本打一折、完全开源、差距缩到六个月,三个信号叠加值得推荐。没给更高分是因为正文没披露模型在复杂任务上的实测对比,光靠排行榜和成本数字还缺一块验证。

6月24日星期三

Hacker News 首页

Qwen 发布 AgentWorld:一个能模拟环境、帮 AI 智能体练级的语言世界模型

Qwen 团队搞了个新东西,叫 Qwen-AgentWorld,本质上是一个用语言模型做的世界模拟器。它不直接干活,而是预测“在当前环境下做了某个动作后,下一步会发生什么”,覆盖了 7 种不同的场景。为了让模型学会这个本事,他们用了超过 1000 万条真实环境里的交互记录,分三步训练:先灌知识让它理解状态变化,再教它一步步推理出下一步,最后用规则和评分...

推荐理由:Qwen 团队拿语言模型当世界模拟器用,在 7 种环境里用超千万条交互记录训练它预测“做了某动作后会发生什么”。思路新,数据量和训练步骤也实在,对搭 agent 的人有参考价值。不过目前还是论文,不是产品,实际任务里能省多少事、准不准,还得看后续验证,所以分数没给太高。

6月23日星期二

Hacker News 首页

Krea 发布 Krea 2 技术报告:开源生图模型,不追求单一美颜,而是让你能探索各种视觉风格

Krea 2 是一系列开源文生图模型,采用宽松许可证。它没有把力气花在优化一种精致默认画风上,而是想覆盖更广的视觉风格,让用户通过文字或参考图去探索。预训练数据刻意排除了 AI 生成的图片,也不用美学评分模型去过滤,只去掉了重复样本、VLM 描述不清的图、有害偏见内容、过于复杂的图。架构是扩散 Transformer,用了 iREPA、改进版 VAE、...

推荐理由:Krea 2 开源了模型和一份技术报告,亮点是数据策略:不用 AI 生成的图、不用美学评分过滤,想靠这个覆盖更宽的视觉风格。对做模型训练的人有干货,但报告没放对比评测或用户实测,在文生图这个拥挤赛道里,实际效果还得等社区跑一跑再看,所以给到 78 分、放在 featured 里。

6月20日星期六

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

AI HOT 精选

Steve Yegge:Fable 被美国政府短暂关闭,意味着最聪明的 AI 模型以后会像核武器一样被锁起来

Steve Yegge 认为,Fable 模型被美国政府短暂关停是一个分水岭,说明模型智能已经危险到需要管控了。他预测,最多再过两三代模型,最前沿的 AI 就会像核武器一样被政府严格管制,绝大多数财富 500 强公司都拿不到访问权限。开源模型虽然能追到 Fable 这个级别,但受限于算力壁垒和供应链封锁,很难再往上突破。对大多数人来说,AI 能力曲线会...

推荐理由:Steve Yegge 把 Fable 被短暂关停这件事当成一个分水岭来聊,核心论点是 AI 能力曲线很快会被政府管制压平。判断很锋利,预测也具体,但本质是评论分析,不是一手报道,缺可核实的新事实,所以分数上我会打个折。

6月18日星期四

AI HOT 精选

GPT-5.5 Instant 把前沿健康问答能力带给了免费用户,医生盲评得分比真人写的还高

OpenAI 把最新的 GPT-5.5 Instant 模型用在了 ChatGPT 的健康问答上,免费用户也能用。在 3500 条回复的盲评里,医生给它的准确性、沟通清晰度和完整性打分,比真人医生写的回答还高,而且更少出现漏掉危险信号、不追问背景这类问题。后台监控显示,过去两个月健康回复的事实错误率下降了 71%。这些提升靠的是模型本身变强,以及请医生...

推荐理由:OpenAI 把 GPT-5.5 Instant 塞进了 ChatGPT 的健康问答,免费用户也能用。在 3500 条回复的盲评里,医生给它的准确性、沟通清晰度和完整性打分,比真人医生写的回答还高,而且更少漏掉危险信号、不追问背景这类问题。后台监控显示过去两个月事实错误率下降了 71%。这些提升靠的是模型本身变强,以及请医生参与调优,但正文没披露医生参与的具体方式和样本覆盖的疾病范围,所以效果能不能泛化到所有健康场景还得打个问号。

AI HOT 精选

阿里开源 LOGOS 科学模型,用 1/56 参数量在多项任务上超过微软 NatureLM

阿里和人大高瓴学院开源了一个叫 LOGOS 的科学模型,把蛋白质、小分子、材料等七种科学数据统一编成一套“科学语法”的 token 序列,让模型用预测下一个词的方式直接处理。它把蛋白质口袋和配体的 3D 接触模式也转成了离散 token,不依赖显式 3D 坐标就能预测空间相互作用。LOGOS-1B 只有 10 亿参数,微软 NatureLM 是 8×7...

推荐理由:阿里开源了一个 10 亿参数的科学模型 LOGOS,把七种科学数据统一成 token 序列,用预测下一个词的方式处理,还在多个任务上赢了参数多 56 倍的微软 NatureLM。有具体数字、有开源代码,知识增量扎实。但领域太专,我会先打个折——对科学 AI 圈内人是硬货,对圈外人共鸣不强,所以放在 featured 里比较合适。

6月17日星期三

OpenAI News

OpenAI 发布 LifeSciBench:由博士科学家出题、审题,专门考模型做真实科研任务的基准

OpenAI 放出了一个叫 LifeSciBench 的基准,750 道题全由有生物技术或制药行业经验的博士科学家出题和审题。它不考知识点背诵,考的是模型能不能干真实的科研活儿:比如解读互相矛盾的实验证据、设计实验方案、评估药物从实验室到临床的风险。53% 的题需要模型去读附带的图表、序列文件等材料,平均每道题要经过 4 步推理。评分也不只看最终答案对...

推荐理由:OpenAI放出了一个由博士科学家出题的基准,750道题考的是实验设计、矛盾证据解读和转化风险评估,比现有基准更接近真实科研工作。分数没给更高是因为目前只有预印本,正文没披露模型在这个基准上的具体表现数据,也没说后续会不会持续更新题目,所以先打个折。

6月16日星期二

AI HOT 精选

蚂蚁百灵开源三款新模型,用混合注意力架构把推理速度拉到 340 tokens/s

蚂蚁百灵发了 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 的技术报告,代码和权重都公开了。三款模型用了同一种 Hybrid Linear Attention 架构,把 Lightning Attention 和 MLA 按 7:1 的比例拼在一起,主要为了在长文本上跑得快、省资源。Ling-2.6-flash 在 ...

推荐理由:蚂蚁百灵这次开源了三款模型,核心卖点是把 Lightning Attention 和 MLA 按 7:1 的比例揉成一个 Hybrid Linear Attention,主要为了在长文本上省资源、跑得快。报告给了具体参数和效率数据,代码权重都公开,信息扎实,所以给了 featured。没打更高是因为蚂蚁的模型在社区关注度上还比不上那几个顶流实验室,实际业务里的表现也得再观察,我会先打个折。

r/LocalLLaMA

HalBench 给 29 个开源模型测拍马屁和幻觉,Qwen 3.6 和 Gemma 4 以小博大,Meta 继续证明自己不会花钱

HalBench 是一个开源基准测试,专门看模型面对错误前提时是直接反驳还是顺着说瞎话。v2.3 测了 33 个模型,其中 29 个开源。结果只有 Sonnet 4.6(65.1%)和 Grok 4.3(50.9%)的反驳率过半。开源里最强的是 Qwen 3.6,一个约 270 亿参数的稠密模型,反驳率 36.6%,压过了 GPT-5.4 和 Gemi...

推荐理由:一个社区自建的基准,有具体数字和排名,Qwen 3.6 在反驳率上超过 GPT-5.4,信息量够。没给 p1 是因为这是自建评测,还没同行评审,先当强推荐处理。

6月15日星期一

AI HOT 精选

MiniMax 开源 M3 模型,428B 总参数里只激活 23B,长文本推理更省钱

MiniMax 把 M3 模型权重放出来了,总参数 428B,每次推理只激活 23B,同时发了 MSA 稀疏注意力论文,专门降长上下文推理成本。M3 是第一个从预训练阶段就用图文交错数据练出来的开源模型。发布两周后,它在 Artificial Analysis 综合智能指数和 GDPval-AA 上拿了开源第一,Code Arena WebDev 进了...

推荐理由:MiniMax 把 428B 的 M3 模型权重和 MSA 稀疏注意力论文一起放出来,主打长上下文推理省钱,两周内拿了两个开源第一。我会先打个折,因为这是官方公告,没有第三方基准或具体的 MSA 成本数字,但架构稀缺性和开源排名已经够上 featured。

6月13日星期六

AI HOT 精选

智谱发了新旗舰 GLM-5.2,主打编程和 1M 上下文,下周开源

GLM-5.2 现在就能用,但只对 Coding Plan 的付费用户开放。模型强调编程能力强,上下文窗口拉到 1M token,也就是一次能塞进整本《三体》的量。API 和对话入口要等到下周,开源也同步,用 MIT 许可证,商用友好。正文没给跑分和具体定价,所以实际编程水平、长文本召回率都还不好说。如果是真的强,下周开源后社区会很快验出来。

推荐理由:智谱放出 GLM-5.2,主打编程能力,上下文拉到 1M token,下周用 MIT 许可证开源。正文没给跑分和定价,实际水平还没法验证,所以分数没给到 85 以上。但国产旗舰更新加开源,信号够强,值得放进 featured。

AI HOT 精选

MiniMax 把 M3 模型权重放上 HuggingFace,顺带怼了 Anthropic 的出口管制

MiniMax 在 HuggingFace 上放出了 M3 模型的权重,帖子用了一句“M3 would never”,暗讽 Anthropic 的 Fable 5 和 Mythos 5 因为美国出口管制被强制禁用、连外国员工都不能碰。正文没披露 M3 的参数量、跑分成绩和具体开源协议,所以模型到底多大、性能怎么样、能不能商用,这些关键信息都还不清楚。

推荐理由:MiniMax 在 HuggingFace 放出 M3 权重,帖子用了一句暗讽 Anthropic 被出口管制卡脖子的事,冲突和话题性都够。但正文没披露参数量、跑分和协议,模型实力和商用条件全悬着,所以分数只能给到 72。