跳到正文

#开源/仓库

今日 3 条

7月23日星期四

Latent Space

Poolside 联创自述:70 人团队如何在 8 周内训出 118B 的 MoE 模型

Poolside 的联合 CEO Eiso Kant 在播客里拆解了他们的“模型工厂”。一个不到 70 人的研究团队,每月跑 1 万到 2 万次实验,把模型迭代周期从半年压缩到了 5 到 8 周。他们刚发的 Laguna S 2.1 是个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,支持 100 万 token 的上下文窗口,还有思...

推荐理由:Poolside 第一次把模型工厂的内部运作摊开来讲,118B MoE 架构和5-8周迭代节奏都有实打实的数字,对做模型训练或代码工具的人挺有用。没给更高分是因为 Poolside 的盘子还集中在代码领域,这篇对非代码方向的从业者触动有限。

7月22日星期三

Hacker News 首页

Codeberg 修改服务条款,禁止上传 vibe coding 项目

Codeberg 会员投票通过了一项服务条款修订,禁止在平台上分享“主要由大模型生成且未经人工审核”的代码项目。提案给出的理由是这类项目版权归属模糊、缺乏基本的安全保障。我会先打个折:条款里没定义什么叫“主要由大模型生成”,也没说清楚“分享”是仅指公开仓库还是也包括私有仓库和 Pull Request,执行时间表同样没提。有成员在讨论中指出了这些模糊点...

推荐理由:Codeberg 会员投票修改服务条款,禁止分享未经人工审核的大模型生成代码。这事有实质性的治理动作,冲突感和新鲜度都够,但正文没给出“主要由大模型生成”的具体判定标准,也没说清私有仓库和 PR 是否在限制范围内,执行细节全是空白,所以分数没拉满。

7月21日星期二

Ben's Bites

Kimi K3 前端编程跑分超 Fable,但 token 浪费让价格优势归零

月之暗面发了新模型 Kimi K3,在 Arena 前端编程榜上压过 Fable 和 GPT-5.6-Sol,其他跑分也咬得很紧。模型很大,有 2.8 万亿参数,支持图片输入,上下文窗口 100 万 token,权重会在 7 月 27 号开源。但它的 token 效率很差——每个 token 的价格只有 Sol 的一半,实际干活却要多用一倍的 toke...

推荐理由:月之暗面扔出 Kimi K3,在 Arena 前端编程榜上把 Fable 和 GPT-5.6-Sol 都挤下去了,其他跑分也咬得很紧。模型体量很大,2.8 万亿参数,支持图片输入,上下文窗口拉到 100 万 token,还定了 7 月 27 号开源权重,这几个信号都挺硬。但有个明显的坑:token 效率差。单价标得便宜,只有 Sol 的一半,实际干活却要多烧一倍的 token,算总账并不省钱。这个反差让整件事更有讨论价值,不是纯吹捧。分数没给到 85 以上,是因为正文只提了 Arena 前端编程榜这一个具体成绩,其他跑分只说“咬得很紧”,没给具体数...

7月20日星期一

Hacker News 首页

Kimi K3 和 Qwen 3.8 开源夹击,Anthropic 的昂贵生意快撑不住了

这周 Moonshot 的 Kimi K3 和阿里的 Qwen 3.8 都发了,性能号称接近 Anthropic 的 Fable 5,而且模型权重马上要公开。文章算了笔账:Anthropic 自己不建数据中心也不发电,用的是租来的算力和电,所以推理成本会跟着用量涨。Fable 5 每完成一个任务,成本差不多是对手的 3 倍。开源模型追上来之后,这种高价...

推荐理由:K3 和 Qwen 3.8 发模型本身不算最大新闻,真正值钱的是那笔成本账:Fable 5 跑一次任务比对手贵三倍,而且 Anthropic 没自建机房,用的全是租来的算力和电,用量越大成本越高。文章把这个结构劣势讲得很清楚,等于给开源追上来提供了一个实打实的经济理由,不是空谈性能。我会先打个折,因为成本对比的细节正文没完全展开,但逻辑链条够硬,值得放进 featured。

AI HOT 精选

小红书和北大开源 UltraEP,给 MoE 模型做实时负载均衡

MoE 模型里专家负载不均会让 GPU 空等,UltraEP 的做法是在每个 microbatch 和每一层动态复制热门专家,用精确路由信息实时调度。在 Qwen3-235B 上训练吞吐达到理想性能的 94.6%,比 Megatron-LM 高 42%;推理 prefill 吞吐是 SGLang 的 1.56 倍。正文没披露开源协议和部署条件。

推荐理由:小红书和北大联合开源的这个方案,解决的是 MoE 训推里 GPU 空等的实际问题,给出的性能数字很强:训练吞吐达到理想的 94.6%,推理比 SGLang 快 56%。技术路线也讲得明白,是逐层、逐 microbatch 的实时动态复制,不是事后补救。我会先打个折,因为正文没提开源协议和部署条件,这两个缺口会卡住很多想落地的人。整体上对做大规模训推基础设施的团队很有用,但对普通 AI 从业者来说场景偏窄。

Hacker News 首页

小米开源机器人基础模型 XR-1:用 10 万小时无实机视频预训练,新任务学不到 10 小时成功率 75%

小米机器人团队放出了一个开箱即用的机器人基础模型 XR-1,代码、权重和论文都公开了。它的思路分两步:先用 10 万小时不带真实机器人的操作视频做预训练,覆盖 1700 多个场景,让模型学会“看到画面变化该输出什么动作”;再用 7200 小时真机数据做后训练,把动作能力对齐到具体机器人上,并让模型能听懂自然语言指令。预训练阶段出现了干净的缩放规律——数...

推荐理由:小米机器人开源了 XR-1,一个带代码和权重的机器人基础模型。两阶段训练路线(10 万小时无真机预训练 + 7200 小时真机后训练)和预训练缩放规律是硬信号,直接对标 π 0.5。我会先打个折:正文没披露真机后训练的具体任务成功率和泛化测试细节,这点先别太激动。但开源全套这个动作本身,对行业来说比发一篇论文管用。

7月19日星期日

Computing Life · Share · 鸭哥调研

Grok Build 开源了客户端执行层,模型和云端没开

xAI 把 Grok Build 在本地管理文件、命令和权限的客户端 harness 用 Apache-2.0 协议公开了,代码可以看、可以自己编译。但 Grok 模型、云端服务以及官方安装包的构建链还是闭源的。仓库不接受外部 PR,官方二进制用的内部 commit 也不在公开历史里,所以下载到的程序不一定对应公开的源码。7 月初的上传争议发生在旧版,...

推荐理由:xAI 把 Grok Build 的客户端 harness 用 Apache-2.0 放出来,支持无头模式和 ACP,不算纯作秀。但模型和构建链还是闭源,仓库也不接外部 PR,所以上限到不了 85。三个 HKR 维度都踩中了,放 featured 合适。

TechCrunch · AI

月之暗面开源 Kimi K3,性能逼近 GPT-5.6 和 Claude Fable 5,但关键细节没公布

月之暗面这周把 Kimi K3 开源了。公司自己承认模型还打不过最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但 Arena.ai 和 Vals AI 的第三方评测显示,K3 已经能跟这些旗舰模型掰手腕了。发布正好赶上习近平在上海世界人工智能大会讲话,纳斯达克周五跌了约 1%,芯片股像英伟达被抛售。这波讨论很像 2025 年...

推荐理由:月之暗面把 Kimi K3 开源,第三方评测显示它能跟 GPT-5.6 Sol 和 Claude Fable 5 掰手腕,这是中国模型生态一个挺硬的信号。不过这篇是 TechCrunch 的评论稿,不是官方发布原文,所以重要性我打了 78 分,没再往上拉。

7月17日星期五

Hacker News 首页

月之暗面发布 2.8 万亿参数 Kimi K3,自称首个开源 3T 级模型,API 定价看齐 Claude Sonnet

月之暗面推出了 Kimi K3,一个 2.8 万亿参数的模型,他们把它四舍五入叫成“首个开源 3T 级模型”。这个模型 API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。它自己公布的跑分大多超过了 Claude Opus 4.8 和...

推荐理由:月之暗面发了 Kimi K3,一个 2.8 万亿参数的模型,他们管它叫“首个开源 3T 级模型”,API 定价输入每百万 token 3 美元、输出 15 美元,跟 Claude Sonnet 一个价,是目前中国 AI 实验室里最贵的。自己公布的跑分大多超过 Claude Opus 4.8 和 GPT-5.5 high,但输给 Claude Fable 5 和 GPT-5.6 Sol。Simon Willison 的测试里 K3 在长周期知识任务上比前代 K2.6 涨了 732 Elo,输出 token 数少了 21%,成本降了 27%,说明模型在...

AI 群聊日报

Kimi K3 登顶前端编程榜,权重将开源,但实测发现它有时会烧光额度原地打转

Kimi K3 在 Frontend Code Arena 拿了 1679 分,压过 Claude Fable 5,七个前端领域赢了六个。模型有 2.8 万亿参数,支持 1M 上下文,定价是每百万 token 3 到 15 美元,完整权重会在 7 月 27 日前放出来。群友上手后评价两极:有人花 199 元月费让它重做了之前搞砸的粒子特效,效果惊艳;也...

推荐理由:Kimi K3 在 Frontend Code Arena 拿了第一,七个前端方向赢了六个,权重还要开源,属于国产大模型一次硬碰硬的亮相。群聊日报给了分数、参数量、价格和真实用户反馈,信息够用。没打更高是因为来源是社区整理,不是一手官方公告,我会先打个折。

7月16日星期四

Hacker News 首页

Sentinel:一个先读代码再动手的开源 QA 智能体

SimbaStack 在 MIT 协议下开源了 Sentinel,一个会先通读代码库、自己梳理业务流程,再做端到端测试的 QA 智能体。他们拿自家酒店管理系统做实验,只给了代码仓库和管理员账号,没给任何测试计划。Sentinel 读完代码后判断这是个精品酒店系统,自动梳理出九条关键业务流,包括完整的预订生命周期、团队预订和夜审。它把最重要的两条流程各跑...

推荐理由:一个开源 QA agent 的新玩家,拿真实的酒店管理系统做了端到端实验,不是玩具 demo。分数没上 80,因为目前只有一篇博客,还没有第三方复现或横向对比。

Hacker News 首页

批评大模型的人说得都对,但我还是在用

作者在柏林 Local-First Conf 上发现一种普遍的矛盾:台上演讲者批评大模型,台下观众一边鼓掌一边开着 Claude Code。他承认所有批评都成立——产出大量信息垃圾、破坏开源社区的信任基础、打乱资深与初级工程师之间的带教循环、存在地缘政治断供风险——但自己依然重度使用。文章没有试图化解这种矛盾,而是把这种集体性的别扭感摊开来讲,并邀请大...

推荐理由:这篇文章没打算讲道理,就是把开发者圈子里那种'边骂边用'的集体拧巴摊开给你看。柏林会议上 Armin Ronacher 的回复是个好钩子,但全文没有数据支撑,也没有解决方案,就是一次诚实的自我暴露。我会给 featured,因为共鸣够强、传播力够好,但别指望从这里学到什么新东西。

AI HOT 精选

xAI 把编程助手 Grok Build 的完整代码开源了

xAI 在 GitHub 上公开了 Grok Build 的全部源码,包括智能体的工作循环(怎么拼上下文、怎么解析模型回复、怎么调用工具)、终端界面、以及技能、插件、MCP 服务器等扩展系统。你可以直接读源码搞清楚它的内部机制,也可以自己编译后连上本地模型跑起来,完全离线使用。

推荐理由:xAI 开源了 Grok Build 的全部代码,包括智能体循环、终端界面和扩展系统,还支持本地离线运行,在开发者圈子里同时踩中了好奇心、干货和实用价值三个点。目前只有官方公告,还没有第三方评测或实际跑通后的反馈,所以分数先定在 featured 这一档,等有人上手验证了再调整。

7月15日星期三

Hacker News 首页

StyleSeed:给 AI 编程助手装一套设计规范引擎,别让它再生成千篇一律的界面

bitjaru 开源了一个叫 StyleSeed 的项目,专门给 Claude Code、Cursor 这类 AI 编程工具用。它不直接生成代码,而是教模型做设计判断。项目里打包了 74 条设计规则、48 个组件、7 套品牌皮肤(像 Stripe、Linear、Vercel 这些),还有一套命名过的动效系统和 15 个快捷指令。目前 MIT 协议开源,...

推荐理由:给 AI 编程工具加设计约束这事确实戳中刚需,74 条规则加品牌皮肤让项目不止于概念 demo。分数没给更高是因为刚在 Show HN 亮相,没有用户反馈和实际落地效果,目前只能按工具完整度打分。

Computing Life · Share · 鸭哥调研

Codex 仍然开源,但父 agent 给子 agent 派了什么任务,现在被加密了

OpenAI 在 6 月 5 日合并了一个 PR,把 Codex 里主 agent 派给子 agent 的任务指令从明文改成了密文。以前你在本地日志里能看到类似“Review the authentication changes”这样的具体任务,现在只剩一串 <ciphertext>。子 agent 调用了什么工具、跑了什么命令、改了哪些代码,这些执行...

推荐理由:这是一条有具体技术细节的产品变动报道,不是公关稿。PR 号、issue 链接、改动前后对比都给出来了。扣分是因为这属于功能调整而非新能力发布,影响范围也局限在 Codex 用户。我会先打个折:虽然对开发者体验的冲击不小,但本质上是一次安全加固,不是模型能力或架构的突破。

7月14日星期二

AI HOT 精选

腾讯混元把295B大模型压到单GPU能跑,发了1-bit和4-bit量化版

混元Hy3是个2950亿参数的MoE模型,现在出了1-bit和4-bit两个压缩版,用llama.cpp就能在单张显卡上跑,还支持MTP加速推理。官方说这个尺寸下它表现最好,能跟万亿参数的大模型掰手腕,适合让模型进业务流程干活。模型走Apache 2.0协议,可以商用,OpenRouter上还给了两周免费API。不过正文没披露量化后精度掉了多少,也没说...

推荐理由:腾讯混元把2950亿参数的Hy3模型压到单GPU能跑,对本地部署和做agent的人很实用。Apache 2.0协议加两周免费API,试错成本低。没给85分以上,是因为正文没披露量化后精度掉了多少,这点先别太激动。

TechCrunch · AI

做开源 Hermes agent 的 Nous Research 正以 15 亿美元估值融资,Robot Ventures 领投

Nous Research 正在敲定一轮新融资,估值 15 亿美元,至少融 7500 万美元。领投方是 Robot Ventures,USV 也跟了很大份额。三个消息源确认了这笔交易,但 Nous 拒绝评论,投资方也没回邮件。这家公司 2023 年成立,之前从 Paradigm、OSS Capital、Balaji Srinivasan 等人手里拿过 ...

推荐理由:Nous Research 的 Hermes agent 在开源圈确实有存在感,融资金额和投资方阵容都够硬。我会先打个折:目前只是'在谈',还没 close,Nous 和投资方都没开口,所有信息都来自消息源。正文没披露这笔钱具体要花在哪、Hermes 的商业化进展到什么程度,估值逻辑暂时只能靠猜。如果是真的,这个估值对开源 agent 赛道是个信号,但先别太激动。

7月13日星期一

AI HOT 精选

腾讯混元开源 HyOCR-1.5:1B 参数的端到端 OCR 模型,推理速度提升 6.37 倍

腾讯混元把 HyOCR-1.5 的训练代码、推理代码和模型权重全开源了,这在端到端 OCR 大模型里是头一个。模型只有 1B 参数,能处理文档解析、公式识别、表格还原等 8 种以上的文字任务。在 OmniDocBench v1.6 上拿了 94.74 分,排在端到端模型的第一名。推理速度这块,它用了一个叫 DFlash 的投机解码方法,在 Transf...

推荐理由:腾讯混元把一个端到端 OCR 模型从训练到推理全开源了,不是只放权重。1B 参数在 OmniDocBench v1.6 上拿了 94.74 分,端到端模型里排第一,还靠 DFlash 把推理速度提了 6.37 倍。这对做文档解析或 RAG 的人来说,是个能直接上手试、省训练成本的开源选项。我会先打个折:正文没提模型在复杂版面、手写体或噪声场景下的具体表现,也没说 6.37 倍提速是在什么硬件和 batch size 下测的,这点先别太激动。但整体看,这是国内大厂一次实打实的全栈开源,不是公关稿。

7月11日星期六

Hacker News 首页

Cloudflare 默认拦截 AI 爬虫,你的智能体读到的可能是假页面

从 2025 年 7 月 1 日起,Cloudflare 对新域名默认开启 AI 爬虫拦截。更麻烦的是,被拦下来的请求会返回一个 403 状态码,但带着完整的网页内容——就是那个“稍等片刻”的验证页面。语言模型会把这当成真实内容,自信地总结出根本不存在的答案。作者用普通请求测了 8 个主流反爬网站,结果 0 次拿到真实内容,8 次都拿到了可被总结的拦截...

推荐理由:我会先打个折:文章没给出绕过工具在 Cloudflare 最新规则下的持续成功率数据,长期有效性存疑。但它的核心价值不在工具本身,而在于揭示了一个被忽视的数据污染路径——403 拦截页被当成正文喂给模型。这个发现对任何依赖网页抓取做知识库或 agent 的团队都是实打实的风险提示,加上有具体测试数字和开源代码,值得推荐。

7月9日星期四

AI HOT 精选

蚂蚁灵波开源 LingBot-Video:一个专为机器人设计的视频生成模型,用 MoE 架构把推理成本打下来

蚂蚁灵波发布了 LingBot-Video,一个专门给具身智能用的视频生成模型,代码已开源。它用 MoE 架构(混合专家)替代了传统的密集模型,总参数量 30B,但生成视频时只激活约 3B 参数,推理速度比同规模的密集模型快 3 倍左右。训练数据是 7 万小时的机器人相关视频,包括灵巧操作、导航和第一人称视角交互,不是网上随便扒的风景片。为了让生成的动...

推荐理由:蚂蚁灵波开源了 LingBot-Video,一个用 MoE 架构做的具身智能视频基模。我会先打个折:这是刚发布的新东西,还没有外部复现报告,效果别急着全信。但亮点挺实在——30B 参数只激活 3B,推理快 3 倍,意味着本地跑或上机器人端成本低不少。训练数据是 7 万小时机器人相关视频,不是网上扒的通用素材,这点比很多视频模型更对口。代码已开源,做这行的人可以直接拉下来试。

7月8日星期三

TechCrunch · AI

法国 AI 创业公司 ZML 发布免费推理加速工具,支持多种芯片

ZML 推出了开源软件 ZML/LLMD,能让 Llama、DeepSeek 这类模型在 Nvidia、AMD、Google TPU、Apple Metal 和 Intel Arc 等不同芯片上跑得更快。创始人 Steeve Morin 说目标就是降低推理成本,目前免费。图灵奖得主 Yann LeCun 之前公开推荐过这家公司。不过正文没披露融资细节,...

推荐理由:跨芯片推理加速确实是刚需,ZML/LLMD 免费开源,又有 LeCun 背书,吸引力不低。但正文没给性能对比数据,也没披露融资情况,所以分数只能打到 72,不能更高。

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

7月5日星期日

AI HOT 精选

美团 LongCat-2.0 完全开源,1.6T 参数的 MoE 模型,权重和推理代码都放出来了

美团把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。它用了三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 ...

推荐理由:美团把 LongCat-2.0 完整开源,MIT 协议放权重和代码,在国内大厂里算动作很大。1.6T 总参数、每次只激活 48B、100 万 token 上下文,这几个数字说明它在长文本和推理成本上都做了针对性设计,不是纯刷参数量。对从业者来说,能直接拿到权重和推理代码,比只发论文或给 API 实用得多。重要性给 82 分合理,featured 也站得住,因为这件事既有技术细节可聊,又有开源生态层面的信号意义。

7月2日星期四

Hacker News 首页

git-annex 维护者花 100 小时把依赖里的 AI 生成代码全清了出去

Joey Hess 花了一个月、大约 100 小时,把 git-annex 整个依赖树里所有 AI 生成的代码都排查并剔除掉了。他发现了一些很离谱的东西:一个 1489 行、语无伦次的提交说明,对应着 10000 行代码改动;还有一个 AI 提示词直接让模型从别的项目抄代码,没惹上版权官司纯属运气好。他说这 100 小时唯一的正面收益,是以后选依赖时手...

推荐理由:Joey Hess 亲自下场干了件脏活累活,不是嘴上说说,是真花了 100 小时把 git-annex 依赖树里的 AI 代码全清了一遍。他挖出来的例子很具体:一个提交说明写得像醉酒机器人,却改了上万行代码;另一个提示词直接教模型去抄别人项目。这些不是假设风险,是已经埋进依赖里的雷。SFC 已经不管了,说明这事目前没人兜底。给 featured 和 78 分,是因为它是一线维护者的实战报告,不是行业公告,但足够让所有靠开源吃饭的人心里一紧。

AI HOT 精选

腾讯混元发布 Hy3 模型,参数量只有旗舰模型的 1/5 到 1/2,但效果能打平甚至超过

腾讯正式开源了 Hy3 模型,采用 Apache 2.0 协议。这个模型最狠的地方在于,它的参数量只有其他家旗舰模型的 1/5 到 1/2,但在推理、智能体(让模型进业务流程干活)和长文本任务上的跑分却能打平甚至超过。在内部 270 人的盲测里,Hy3 均分 2.67 分,赢了 GLM5.1 的 2.51 分。产品体验上修了几个硬伤:幻觉率从 12.5...

推荐理由:腾讯混元发Hy3,用更小参数量打平甚至超过更大模型,还直接Apache 2.0开源。我会先打个折,因为内部盲测和跑分不能完全代表真实场景,但参数量小、幻觉率降低、协议友好这三点组合在一起,对想省钱又想用强模型的团队来说,值得立刻关注。

Computing Life · Share · 鸭哥调研

Fable 5 被禁 18 天,Anthropic 丢掉的份额被 GLM 吃掉了

Anthropic 发布最强编码模型 Fable 5 三天后,被美国出口管制强制下线 18 天。OpenRouter 的逐日 token 数据显示,这期间平台总流量从 24T 涨到 32T,但 Anthropic 的份额从 20.7% 跌到 17.6%,绝对流量也缩水了。最大的赢家是 GLM,份额从 1.8% 飙到 7.4%。一个诡异细节是,GLM-5...

推荐理由:这篇文章用 OpenRouter 的逐日 token 数据,给 Fable 5 被禁 18 天这件事做了个定量归因。Anthropic 丢了 3.1 个百分点的份额,GLM 吃进 6.7 个百分点,还附带一个反常识的细节:GLM-5.2 发布后,老版本 GLM-5.1 的流量反而暴涨了四五倍。结论有数据支撑,而且指向一个很多人没料到的赢家,对从业者判断模型替代关系和供应链稳定性有直接帮助。

7月1日星期三

Hacker News 首页

开源游戏引擎 Godot 宣布不再接受 AI 写的代码贡献

Godot 维护者正式表态,不再合并由 AI 生成的代码补丁。核心原因是他们发现重度使用 AI 的贡献者往往看不懂自己提交的代码,出了问题没法修。项目方担心这些补丁表面正确,但藏着不易察觉的 bug,长期会拖垮维护工作。至于具体从哪天开始执行、用什么工具检测 AI 代码,正文没披露。

推荐理由:Godot 是开源游戏引擎里的头部项目,它公开拒绝 AI 代码补丁,等于给“AI 辅助编程靠不靠谱”这个争论扔了个重磅炸弹。维护者给出的理由很实在——不是代码写得不好,而是写的人自己看不懂,没法修 bug,这会慢慢拖死项目。这个判断对同行有很强的警示作用,而且话题本身在开发者群体里热度很高,容易传播。

AI HOT 精选

美团开源 LongCat-2.0:1.6 万亿参数,用五万张国产卡训练,月调用量已冲到 OpenRouter 全球前三

LongCat-2.0 是个总参数 1.6 万亿、每次推理只激活约 480 亿参数的大模型,原生支持 100 万 token 上下文。它全程在五万张国产 GPU 集群上训练和跑推理,架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分...

推荐理由:美团不是一线模型厂,突然掏出万亿参数模型,而且全程国产 GPU,这个反差是最大的新闻点。代码评测分数不低,但正文没披露更多推理成本和实际部署细节,所以我会先打个折。分数没给更高,是因为美团在模型圈还没建立起持续交付的信用,真实可用性要看开源后的社区反馈。

6月30日星期二

Hacker News 首页

美团开源 LongCat-2.0:1.6 万亿参数 MoE 模型,48B 激活,全程用自研 AI ASIC 训练

美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...

推荐理由:美团开源了一个总参数 1.6 万亿、每次激活约 480 亿参数的 MoE 模型,全程用自研 AI ASIC 训练,5 万多张卡零回滚跑完,预训练数据量超过 35 万亿 token。模型专门为长上下文和智能体场景做了优化,引入了 LongCat 稀疏注意力来加速百万 token 级处理。我会先打个折:目前只有官方博客,没有第三方评测或真实业务反馈,所以分数停在 82 而不是更高。如果是真的,这套非 GPU 训练方案挺省钱,但稳定性和性能还需要更多证据。

6月26日星期五

纽约时报中文网

智谱 GLM-5.2 冲进全球前十,中国模型与 OpenAI、Anthropic 的差距只剩不到半年

智谱的新模型 GLM-5.2 在 Anthropic 限制 Fable 和 Mythos 访问后迅速走红,登上了 OpenRouter 排行榜前十。它处理某些任务的成本只有 Claude Opus 4.8 的八分之一,而且完全开源。有专家估计,中国 AI 落后美国的时间差已经缩短到六个月甚至更短。不过,智谱 2025 年上半年的算力支出超过了营收的七倍...

推荐理由:智谱 GLM-5.2 在 Anthropic 限制访问后迅速补位,成本打一折、完全开源、差距缩到六个月,三个信号叠加值得推荐。没给更高分是因为正文没披露模型在复杂任务上的实测对比,光靠排行榜和成本数字还缺一块验证。

AI HOT 精选

博主小互开源了个人IP配图工具,自带31个原创角色和一套自动配图流程

小互把给自己文章自动配图的技能打包开源了,叫“小互IP Studio”。工具里带了31个原创角色——15个是手绘线稿风格的人物,另外16个是谐音梗做成的meme形象。工作流程是:Agent先读文章,自己判断该配情绪图、示意图还是四格漫画,然后生成图片,再自己检查,不满意会返工重来。默认画风是手绘线稿加淡彩,另外给了5种皮肤可以换,比如3D盲盒风、黑白线...

推荐理由:一个实用工具的开源发布,工作流设计有细节,31个原创角色直接可用,对AI内容创作者价值明确。但这是个人项目开源,不是行业级事件,所以放在featured档。

6月25日星期四

AI HOT 精选

美团 LongCat 开源 VitaBench 2.0:一个测 AI 能不能长期记住你、主动问你的基准

这个基准模拟了 56 个虚拟用户,每人平均有 1580 天的交互记录、2093 个事件,任务有 819 个,偏好会动态变化超过 2000 次,还给模型配了 66 个可调用的工具。目前最强的 Claude-Opus-4.6 在开卷考试下平均分刚过 0.5,说明整体还不太行。开了思考模式对个性化任务不一定加分,一到需要主动提问的场景,所有模型分数都断崖式下...

推荐理由:美团 LongCat 开源的这个基准规模够大、设计也贴近真实场景,不是又一个刷分的玩具榜。56 个虚拟用户每人上千天的交互数据,任务和偏好变化都给了具体数字,Claude Opus 4.6 刚过 0.5 的成绩说明挑战确实硬核。我会先打个折,因为目前只看到一篇微信文章,没有其他来源交叉验证,基准本身的长期稳定性和社区接受度还要再观察。分数没给更高也是这个原因——信息源单一,但内容本身对从业者有直接参考价值。

6月24日星期三

Hacker News 首页

Greptile 统计发现,AI 生成的垃圾 PR 已经像 2000 年初的垃圾邮件一样泛滥

Greptile 分析了 OpenClaw 仓库的 PR 数据。去年 12 月每周只有 2 个 PR,到今年 2 月飙升至每周 3400 个,合并率从 48% 跌到不足 9.3%。有贡献者一天提交了 106 个 PR,提交间隔中位数只有 3 秒,明显是 AI 编程工具自动生成的。文章提了三点观察:第一,PR 审核需要像邮件反垃圾一样引入发送者信誉机制,...

推荐理由:Greptile 用 OpenClaw 仓库的真实数据把 AI 刷 PR 的问题摆到了台面上,数字冲击力很强。我会先打个折:这只是单个仓库的案例,而且 Greptile 自己卖代码审查产品,有利益相关,但数据和方法交代得还算清楚,所以整体可信。文章提的'发送者信誉机制'思路,对正在被 AI 贡献淹掉的维护者来说是个可讨论的方向。

6月23日星期二

Hacker News 首页

Krea 发布 Krea 2 技术报告:开源生图模型,不追求单一美颜,而是让你能探索各种视觉风格

Krea 2 是一系列开源文生图模型,采用宽松许可证。它没有把力气花在优化一种精致默认画风上,而是想覆盖更广的视觉风格,让用户通过文字或参考图去探索。预训练数据刻意排除了 AI 生成的图片,也不用美学评分模型去过滤,只去掉了重复样本、VLM 描述不清的图、有害偏见内容、过于复杂的图。架构是扩散 Transformer,用了 iREPA、改进版 VAE、...

推荐理由:Krea 2 开源了模型和一份技术报告,亮点是数据策略:不用 AI 生成的图、不用美学评分过滤,想靠这个覆盖更宽的视觉风格。对做模型训练的人有干货,但报告没放对比评测或用户实测,在文生图这个拥挤赛道里,实际效果还得等社区跑一跑再看,所以给到 78 分、放在 featured 里。

AI HOT 精选

IBM 开源 CUGA 智能体框架,一个文件就能跑一个应用,附带二十多个现成例子

CUGA 把规划、执行、反思和工具调用打包成一个可配置的智能体,你只需要给一份工具清单和一段提示词。它在 AppWorld(2025 年 7 月到 2026 年 2 月)和 WebArena(2025 年 2 月到 9 月)两个基准上都拿了第一。框架提供快、均衡、准三种推理模式,代码可以在本地、Docker 或 E2B 沙箱里跑。工具层兼容 OpenA...

推荐理由:IBM 开源 CUGA 这件事干货是有的:两个基准的第一名,加上二十多个能跑的例子,对想动手试的人门槛低。框架设计上把智能体的几个关键环节都模块化了,还给了三种推理模式,工程落地想得挺全。但问题在于,智能体框架现在遍地都是,公告里没说出一个让人非试不可的独特设计,比如架构上有什么别人没有的巧思,或者成本上能省一大截。光靠基准分数在开源圈子里很难炸出水花。所以知识密度够,但传播力弱,按规则落在低共振这一档。

TechCrunch · AI

SpaceX 拿下第三笔算力大单,开源 AI 实验室 Reflection AI 每月付 1.5 亿美元租用 GB300 芯片

SpaceX 在孟菲斯附近的 Colossus 2 数据中心又签了一家大客户。开源 AI 实验室 Reflection AI 从 2026 年 7 月 1 日起,每月支付 1.5 亿美元,合同签到 2029 年,换来英伟达最新 GB300 芯片的即时使用权。这是该数据中心继 Anthropic(月付 12.5 亿美元)和 Google(月付 9.2 亿...

推荐理由:SpaceX 签下开源实验室 Reflection AI,月付 1.5 亿美元用到 2029 年。这事新鲜、有硬数字、话题性也够,但 Reflection AI 知名度低,正文也没交代资金来源,所以先给 78 分放在 featured 档。

6月22日星期一

Hacker News 首页

Git 不会消失,但 Zach Geier 还是给 AI 编程助手做了个新版本管理工具 Oak

Zach Geier 花了四年业余时间做了个版本管理工具 Jam,卖掉后公司一年就关门了。现在他用 AI 辅助开发,四个月干完了过去四年的活,做出了 Oak——一个专为 AI 编程助手设计的版本管理系统。它的核心卖点是虚拟挂载:助手不用把整个仓库下载到本地就能干活,多个任务并行也不用折腾 Git 的 worktree。团队自己已经用 Oak 开发了几个...

推荐理由:作者故事有戏剧性,技术方案也切中了 AI 编程助手的真实痛点。但这是一篇宣布博客,没有公开产品、没有用户反馈、没有性能对比,目前只能当“想法验证”看。72 分合理,先别太激动,等有实际可用的东西再说。

AI HOT 精选

OpenAI 发布 Daybreak 安全工具:Codex Security 和 GPT-5.5-Cyber 把重心从找漏洞转向自动修漏洞

OpenAI 这次没再卷找漏洞,而是推了一套叫 Daybreak 的工具,核心是帮人自动修漏洞。Codex Security 插件已经扫了 3000 多万次代码提交,标记出超过 50 万个已修复的发现,说明修漏洞这事现在得靠机器批量干。同时放出了完整版 GPT-5.5-Cyber,在 CyberGym 基准上拿了 85.6%,比 GPT-5.5 的 8...

推荐理由:OpenAI 发布 Daybreak,从找漏洞转向自动修漏洞。Codex Security 用 3000 万次扫描和 50 万个标记发现撑场面,GPT-5.5-Cyber 在 CyberGym 上跑出 85.6%。分数没给到 90 是因为正文没披露修复准确率和误报率——修错了比没修更麻烦,这点先别太激动。

6月21日星期日

Product Hunt · AI

Conduit:一个本地网关,把 AI 智能体的工具清单开销砍掉约 90%

给 AI 智能体接上多个 MCP 服务器后,每次请求都要把所有工具的定义塞进上下文,3 个服务器就能吃掉约 2.4 万个 token,模型还没干活就先付了一大笔算力费。Conduit 在智能体和 MCP 服务器之间加了一层本地网关,只暴露 3 个“元工具”让智能体按需搜索,不再一股脑加载全部工具。实测下来,单次请求的工具开销减少 97%,总 token...

推荐理由:Conduit 解决的是 MCP 工具列表膨胀吃 token 的实际问题,有实测的 97% 开销削减,对开发者钱包友好。分数没打更高是因为这是 Product Hunt 发布而非正式产品,且正文没披露网关自身的计算开销。

6月20日星期六

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。