跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 121–140 条 · 共 329 条

7月8日星期三

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

7月5日星期日

AI HOT 精选

美团 LongCat-2.0 完全开源,1.6T 参数的 MoE 模型,权重和推理代码都放出来了

美团把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。它用了三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 ...

推荐理由:美团把 LongCat-2.0 完整开源,MIT 协议放权重和代码,在国内大厂里算动作很大。1.6T 总参数、每次只激活 48B、100 万 token 上下文,这几个数字说明它在长文本和推理成本上都做了针对性设计,不是纯刷参数量。对从业者来说,能直接拿到权重和推理代码,比只发论文或给 API 实用得多。重要性给 82 分合理,featured 也站得住,因为这件事既有技术细节可聊,又有开源生态层面的信号意义。

7月2日星期四

Hacker News 首页

git-annex 维护者花 100 小时把依赖里的 AI 生成代码全清了出去

Joey Hess 花了一个月、大约 100 小时,把 git-annex 整个依赖树里所有 AI 生成的代码都排查并剔除掉了。他发现了一些很离谱的东西:一个 1489 行、语无伦次的提交说明,对应着 10000 行代码改动;还有一个 AI 提示词直接让模型从别的项目抄代码,没惹上版权官司纯属运气好。他说这 100 小时唯一的正面收益,是以后选依赖时手...

推荐理由:Joey Hess 亲自下场干了件脏活累活,不是嘴上说说,是真花了 100 小时把 git-annex 依赖树里的 AI 代码全清了一遍。他挖出来的例子很具体:一个提交说明写得像醉酒机器人,却改了上万行代码;另一个提示词直接教模型去抄别人项目。这些不是假设风险,是已经埋进依赖里的雷。SFC 已经不管了,说明这事目前没人兜底。给 featured 和 78 分,是因为它是一线维护者的实战报告,不是行业公告,但足够让所有靠开源吃饭的人心里一紧。

AI HOT 精选

腾讯混元发布 Hy3 模型,参数量只有旗舰模型的 1/5 到 1/2,但效果能打平甚至超过

腾讯正式开源了 Hy3 模型,采用 Apache 2.0 协议。这个模型最狠的地方在于,它的参数量只有其他家旗舰模型的 1/5 到 1/2,但在推理、智能体(让模型进业务流程干活)和长文本任务上的跑分却能打平甚至超过。在内部 270 人的盲测里,Hy3 均分 2.67 分,赢了 GLM5.1 的 2.51 分。产品体验上修了几个硬伤:幻觉率从 12.5...

推荐理由:腾讯混元发Hy3,用更小参数量打平甚至超过更大模型,还直接Apache 2.0开源。我会先打个折,因为内部盲测和跑分不能完全代表真实场景,但参数量小、幻觉率降低、协议友好这三点组合在一起,对想省钱又想用强模型的团队来说,值得立刻关注。

Computing Life · Share · 鸭哥调研

Fable 5 被禁 18 天,Anthropic 丢掉的份额被 GLM 吃掉了

Anthropic 发布最强编码模型 Fable 5 三天后,被美国出口管制强制下线 18 天。OpenRouter 的逐日 token 数据显示,这期间平台总流量从 24T 涨到 32T,但 Anthropic 的份额从 20.7% 跌到 17.6%,绝对流量也缩水了。最大的赢家是 GLM,份额从 1.8% 飙到 7.4%。一个诡异细节是,GLM-5...

推荐理由:这篇文章用 OpenRouter 的逐日 token 数据,给 Fable 5 被禁 18 天这件事做了个定量归因。Anthropic 丢了 3.1 个百分点的份额,GLM 吃进 6.7 个百分点,还附带一个反常识的细节:GLM-5.2 发布后,老版本 GLM-5.1 的流量反而暴涨了四五倍。结论有数据支撑,而且指向一个很多人没料到的赢家,对从业者判断模型替代关系和供应链稳定性有直接帮助。

7月1日星期三

Hacker News 首页

开源游戏引擎 Godot 宣布不再接受 AI 写的代码贡献

Godot 维护者正式表态,不再合并由 AI 生成的代码补丁。核心原因是他们发现重度使用 AI 的贡献者往往看不懂自己提交的代码,出了问题没法修。项目方担心这些补丁表面正确,但藏着不易察觉的 bug,长期会拖垮维护工作。至于具体从哪天开始执行、用什么工具检测 AI 代码,正文没披露。

推荐理由:Godot 是开源游戏引擎里的头部项目,它公开拒绝 AI 代码补丁,等于给“AI 辅助编程靠不靠谱”这个争论扔了个重磅炸弹。维护者给出的理由很实在——不是代码写得不好,而是写的人自己看不懂,没法修 bug,这会慢慢拖死项目。这个判断对同行有很强的警示作用,而且话题本身在开发者群体里热度很高,容易传播。

AI HOT 精选

美团开源 LongCat-2.0:1.6 万亿参数,用五万张国产卡训练,月调用量已冲到 OpenRouter 全球前三

LongCat-2.0 是个总参数 1.6 万亿、每次推理只激活约 480 亿参数的大模型,原生支持 100 万 token 上下文。它全程在五万张国产 GPU 集群上训练和跑推理,架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分...

推荐理由:美团不是一线模型厂,突然掏出万亿参数模型,而且全程国产 GPU,这个反差是最大的新闻点。代码评测分数不低,但正文没披露更多推理成本和实际部署细节,所以我会先打个折。分数没给更高,是因为美团在模型圈还没建立起持续交付的信用,真实可用性要看开源后的社区反馈。

6月30日星期二

Hacker News 首页

美团开源 LongCat-2.0:1.6 万亿参数 MoE 模型,48B 激活,全程用自研 AI ASIC 训练

美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...

推荐理由:美团开源了一个总参数 1.6 万亿、每次激活约 480 亿参数的 MoE 模型,全程用自研 AI ASIC 训练,5 万多张卡零回滚跑完,预训练数据量超过 35 万亿 token。模型专门为长上下文和智能体场景做了优化,引入了 LongCat 稀疏注意力来加速百万 token 级处理。我会先打个折:目前只有官方博客,没有第三方评测或真实业务反馈,所以分数停在 82 而不是更高。如果是真的,这套非 GPU 训练方案挺省钱,但稳定性和性能还需要更多证据。

6月26日星期五

纽约时报中文网

智谱 GLM-5.2 冲进全球前十,中国模型与 OpenAI、Anthropic 的差距只剩不到半年

智谱的新模型 GLM-5.2 在 Anthropic 限制 Fable 和 Mythos 访问后迅速走红,登上了 OpenRouter 排行榜前十。它处理某些任务的成本只有 Claude Opus 4.8 的八分之一,而且完全开源。有专家估计,中国 AI 落后美国的时间差已经缩短到六个月甚至更短。不过,智谱 2025 年上半年的算力支出超过了营收的七倍...

推荐理由:智谱 GLM-5.2 在 Anthropic 限制访问后迅速补位,成本打一折、完全开源、差距缩到六个月,三个信号叠加值得推荐。没给更高分是因为正文没披露模型在复杂任务上的实测对比,光靠排行榜和成本数字还缺一块验证。

AI HOT 精选

博主小互开源了个人IP配图工具,自带31个原创角色和一套自动配图流程

小互把给自己文章自动配图的技能打包开源了,叫“小互IP Studio”。工具里带了31个原创角色——15个是手绘线稿风格的人物,另外16个是谐音梗做成的meme形象。工作流程是:Agent先读文章,自己判断该配情绪图、示意图还是四格漫画,然后生成图片,再自己检查,不满意会返工重来。默认画风是手绘线稿加淡彩,另外给了5种皮肤可以换,比如3D盲盒风、黑白线...

推荐理由:一个实用工具的开源发布,工作流设计有细节,31个原创角色直接可用,对AI内容创作者价值明确。但这是个人项目开源,不是行业级事件,所以放在featured档。

6月25日星期四

AI HOT 精选

美团 LongCat 开源 VitaBench 2.0:一个测 AI 能不能长期记住你、主动问你的基准

这个基准模拟了 56 个虚拟用户,每人平均有 1580 天的交互记录、2093 个事件,任务有 819 个,偏好会动态变化超过 2000 次,还给模型配了 66 个可调用的工具。目前最强的 Claude-Opus-4.6 在开卷考试下平均分刚过 0.5,说明整体还不太行。开了思考模式对个性化任务不一定加分,一到需要主动提问的场景,所有模型分数都断崖式下...

推荐理由:美团 LongCat 开源的这个基准规模够大、设计也贴近真实场景,不是又一个刷分的玩具榜。56 个虚拟用户每人上千天的交互数据,任务和偏好变化都给了具体数字,Claude Opus 4.6 刚过 0.5 的成绩说明挑战确实硬核。我会先打个折,因为目前只看到一篇微信文章,没有其他来源交叉验证,基准本身的长期稳定性和社区接受度还要再观察。分数没给更高也是这个原因——信息源单一,但内容本身对从业者有直接参考价值。

6月24日星期三

Hacker News 首页

Greptile 统计发现,AI 生成的垃圾 PR 已经像 2000 年初的垃圾邮件一样泛滥

Greptile 分析了 OpenClaw 仓库的 PR 数据。去年 12 月每周只有 2 个 PR,到今年 2 月飙升至每周 3400 个,合并率从 48% 跌到不足 9.3%。有贡献者一天提交了 106 个 PR,提交间隔中位数只有 3 秒,明显是 AI 编程工具自动生成的。文章提了三点观察:第一,PR 审核需要像邮件反垃圾一样引入发送者信誉机制,...

推荐理由:Greptile 用 OpenClaw 仓库的真实数据把 AI 刷 PR 的问题摆到了台面上,数字冲击力很强。我会先打个折:这只是单个仓库的案例,而且 Greptile 自己卖代码审查产品,有利益相关,但数据和方法交代得还算清楚,所以整体可信。文章提的'发送者信誉机制'思路,对正在被 AI 贡献淹掉的维护者来说是个可讨论的方向。

6月23日星期二

Hacker News 首页

Krea 发布 Krea 2 技术报告:开源生图模型,不追求单一美颜,而是让你能探索各种视觉风格

Krea 2 是一系列开源文生图模型,采用宽松许可证。它没有把力气花在优化一种精致默认画风上,而是想覆盖更广的视觉风格,让用户通过文字或参考图去探索。预训练数据刻意排除了 AI 生成的图片,也不用美学评分模型去过滤,只去掉了重复样本、VLM 描述不清的图、有害偏见内容、过于复杂的图。架构是扩散 Transformer,用了 iREPA、改进版 VAE、...

推荐理由:Krea 2 开源了模型和一份技术报告,亮点是数据策略:不用 AI 生成的图、不用美学评分过滤,想靠这个覆盖更宽的视觉风格。对做模型训练的人有干货,但报告没放对比评测或用户实测,在文生图这个拥挤赛道里,实际效果还得等社区跑一跑再看,所以给到 78 分、放在 featured 里。

AI HOT 精选

IBM 开源 CUGA 智能体框架,一个文件就能跑一个应用,附带二十多个现成例子

CUGA 把规划、执行、反思和工具调用打包成一个可配置的智能体,你只需要给一份工具清单和一段提示词。它在 AppWorld(2025 年 7 月到 2026 年 2 月)和 WebArena(2025 年 2 月到 9 月)两个基准上都拿了第一。框架提供快、均衡、准三种推理模式,代码可以在本地、Docker 或 E2B 沙箱里跑。工具层兼容 OpenA...

推荐理由:IBM 开源 CUGA 这件事干货是有的:两个基准的第一名,加上二十多个能跑的例子,对想动手试的人门槛低。框架设计上把智能体的几个关键环节都模块化了,还给了三种推理模式,工程落地想得挺全。但问题在于,智能体框架现在遍地都是,公告里没说出一个让人非试不可的独特设计,比如架构上有什么别人没有的巧思,或者成本上能省一大截。光靠基准分数在开源圈子里很难炸出水花。所以知识密度够,但传播力弱,按规则落在低共振这一档。

TechCrunch · AI

SpaceX 拿下第三笔算力大单,开源 AI 实验室 Reflection AI 每月付 1.5 亿美元租用 GB300 芯片

SpaceX 在孟菲斯附近的 Colossus 2 数据中心又签了一家大客户。开源 AI 实验室 Reflection AI 从 2026 年 7 月 1 日起,每月支付 1.5 亿美元,合同签到 2029 年,换来英伟达最新 GB300 芯片的即时使用权。这是该数据中心继 Anthropic(月付 12.5 亿美元)和 Google(月付 9.2 亿...

推荐理由:SpaceX 签下开源实验室 Reflection AI,月付 1.5 亿美元用到 2029 年。这事新鲜、有硬数字、话题性也够,但 Reflection AI 知名度低,正文也没交代资金来源,所以先给 78 分放在 featured 档。

6月22日星期一

Hacker News 首页

Git 不会消失,但 Zach Geier 还是给 AI 编程助手做了个新版本管理工具 Oak

Zach Geier 花了四年业余时间做了个版本管理工具 Jam,卖掉后公司一年就关门了。现在他用 AI 辅助开发,四个月干完了过去四年的活,做出了 Oak——一个专为 AI 编程助手设计的版本管理系统。它的核心卖点是虚拟挂载:助手不用把整个仓库下载到本地就能干活,多个任务并行也不用折腾 Git 的 worktree。团队自己已经用 Oak 开发了几个...

推荐理由:作者故事有戏剧性,技术方案也切中了 AI 编程助手的真实痛点。但这是一篇宣布博客,没有公开产品、没有用户反馈、没有性能对比,目前只能当“想法验证”看。72 分合理,先别太激动,等有实际可用的东西再说。

AI HOT 精选

OpenAI 发布 Daybreak 安全工具:Codex Security 和 GPT-5.5-Cyber 把重心从找漏洞转向自动修漏洞

OpenAI 这次没再卷找漏洞,而是推了一套叫 Daybreak 的工具,核心是帮人自动修漏洞。Codex Security 插件已经扫了 3000 多万次代码提交,标记出超过 50 万个已修复的发现,说明修漏洞这事现在得靠机器批量干。同时放出了完整版 GPT-5.5-Cyber,在 CyberGym 基准上拿了 85.6%,比 GPT-5.5 的 8...

推荐理由:OpenAI 发布 Daybreak,从找漏洞转向自动修漏洞。Codex Security 用 3000 万次扫描和 50 万个标记发现撑场面,GPT-5.5-Cyber 在 CyberGym 上跑出 85.6%。分数没给到 90 是因为正文没披露修复准确率和误报率——修错了比没修更麻烦,这点先别太激动。

6月21日星期日

Product Hunt · AI

Conduit:一个本地网关,把 AI 智能体的工具清单开销砍掉约 90%

给 AI 智能体接上多个 MCP 服务器后,每次请求都要把所有工具的定义塞进上下文,3 个服务器就能吃掉约 2.4 万个 token,模型还没干活就先付了一大笔算力费。Conduit 在智能体和 MCP 服务器之间加了一层本地网关,只暴露 3 个“元工具”让智能体按需搜索,不再一股脑加载全部工具。实测下来,单次请求的工具开销减少 97%,总 token...

推荐理由:Conduit 解决的是 MCP 工具列表膨胀吃 token 的实际问题,有实测的 97% 开销削减,对开发者钱包友好。分数没打更高是因为这是 Product Hunt 发布而非正式产品,且正文没披露网关自身的计算开销。

6月20日星期六

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

AI HOT 精选

禁止开源AI会是个错误

Nathan Lambert 和 Kevin Xu 合写了一篇面向大众的评论,指出华盛顿近期的 AI 监管动作——包括行政令、国会提案以及禁止外国人访问 Anthropic 最强模型——可能误伤开源。文章把 Anthropic 和 OpenAI 称为正在形成的双头垄断,并提到 Anthropic 被发现在模型被用来改进竞争对手时会主动降低其能力。开源支...

推荐理由:这篇评论不是技术论文,而是两位作者对华盛顿监管动作的直接回应,把 Anthropic 和 OpenAI 称为正在形成的双头垄断,还点出 Anthropic 会主动降能力防竞争对手——这个细节挺狠的。文章面向大众,但信息量对从业者也够用,冲突感和时效性都强,所以给了 featured。