跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 101–120 条 · 共 329 条

7月22日星期三

Hacker News 首页

Codeberg 修改服务条款,禁止上传 vibe coding 项目

Codeberg 会员投票通过了一项服务条款修订,禁止在平台上分享“主要由大模型生成且未经人工审核”的代码项目。提案给出的理由是这类项目版权归属模糊、缺乏基本的安全保障。我会先打个折:条款里没定义什么叫“主要由大模型生成”,也没说清楚“分享”是仅指公开仓库还是也包括私有仓库和 Pull Request,执行时间表同样没提。有成员在讨论中指出了这些模糊点...

推荐理由:Codeberg 会员投票修改服务条款,禁止分享未经人工审核的大模型生成代码。这事有实质性的治理动作,冲突感和新鲜度都够,但正文没给出“主要由大模型生成”的具体判定标准,也没说清私有仓库和 PR 是否在限制范围内,执行细节全是空白,所以分数没拉满。

7月21日星期二

Ben's Bites

Kimi K3 前端编程跑分超 Fable,但 token 浪费让价格优势归零

月之暗面发了新模型 Kimi K3,在 Arena 前端编程榜上压过 Fable 和 GPT-5.6-Sol,其他跑分也咬得很紧。模型很大,有 2.8 万亿参数,支持图片输入,上下文窗口 100 万 token,权重会在 7 月 27 号开源。但它的 token 效率很差——每个 token 的价格只有 Sol 的一半,实际干活却要多用一倍的 toke...

推荐理由:月之暗面扔出 Kimi K3,在 Arena 前端编程榜上把 Fable 和 GPT-5.6-Sol 都挤下去了,其他跑分也咬得很紧。模型体量很大,2.8 万亿参数,支持图片输入,上下文窗口拉到 100 万 token,还定了 7 月 27 号开源权重,这几个信号都挺硬。但有个明显的坑:token 效率差。单价标得便宜,只有 Sol 的一半,实际干活却要多烧一倍的 token,算总账并不省钱。这个反差让整件事更有讨论价值,不是纯吹捧。分数没给到 85 以上,是因为正文只提了 Arena 前端编程榜这一个具体成绩,其他跑分只说“咬得很紧”,没给具体数...

7月20日星期一

Hacker News 首页

Kimi K3 和 Qwen 3.8 开源夹击,Anthropic 的昂贵生意快撑不住了

这周 Moonshot 的 Kimi K3 和阿里的 Qwen 3.8 都发了,性能号称接近 Anthropic 的 Fable 5,而且模型权重马上要公开。文章算了笔账:Anthropic 自己不建数据中心也不发电,用的是租来的算力和电,所以推理成本会跟着用量涨。Fable 5 每完成一个任务,成本差不多是对手的 3 倍。开源模型追上来之后,这种高价...

推荐理由:K3 和 Qwen 3.8 发模型本身不算最大新闻,真正值钱的是那笔成本账:Fable 5 跑一次任务比对手贵三倍,而且 Anthropic 没自建机房,用的全是租来的算力和电,用量越大成本越高。文章把这个结构劣势讲得很清楚,等于给开源追上来提供了一个实打实的经济理由,不是空谈性能。我会先打个折,因为成本对比的细节正文没完全展开,但逻辑链条够硬,值得放进 featured。

AI HOT 精选

小红书和北大开源 UltraEP,给 MoE 模型做实时负载均衡

MoE 模型里专家负载不均会让 GPU 空等,UltraEP 的做法是在每个 microbatch 和每一层动态复制热门专家,用精确路由信息实时调度。在 Qwen3-235B 上训练吞吐达到理想性能的 94.6%,比 Megatron-LM 高 42%;推理 prefill 吞吐是 SGLang 的 1.56 倍。正文没披露开源协议和部署条件。

推荐理由:小红书和北大联合开源的这个方案,解决的是 MoE 训推里 GPU 空等的实际问题,给出的性能数字很强:训练吞吐达到理想的 94.6%,推理比 SGLang 快 56%。技术路线也讲得明白,是逐层、逐 microbatch 的实时动态复制,不是事后补救。我会先打个折,因为正文没提开源协议和部署条件,这两个缺口会卡住很多想落地的人。整体上对做大规模训推基础设施的团队很有用,但对普通 AI 从业者来说场景偏窄。

Hacker News 首页

小米开源机器人基础模型 XR-1:用 10 万小时无实机视频预训练,新任务学不到 10 小时成功率 75%

小米机器人团队放出了一个开箱即用的机器人基础模型 XR-1,代码、权重和论文都公开了。它的思路分两步:先用 10 万小时不带真实机器人的操作视频做预训练,覆盖 1700 多个场景,让模型学会“看到画面变化该输出什么动作”;再用 7200 小时真机数据做后训练,把动作能力对齐到具体机器人上,并让模型能听懂自然语言指令。预训练阶段出现了干净的缩放规律——数...

推荐理由:小米机器人开源了 XR-1,一个带代码和权重的机器人基础模型。两阶段训练路线(10 万小时无真机预训练 + 7200 小时真机后训练)和预训练缩放规律是硬信号,直接对标 π 0.5。我会先打个折:正文没披露真机后训练的具体任务成功率和泛化测试细节,这点先别太激动。但开源全套这个动作本身,对行业来说比发一篇论文管用。

7月19日星期日

Computing Life · Share · 鸭哥调研

Grok Build 开源了客户端执行层,模型和云端没开

xAI 把 Grok Build 在本地管理文件、命令和权限的客户端 harness 用 Apache-2.0 协议公开了,代码可以看、可以自己编译。但 Grok 模型、云端服务以及官方安装包的构建链还是闭源的。仓库不接受外部 PR,官方二进制用的内部 commit 也不在公开历史里,所以下载到的程序不一定对应公开的源码。7 月初的上传争议发生在旧版,...

推荐理由:xAI 把 Grok Build 的客户端 harness 用 Apache-2.0 放出来,支持无头模式和 ACP,不算纯作秀。但模型和构建链还是闭源,仓库也不接外部 PR,所以上限到不了 85。三个 HKR 维度都踩中了,放 featured 合适。

TechCrunch · AI

月之暗面开源 Kimi K3,性能逼近 GPT-5.6 和 Claude Fable 5,但关键细节没公布

月之暗面这周把 Kimi K3 开源了。公司自己承认模型还打不过最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但 Arena.ai 和 Vals AI 的第三方评测显示,K3 已经能跟这些旗舰模型掰手腕了。发布正好赶上习近平在上海世界人工智能大会讲话,纳斯达克周五跌了约 1%,芯片股像英伟达被抛售。这波讨论很像 2025 年...

推荐理由:月之暗面把 Kimi K3 开源,第三方评测显示它能跟 GPT-5.6 Sol 和 Claude Fable 5 掰手腕,这是中国模型生态一个挺硬的信号。不过这篇是 TechCrunch 的评论稿,不是官方发布原文,所以重要性我打了 78 分,没再往上拉。

7月17日星期五

Hacker News 首页

月之暗面发布 2.8 万亿参数 Kimi K3,自称首个开源 3T 级模型,API 定价看齐 Claude Sonnet

月之暗面推出了 Kimi K3,一个 2.8 万亿参数的模型,他们把它四舍五入叫成“首个开源 3T 级模型”。这个模型 API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。它自己公布的跑分大多超过了 Claude Opus 4.8 和...

推荐理由:月之暗面发了 Kimi K3,一个 2.8 万亿参数的模型,他们管它叫“首个开源 3T 级模型”,API 定价输入每百万 token 3 美元、输出 15 美元,跟 Claude Sonnet 一个价,是目前中国 AI 实验室里最贵的。自己公布的跑分大多超过 Claude Opus 4.8 和 GPT-5.5 high,但输给 Claude Fable 5 和 GPT-5.6 Sol。Simon Willison 的测试里 K3 在长周期知识任务上比前代 K2.6 涨了 732 Elo,输出 token 数少了 21%,成本降了 27%,说明模型在...

AI 群聊日报

Kimi K3 登顶前端编程榜,权重将开源,但实测发现它有时会烧光额度原地打转

Kimi K3 在 Frontend Code Arena 拿了 1679 分,压过 Claude Fable 5,七个前端领域赢了六个。模型有 2.8 万亿参数,支持 1M 上下文,定价是每百万 token 3 到 15 美元,完整权重会在 7 月 27 日前放出来。群友上手后评价两极:有人花 199 元月费让它重做了之前搞砸的粒子特效,效果惊艳;也...

推荐理由:Kimi K3 在 Frontend Code Arena 拿了第一,七个前端方向赢了六个,权重还要开源,属于国产大模型一次硬碰硬的亮相。群聊日报给了分数、参数量、价格和真实用户反馈,信息够用。没打更高是因为来源是社区整理,不是一手官方公告,我会先打个折。

7月16日星期四

Hacker News 首页

Sentinel:一个先读代码再动手的开源 QA 智能体

SimbaStack 在 MIT 协议下开源了 Sentinel,一个会先通读代码库、自己梳理业务流程,再做端到端测试的 QA 智能体。他们拿自家酒店管理系统做实验,只给了代码仓库和管理员账号,没给任何测试计划。Sentinel 读完代码后判断这是个精品酒店系统,自动梳理出九条关键业务流,包括完整的预订生命周期、团队预订和夜审。它把最重要的两条流程各跑...

推荐理由:一个开源 QA agent 的新玩家,拿真实的酒店管理系统做了端到端实验,不是玩具 demo。分数没上 80,因为目前只有一篇博客,还没有第三方复现或横向对比。

Hacker News 首页

批评大模型的人说得都对,但我还是在用

作者在柏林 Local-First Conf 上发现一种普遍的矛盾:台上演讲者批评大模型,台下观众一边鼓掌一边开着 Claude Code。他承认所有批评都成立——产出大量信息垃圾、破坏开源社区的信任基础、打乱资深与初级工程师之间的带教循环、存在地缘政治断供风险——但自己依然重度使用。文章没有试图化解这种矛盾,而是把这种集体性的别扭感摊开来讲,并邀请大...

推荐理由:这篇文章没打算讲道理,就是把开发者圈子里那种'边骂边用'的集体拧巴摊开给你看。柏林会议上 Armin Ronacher 的回复是个好钩子,但全文没有数据支撑,也没有解决方案,就是一次诚实的自我暴露。我会给 featured,因为共鸣够强、传播力够好,但别指望从这里学到什么新东西。

AI HOT 精选

xAI 把编程助手 Grok Build 的完整代码开源了

xAI 在 GitHub 上公开了 Grok Build 的全部源码,包括智能体的工作循环(怎么拼上下文、怎么解析模型回复、怎么调用工具)、终端界面、以及技能、插件、MCP 服务器等扩展系统。你可以直接读源码搞清楚它的内部机制,也可以自己编译后连上本地模型跑起来,完全离线使用。

推荐理由:xAI 开源了 Grok Build 的全部代码,包括智能体循环、终端界面和扩展系统,还支持本地离线运行,在开发者圈子里同时踩中了好奇心、干货和实用价值三个点。目前只有官方公告,还没有第三方评测或实际跑通后的反馈,所以分数先定在 featured 这一档,等有人上手验证了再调整。

7月15日星期三

Hacker News 首页

StyleSeed:给 AI 编程助手装一套设计规范引擎,别让它再生成千篇一律的界面

bitjaru 开源了一个叫 StyleSeed 的项目,专门给 Claude Code、Cursor 这类 AI 编程工具用。它不直接生成代码,而是教模型做设计判断。项目里打包了 74 条设计规则、48 个组件、7 套品牌皮肤(像 Stripe、Linear、Vercel 这些),还有一套命名过的动效系统和 15 个快捷指令。目前 MIT 协议开源,...

推荐理由:给 AI 编程工具加设计约束这事确实戳中刚需,74 条规则加品牌皮肤让项目不止于概念 demo。分数没给更高是因为刚在 Show HN 亮相,没有用户反馈和实际落地效果,目前只能按工具完整度打分。

Computing Life · Share · 鸭哥调研

Codex 仍然开源,但父 agent 给子 agent 派了什么任务,现在被加密了

OpenAI 在 6 月 5 日合并了一个 PR,把 Codex 里主 agent 派给子 agent 的任务指令从明文改成了密文。以前你在本地日志里能看到类似“Review the authentication changes”这样的具体任务,现在只剩一串 <ciphertext>。子 agent 调用了什么工具、跑了什么命令、改了哪些代码,这些执行...

推荐理由:这是一条有具体技术细节的产品变动报道,不是公关稿。PR 号、issue 链接、改动前后对比都给出来了。扣分是因为这属于功能调整而非新能力发布,影响范围也局限在 Codex 用户。我会先打个折:虽然对开发者体验的冲击不小,但本质上是一次安全加固,不是模型能力或架构的突破。

7月14日星期二

AI HOT 精选

腾讯混元把295B大模型压到单GPU能跑,发了1-bit和4-bit量化版

混元Hy3是个2950亿参数的MoE模型,现在出了1-bit和4-bit两个压缩版,用llama.cpp就能在单张显卡上跑,还支持MTP加速推理。官方说这个尺寸下它表现最好,能跟万亿参数的大模型掰手腕,适合让模型进业务流程干活。模型走Apache 2.0协议,可以商用,OpenRouter上还给了两周免费API。不过正文没披露量化后精度掉了多少,也没说...

推荐理由:腾讯混元把2950亿参数的Hy3模型压到单GPU能跑,对本地部署和做agent的人很实用。Apache 2.0协议加两周免费API,试错成本低。没给85分以上,是因为正文没披露量化后精度掉了多少,这点先别太激动。

TechCrunch · AI

做开源 Hermes agent 的 Nous Research 正以 15 亿美元估值融资,Robot Ventures 领投

Nous Research 正在敲定一轮新融资,估值 15 亿美元,至少融 7500 万美元。领投方是 Robot Ventures,USV 也跟了很大份额。三个消息源确认了这笔交易,但 Nous 拒绝评论,投资方也没回邮件。这家公司 2023 年成立,之前从 Paradigm、OSS Capital、Balaji Srinivasan 等人手里拿过 ...

推荐理由:Nous Research 的 Hermes agent 在开源圈确实有存在感,融资金额和投资方阵容都够硬。我会先打个折:目前只是'在谈',还没 close,Nous 和投资方都没开口,所有信息都来自消息源。正文没披露这笔钱具体要花在哪、Hermes 的商业化进展到什么程度,估值逻辑暂时只能靠猜。如果是真的,这个估值对开源 agent 赛道是个信号,但先别太激动。

7月13日星期一

AI HOT 精选

腾讯混元开源 HyOCR-1.5:1B 参数的端到端 OCR 模型,推理速度提升 6.37 倍

腾讯混元把 HyOCR-1.5 的训练代码、推理代码和模型权重全开源了,这在端到端 OCR 大模型里是头一个。模型只有 1B 参数,能处理文档解析、公式识别、表格还原等 8 种以上的文字任务。在 OmniDocBench v1.6 上拿了 94.74 分,排在端到端模型的第一名。推理速度这块,它用了一个叫 DFlash 的投机解码方法,在 Transf...

推荐理由:腾讯混元把一个端到端 OCR 模型从训练到推理全开源了,不是只放权重。1B 参数在 OmniDocBench v1.6 上拿了 94.74 分,端到端模型里排第一,还靠 DFlash 把推理速度提了 6.37 倍。这对做文档解析或 RAG 的人来说,是个能直接上手试、省训练成本的开源选项。我会先打个折:正文没提模型在复杂版面、手写体或噪声场景下的具体表现,也没说 6.37 倍提速是在什么硬件和 batch size 下测的,这点先别太激动。但整体看,这是国内大厂一次实打实的全栈开源,不是公关稿。

7月11日星期六

Hacker News 首页

Cloudflare 默认拦截 AI 爬虫,你的智能体读到的可能是假页面

从 2025 年 7 月 1 日起,Cloudflare 对新域名默认开启 AI 爬虫拦截。更麻烦的是,被拦下来的请求会返回一个 403 状态码,但带着完整的网页内容——就是那个“稍等片刻”的验证页面。语言模型会把这当成真实内容,自信地总结出根本不存在的答案。作者用普通请求测了 8 个主流反爬网站,结果 0 次拿到真实内容,8 次都拿到了可被总结的拦截...

推荐理由:我会先打个折:文章没给出绕过工具在 Cloudflare 最新规则下的持续成功率数据,长期有效性存疑。但它的核心价值不在工具本身,而在于揭示了一个被忽视的数据污染路径——403 拦截页被当成正文喂给模型。这个发现对任何依赖网页抓取做知识库或 agent 的团队都是实打实的风险提示,加上有具体测试数字和开源代码,值得推荐。

7月9日星期四

AI HOT 精选

蚂蚁灵波开源 LingBot-Video:一个专为机器人设计的视频生成模型,用 MoE 架构把推理成本打下来

蚂蚁灵波发布了 LingBot-Video,一个专门给具身智能用的视频生成模型,代码已开源。它用 MoE 架构(混合专家)替代了传统的密集模型,总参数量 30B,但生成视频时只激活约 3B 参数,推理速度比同规模的密集模型快 3 倍左右。训练数据是 7 万小时的机器人相关视频,包括灵巧操作、导航和第一人称视角交互,不是网上随便扒的风景片。为了让生成的动...

推荐理由:蚂蚁灵波开源了 LingBot-Video,一个用 MoE 架构做的具身智能视频基模。我会先打个折:这是刚发布的新东西,还没有外部复现报告,效果别急着全信。但亮点挺实在——30B 参数只激活 3B,推理快 3 倍,意味着本地跑或上机器人端成本低不少。训练数据是 7 万小时机器人相关视频,不是网上扒的通用素材,这点比很多视频模型更对口。代码已开源,做这行的人可以直接拉下来试。

7月8日星期三

TechCrunch · AI

法国 AI 创业公司 ZML 发布免费推理加速工具,支持多种芯片

ZML 推出了开源软件 ZML/LLMD,能让 Llama、DeepSeek 这类模型在 Nvidia、AMD、Google TPU、Apple Metal 和 Intel Arc 等不同芯片上跑得更快。创始人 Steeve Morin 说目标就是降低推理成本,目前免费。图灵奖得主 Yann LeCun 之前公开推荐过这家公司。不过正文没披露融资细节,...

推荐理由:跨芯片推理加速确实是刚需,ZML/LLMD 免费开源,又有 LeCun 背书,吸引力不低。但正文没给性能对比数据,也没披露融资情况,所以分数只能打到 72,不能更高。