跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 181–200 条 · 共 329 条

6月2日星期二

AI HOT 精选

为了省120刀,我把电脑清理做成了开源AI工具

作者用Codex扫了自己的MacBook,发现B站缓存等一堆可删文件,激进方案能清出超140G。他干脆把清理逻辑做成一个开源skill,Mac和Windows都能用。工具会扫描文件生成可交互的HTML报告,用绿黄红三色标出哪些能放心删、哪些要人工判断、哪些千万别动,还带安全执行按钮。实测清出近120G,而CleanMyMac只扫出15.8G,信息透明度...

推荐理由:这篇东西不是平台级大新闻,但 H、K、R 三点都踩中了:120 美元的替代钩子够抓人,扫描报告和 120G 实测结果给了具体信息,开源 skill 的思路对想用 AI 省钱的开发者有直接复用价值。放在 featured 门槛附近没问题,属于那种实用开源工具类的推荐。

新智元 · 公众号

中科院开源 MobileGym:在浏览器里搭了个手机训练场,微信、原神都能跑

中科院自动化所开源了一个叫 MobileGym 的移动端智能体训练环境,直接在浏览器里模拟安卓手机。它覆盖了 28 款常用 App,包括微信、原神、淘宝这些,每个实例只占 400MB 左右,冷启动 3 秒就能跑起来。环境会把手机界面状态转成结构化的 JSON 快照,方便模型理解当前屏幕有什么、能点哪里,任务验证也是程序化自动完成的,不用人工盯着看。这套...

推荐理由:MobileGym 是一套开源的移动 agent 训练与评测基础设施,不是模型发布,但实用性强。我会先打个折:正文没披露判分准确率、任务完成率等验证数据,这点先别太激动。不过它用浏览器仿真 28 个 App,单实例约 400MB、3 秒冷启动,还支持 JSON 状态复制,意味着复现成本低、部署快,适合批量跑实验。对 agent 开发者来说,这比租真机或搭模拟器集群省钱省事。整体在 78–84 这个质量区间里算扎实的工程贡献,所以维持 featured 和现有评分。

6月1日星期一

AI HOT 精选

MiniMax 开源 M3 模型,把写代码、读长文和看图听声塞进一个系统,跑分压过 GPT-5.5 但成本只要十二分之一

MiniMax 放出了一个叫 M3 的开源模型,把代码能力、一次能读 100 万 token 的长上下文和原生多模态(能直接处理图像、音频)做在了一起。在 SWE-Bench Pro 这个代码基准上拿了 59.0%,比 GPT-5.5 的 58.6% 和 Gemini 3.1 Pro 的 54.2% 都高一点;在 BrowseComp 自主浏览任务上 ...

推荐理由:我会先打个折:目前只有一条 X 帖子,没看到官方技术报告或第三方独立评测,所以分数压在 78–84 区间。但 M3 确实把编码、超长上下文和多模态打包开源,SWE-Bench Pro 59.0% 不算顶尖但够用,成本只有 GPT-5.5 的约 1/12,对想省钱又有长上下文需求的团队是个实在选项。这点先别太激动,等正式文档和更多实测出来再调判断。

AI HOT 精选

OpenBMB 放出两个开源数据集,预训练语料和 SFT 样本都给了,HuggingFace 趋势榜第一

OpenBMB 跟清华 NLP、Modelbest 一起发了两个数据集,都挂在 HuggingFace 上。一个是 Ultra-FineWeb-L3,给预训练用的合成数据,总量超过 600B token,其中英文 400B+、中文 200B+,是目前最大的开源中文预训练合成数据集。另一个是 UltraData-SFT-2605,给模型做指令微调用的,有...

推荐理由:我会先打个折:正文没披露数据质量评测、去重细节和许可证,所以没法判断实际可用度。但两个数据集的体量摆在那,600B+ tokens 的网页语料和 15M+ 条 SFT 样本,对做预训练和指令微调的人是实打实的弹药。冲上 HuggingFace 趋势榜说明社区有需求,不过这点先别太激动,热度不等于质量。整体看,这是一次对开源训练数据供给的补充,尤其对中文场景,值得关注但需要等后续评测。

AI HOT 精选

NVIDIA 开源 Cosmos 3:一个模型搞定物理世界的看、想、动

NVIDIA 在 GTC Taipei 把 Cosmos 3 完全开源了,模型权重、代码和数据集都放了出来。它被叫做首个物理 AI 全能模型,意思是能直接看懂真实世界、预测接下来会发生什么,并给出机器人该做的动作。这次发了两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提具体跑分和硬件门槛,实际部署成本还得自己测。

推荐理由:HKR 三项都成立:钩子是 NVIDIA 开源物理 AI 模型,知识增量是 32B/8B 双版本加全套开放物料,受众是机器人、仿真方向的从业者。正文信息很薄,没给基准测试、没提许可证细节,所以分数压在 78–84 区间,不往上拔。

r/LocalLLaMA

有人把英伟达 Parakeet 语音转文字模型移植到了 ggml,不再需要 Python,还能量化压缩

开发者 mudler_it 把英伟达的 Parakeet 语音转文字模型用 C++ 和 ggml 重写了一遍,彻底甩掉了 Python 和 PyTorch。他测试下来,在 f32 和 f16 精度下输出结果和原版 NeMo 逐字节一致,但速度更快,大一点的 TDT 和混合模型在 GPU 上能跑到大约 5 倍加速。模型还支持 GGUF 量化,提供了 f1...

推荐理由:我会先打个折:这是个人移植项目,不是 NVIDIA 官方出品,长期维护和后续模型支持还得看社区。但亮点很明确——输出字节级对齐 NeMo,量化后跑得更快,而且不用碰 Python 环境。对想在树莓派、本地服务器或离线场景跑语音转文字的人来说,这是个省事的选择。正文没披露量化后的精度损失有多大,这点先别太激动。整体看,技术验证扎实,痛点打得准,放在 featured 低位合适。

5月31日星期日

机器之心 · 公众号

微软开源 SkillOpt:像训练神经网络一样,自动优化给 AI 智能体看的技能说明书

微软放出了一个叫 SkillOpt 的开源框架,一周就在 GitHub 上拿了 3300 多颗星。它的思路挺直接:不改模型本身的参数,而是像做文本版梯度下降一样,自动迭代优化那些写给 AI 智能体看的“技能文档”。论文里的实验覆盖了 7 个目标模型、6 个评测基准和 3 种执行环境,总共 52 种组合,结果要么最好,要么并列最好。不过正文因为访问限制没...

推荐理由:微软开源的 SkillOpt 把 agent 技能文档当成可训练的文本参数,像训神经网络一样去优化技能描述,这个思路挺新鲜。我会先打个折:论文说在 52 个组合里做到最优或并列最优,但正文没披露具体对比基线和误差范围,这点先别太激动。不过一周 3.3k star 说明 agent 工程圈确实被技能维护和评估成本折磨很久了,一个能自动优化技能文档的工具,哪怕只是省掉一部分手工调 prompt 的活,也值得关注。

5月30日星期六

量子位 · 公众号

人大和至知研究院开源了 Claw Agent 的全套训练方案,连数据带模型和评测一起给了

人大和至知研究院放出了一个叫 ClawGym 的 Agent 训练框架,把数据、训练代码和模型权重都开源了。他们合成了 13500 条可执行的任务当训练数据,又做了 200 条任务的基准测试集。用这套东西训出来的 ClawGym-30B-A3B 模型,在他们自己的 ClawGym-Bench 上拿了 56.82 分,比 Qwen3-235B-A23B ...

推荐理由:这条消息对 Agent 开发者很实用。ClawGym 把数据、代码、模型检查点一起打包开源,不是又一个只有排行榜的项目。13.5K 合成任务规模不算大,但 200 个评测任务和 56.82 的得分给了明确的起点。我会先打个折:正文没披露合成任务的质量验证细节,也没说这个分数在实际业务场景里对应什么水平,所以别急着对标生产环境。但作为开源基建,它降低了复现和改造的门槛,值得关注。

5月29日星期五

AI HOT 精选

小米开源 ControlFoley:给视频配音效,可以按你写的提示词或给的参考音频来

小米大模型应用团队放出了一个叫 ControlFoley 的视频音效生成模型,权重和代码都开源了。它主要解决一个问题:以前模型只能看画面自动猜配什么声音,创作者没法干预。ControlFoley 支持三种用法——用文字描述想要的音效、用文字强行覆盖画面里原有的声音、或者上传一段参考音频让它模仿音色和风格,同时还能保证声音和画面动作对得上。团队自己训了一...

推荐理由:ControlFoley 把视频拟音做成可控生成,还直接开源了全套,对创作者和开发者都挺友好。它不是那种刷榜的基础模型发布,但胜在任务明确、工具属性强,放在 featured 门槛附近是合理的。

5月28日星期四

新智元 · 公众号

清华团队开源 PilotDeck:让多个 AI 分工干活,Token 成本砍掉七成

清华 NLP 实验室、面壁智能、OpenBMB 和 AI9stars 一起放出了 PilotDeck 的开源代码。这套系统让多个 AI 子代理分工协作,各自有独立的工作区和可编辑的记忆库,每次任务还会留下调度日志。文章里举了个例子:在小红书内容生成测试里,用 PilotDeck 把成本从 12.58 美元压到了 2.83 美元,相当于省了 77% 的 ...

推荐理由:我会先打个折,标题里“彻底凉了”是流量话术,但正文确实给了硬数据:子 Agent 路由在小红书内容生成场景把成本从 12.58 美元压到 2.83 美元,降幅接近 77%。如果是真的,对跑 Agent 工作流的人来说挺省钱。不过正文没披露这个数字是在什么规模、什么模型上测的,也没说延迟有没有变差,这点先别太激动。整体是个有具体成本锚点的工具发布,不是大模型或平台级动作,所以分数放在 78–84 区间是合理的。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。

r/LocalLLaMA

有人整理了一份1030亿token的Usenet语料,覆盖1980到2013年,全是真人发言、没有AI污染

一个叫OwnerByDane的用户放出了一套从Usenet新闻组扒下来的语料,总规模1031亿token,包含4.08亿条帖子,横跨18347个新闻组,时间从1980年一直拉到2013年。这套数据最大的卖点是“前互联网时代、纯人类产出、零AI生成内容”,对想避开模型训练数据被AI输出污染的开发者来说,算是个稀缺资源。目前可以免费下载每个新闻组层级500...

推荐理由:我会先打个折:这事目前只在 Reddit 上发酵,完整语料要授权才拿得到,也没有第三方验证或跑过 benchmark,所以分数没给更高。但它的卖点很硬——103B token 的纯人类对话,时间跨度 33 年,对做微调、研究语言演变或者想避开合成数据的人都有吸引力。样本已经挂在 Hugging Face 上,作者还拿它微调了 Gemma 模型,至少说明能用。这点先别太激动,但如果授权条款不苛刻,这个语料库的价值不小。

AI HOT 精选

Hao AI Lab 开源 FastVideo Dreamverse,一张 B200 显卡 7 秒跑出 30 秒 1080p 视频

这个工具用一张 NVIDIA B200 GPU 搭配 LTX-2 模型,把生成 30 秒 1080p 视频的时间压到了 7 秒,做到了实时出片。代码和博客都公开了,但正文没披露画面质量、一致性和复杂场景下的表现,实际效果得自己跑一遍才知道。

推荐理由:我会先打个折:目前只有Hao AI Lab单方面放出的数据,没看到第三方跑分或横向对比,所以别急着当定论。但7秒出30秒1080p这个指标本身很直观,如果真能在单卡B200上稳定复现,对做实时视频生成的人来说省卡又省时间。正文没披露模型权重是否全开源、也没提长视频的连贯性测试,这两点会直接影响实际能用在哪。

5月27日星期三

AI HOT 精选

Perplexity 开源 Unigram 分词器,CPU 占用降了五六倍

Perplexity 把自家重写的 Unigram 分词器开源了,放在 pplx-garden 仓库里。这个分词器主要解决一个实际问题:现在小型的重排序模型和嵌入模型在 GPU 上跑一次只要几毫秒,但 CPU 分词那一步反而成了拖后腿的环节。他们这次重构后,CPU 占用直接降了 5 到 6 倍,等于把分词这步的延迟砍掉一大截,让整体响应更快。正文没提具...

推荐理由:我会先打个折:正文没给独立基准测试、代码仓库细节和实际部署规模,所以 5-6 倍这个数字先别太激动。但分词器确实是重排序和嵌入模型里容易被忽略的 CPU 消耗大户,Perplexity 把这块开源出来,对跑生产 RAG 和搜索管线的团队来说,省下来的算力就是省下来的钱。

AI HOT 精选

面壁智能开源 ForgeTrain,一个完全由 AI 写出来的模型训练框架,零人类代码

面壁智能、清华和 OpenBMB 开源了 ForgeTrain,一个完全由 AI 编写、没有人类代码介入的大模型训练框架。他们用这套框架在华为昇腾芯片上预训练了 MiniCPM5-1B,这个模型在 AA 榜单的 2B 参数以下级别里排到了第一。同时开源的还有制造 ForgeTrain 的 Agent Harness 工具链。正文没披露训练成本、耗时和具...

推荐理由:我会先打个折:这不是一个顶配模型发布,而是一个工具链层面的开源动作,所以给 80 分、放 featured 比较合适。故事的核心是“AI 造 AI”——面壁智能说 ForgeTrain 是全球第一个零人类代码介入的生产级训练框架,并且已经在华为昇腾上跑通了 MiniCPM5-1B 的预训练。对从业者来说,这比单纯刷榜有意思,因为它直接关系到训练流程能不能自动化、能不能省人力。不过正文没披露这套 AI 写的代码质量到底怎么样、训练出来的模型跟人手写的框架比有没有性能差距,这点先别太激动。整体看,H、K、R 三条都踩中了,是个扎实的工具链新闻。

5月26日星期二

AI HOT 精选

商汤把 SenseNova-U1 的训练代码全开源了,一个框架同时训生图、修图、交错生成和理解

OpenSenseNova 在 GitHub 上放出了 SenseNova-U1 的完整训练代码,用 Apache-2.0 协议。代码覆盖了 8B 稠密模型和 A3B MoE(混合专家)架构,在一个统一框架里支持四种多模态任务:文生图、图片编辑、图文交错生成,以及文本与视觉理解。工程上为大规模训练做了准备,支持混合并行、流式可恢复的数据管线、用环境变量...

推荐理由:这条消息的卖点是“完整训练代码开源”,不是常见的只放权重。8B 密集和 A3B MoE 两种模型规格都给了,Apache-2.0 协议也干净。不过正文没披露训练用了多少数据、多少算力,也没有任何评测结果,所以实际效果和训练成本现在没法判断。我会先打个折:代码开源本身值得关注,但别急着对标闭源模型,等社区跑出结果再说。

r/LocalLLaMA

dlmserve 开源:首个为扩散语言模型设计的推理引擎,支持 LLaDA-8B,吞吐量是 HuggingFace 的 2.5 倍

Reddit 上有人放出了一个叫 dlmserve 的开源项目,MIT 协议,专门给扩散语言模型做推理服务。它第一个支持的模型是 LLaDA-8B-Instruct,这种模型生成文本的方式和常见的自回归模型不一样,是一步步“去噪”出完整回答。引擎对外提供兼容 OpenAI 的 /v1/chat/completions 接口,方便直接替换。性能方面,在批...

推荐理由:我会先打个折:目前只有 Reddit 一个信源,生态还很早期,所以分数没往上拉。但这条信息本身对玩本地模型的人挺实用——扩散语言模型一直缺好用的推理引擎,dlmserve 直接说自己是第一个,还给了 batch=4 下 2.5 倍 HF 吞吐、12GB 显存可跑这些具体数字,不是空喊口号。MIT 协议和 OpenAI 兼容接口也让试错成本变低。这点先别太激动,但值得放进雷达让读者知道有这么个东西出现了。

AI HOT 精选

面壁智能开源 MiniCPM5-1B,1B 参数在 AA-Index 上跑赢所有 2B 以下模型,量化后 0.5GB 能塞进手机和浏览器

面壁智能联合清华和 OpenBMB 开源了一个 1B 参数的小模型 MiniCPM5-1B。它在 AA-Index(一个综合评测榜单)上的得分超过了所有参数不到 2B 的模型,甚至比 3 个月前发布的 Qwen3.5-2B 效果还好,参数量却只有后者的一半。这个模型用 INT4 量化后权重文件只有 0.5GB,可以直接在手机和浏览器里跑。它的基础模型是...

推荐理由:HKR 三项都站得住:有具体参数、量化尺寸和端侧运行条件,反差也够。不过它终究是一次小模型发布,影响力到不了旗舰模型级别,所以 featured 和 78 分是合适的。

r/LocalLLaMA

Shard:把 KV 缓存压到原来的十分之一,长上下文推理更省显存

Shard 这套方法能在 Llama-3.1-8B 上把 KV 缓存占的显存砍掉约 90%。具体来说,8K 上下文长度时压缩比约 10 倍,拉到 32K 时能到 11 倍。技术路线分两路:对 Key 矩阵先用 PCA 降维再做 int4 量化,对 Value 矩阵则用 Hadamard 旋转配合向量量化。论文在 NIAH 和 LongBench 两个基...

推荐理由:HKR 三项都站得住:10 倍 KV 缓存压缩是个好钩子,数字和模型、上下文长度、基准测试都列清楚了。信息目前只来自 Reddit 帖子,验证有限,所以分数压在 78–84 这个区间。正文没提压缩方法的具体实现和额外计算开销,这点先别太激动,等有人复现再说。

5月25日星期一

r/LocalLLaMA

一个让 Codex 在无头 Linux 上安全折腾的沙盒框架

作者 superSmitty9999 放出了一个概念验证工具 ai-sandbox-manager,用 LXC 模板给 Codex 开了 sudo 权限、浏览器操作、Docker 和共享 GPU 访问,同时加了个钩子阻止 git push,让模型在隔离副本里干活,降低把系统搞崩的风险。正文没披露性能开销和具体延迟数据。

推荐理由:这是个 Reddit 上的个人概念验证,作者把 Codex 塞进 LXC 沙箱,给了 sudo、浏览器和 GPU,还加了防 push 的钩子。思路很实用,解决了“让模型干活又怕它闯祸”的矛盾,但正文没给任何性能数据、稳定性测试或实际跑任务的案例,目前只能当个有趣的工程方案看,离生产环境还有距离。