跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 141–160 条 · 共 179 条

5月15日星期五

AI HOT 精选

IBM 开源多语言嵌入模型 R2:不到 1 亿参数,32K 上下文,检索跑分在同级里最高

IBM 在 Hugging Face 上发了两个新的多语言嵌入模型,都走 Apache 2.0 协议。小号 9700 万参数,在 MTEB 多语言检索上拿了 60.3 分,正文说这是目前所有开源同尺寸模型里最高的。大号 3.11 亿参数,得分 65.2,在 5 亿参数以下的开放模型里排第二。两个模型都基于 ModernBERT,支持 200 多种语言(...

推荐理由:HKR 三项都过:一个不到 1 亿参数、支持 32K 上下文的多语言嵌入模型,给 RAG 开发者提供了一个轻量开源选项。影响面不如前沿模型发布那么大,放在 featured 档刚好。

r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

r/LocalLLaMA

inclusionAI 在 Hugging Face 上放出了 Ring-2.6-1T,一个 1 万亿参数、支持多档推理强度的模型

Ring-2.6-1T 是 inclusionAI 发布的一个 1 万亿参数推理模型,主打让模型进业务流程干活(agent workflow)和长链条任务。它提供 high 和 xhigh 两档推理强度,训练时用了异步强化学习加 IcePop 算法来稳住训练过程。不过 Reddit 原帖被网络屏蔽,正文没披露更多技术细节、实际跑分或硬件需求,这点先别太激动。

推荐理由:我会先打个折:正文没给任何跑分、没提许可证、也没说推理到底要多少卡,所以只能算个信号,不能当结论。1T 参数加上两档推理强度,说明 inclusionAI 在试着让大模型按需出力——开低档省资源,开高档拼质量。Async RL 和 IcePop 这两个训练名是新的,但没解释具体怎么训、省了多少成本,这点先别太激动。整体看,消息本身有料,但缺验证,暂时放在 featured 的下沿比较合适。

5月14日星期四

r/LocalLLaMA

有人把 HuggingFace 的 AI 研究员搬到了本地,用 llama.cpp 跑通了一条自动微调流水线

HuggingFace 之前开源了一个叫 ml-intern 的自动化 AI 研究员,现在社区有人把它接上了 llama.cpp 和 ollama,让整个流程能在本地跑。帖子说用 Qwen3.6-35B-A3B 这个模型就能当大脑,指挥 CPU/GPU 沙箱和 HuggingFace Hub 上的任务,从头到尾完成一次 SFT(有监督微调)。正文没披露...

推荐理由:我会先打个折:这是 Reddit 出来的开源工具更新,不是大模型发布。但本地沙箱加 Hub 作业编排能跑通完整微调,对想在自己机器上做自动化实验的人挺实用。正文没披露具体延迟和资源占用,这点先别太激动。

r/LocalLLaMA

单卡跑通一句话生成电影级短片:FLUX.2 出角色,Wan2.2 做动画,带自动质检和 9 语配音

这个叫 StudioMI300 的开源流水线,把一句英文提示词变成 720p 短片,全程跑在一张 AMD Instinct MI300X 上。流程分 8 步:先用 FLUX.2 [klein] 生成角色关键帧,再用 Wan2.2-I2V 把静态图转成动画,中间加了一道视觉评分和自动重试的质检,最后配上音乐和 9 种语言的旁白。开发者把单条片子的生成时间...

推荐理由:HKR 三项都成立:帖子把一句提示词到成片的完整链路讲清楚了,有硬件型号、阶段数和压缩后的耗时,对想自己搭视频管线的开发者来说,省钱和可控这两点很抓人。不过来源只有 Reddit 单帖,没有第三方复现或更多验证,所以分数没再往上走。

AI HOT 精选

让 GPU 别闲着:用异步批处理榨干推理性能

Hugging Face 发现,一个 80 亿参数的模型在生成 8000 个 token 时,GPU 有 24% 的时间在空转。原因出在同步批处理上:CPU 准备下一批数据时,GPU 只能干等,反之亦然。这篇文章讲的是怎么用 CUDA 流把这两件事拆开并行,让 CPU 准备第 N+1 批的同时,GPU 已经在算第 N 批,把空闲缝隙填满。

推荐理由:我会先打个折:这不是新模型发布,是推理系统的工程优化。Hugging Face 给了一个具体的 24% GPU 空闲率,并解释了用 CUDA 流重叠 CPU 与 GPU 工作的机制,对跑线上服务的团队有参考价值,但属于底层技巧而非行业大新闻,所以放在低 featured 档。

r/LocalLLaMA

商汤发布 SenseNova-U1-A3B-MoT,一个模型搞定看图、推理和生成

商汤在 Hugging Face 上放出了 SenseNova-U1-A3B-MoT 模型,同时提供了 A3B MoT、8B MoT 和 0.4B LoRA 权重链接。按官方说法,这套模型用 NEO-unify 架构把多模态理解、推理和生成统一到一个模型家族里。不过 Reddit 原帖被网络屏蔽了,正文没披露具体性能数据、训练细节和实际跑分,想试的话得...

推荐理由:SenseNova 在 Hugging Face 扔了一套多模态模型权重,A3B MoT、8B MoT 加一个 0.4B LoRA,主打 NEO-unify 架构,说能把看图、推理和生成塞进一个模型。我会先打个折:正文没给任何 benchmark 分数,也没写清楚开源协议,所以性能好坏和商用限制现在全是问号。亮点是 LoRA 权重只有 0.4B,对想用消费级显卡跑多模态任务的人挺友好,这点先别太激动,等实测出来再看。整体属于有料但缺关键信息的发布,给个 featured 低段位合理。

5月13日星期三

r/LocalLLaMA

阿里达摩院放出 Ovis2.6-80B-A3B:总参数 800 亿,推理时只激活约 30 亿的多模态 MoE 模型

Ovis2.6 把语言模型底座换成了混合专家架构,总参数量堆到 800 亿,但推理时只叫醒大概 30 亿个参数,跑起来比较省算力。上下文窗口拉到 64K token,能处理的图片分辨率最高到 2880×2880,适合啃长文档、高信息密度的图表和扫描件。这次加了一个“边想边看图”的能力,推理过程中模型可以主动裁剪、旋转图片区域,在思维链里反复检查视觉细节...

推荐理由:我会先打个折:正文没给任何跑分、授权条款和实测结果,所以别急着下结论。亮点是 80B 总参数里只激活约 3B,推理成本可能压得很低,同时支持 64K 上下文和 2880×2880 大图输入,适合拿来做文档理解、高分辨率视觉问答这类吃上下文和细节的任务。MoE 结构意味着你可以用消费级硬件试试,但实际吞吐和显存占用还得自己测。这点先别太激动,等补上基准测试和开源协议再说。

量子位 · 公众号

字节提出 GRN,让生图模型像人一样边画边改,不再死磕扩散和自回归

字节跳动的技术团队搞了个叫 GRN(生成式精炼网络)的新架构,想给视觉生成找第三条路,不跟扩散模型和自回归模型硬卷。它的核心思路是让模型先生成一张粗糙的图,再反复精修,就像画师先铺大色块再慢慢抠细节。为了解决反复修图容易把图修糊、错误越攒越多的问题,他们用了三项技术:HBQ(分层二元量化)把图片压成更紧凑的离散编码,减少信息损耗;全局精炼让模型每次修改...

推荐理由:字节这篇 GRN 想走扩散和自回归之外的第三条路,核心卖点是让模型像人画画一样边生成边修改。我会先打个折:130M 参数不算大,gFID 从 3.56 涨到 3.79,画质有小幅下降,但推理步数从 50 步压到平均 24 步,省了将近一半,这个取舍在轻量场景里可能划算。技术上有三个动作:HBQ 解决量化带来的画质损失,全局精炼缓解一步步画下去误差越攒越多的问题,复杂度采样让简单区域少画几步、复杂区域多画几步,不再固定步数。正文没披露在更大模型或更高分辨率上的表现,也没给实际推理延迟的毫秒数,所以现在只能说在小模型上验证了思路。对做图像生成落地、想降...

5月11日星期一

r/LocalLLaMA

MTP 实测:写代码能加速 71%,写小说反而变慢 9%,任务类型决定投机推理是帮忙还是帮倒忙

一位 Reddit 用户用 Qwen 3.6 27B 的 MTP 量化模型跑了 300 多次测试,发现投机推理(让模型先猜后验证)的效果完全看任务类型。写代码时草稿被采纳的比例高达 79% 到 89%,用 F16 精度跑代码生成速度提升了 171%;但换成创意写作,Q4_K_M 量化下推理速度反而慢了 9%。结论很直接:别只看模型和量化,先看你要让模型...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次实验,不是官方基准,但 300 多次测试把投机推理的任务依赖性讲得很清楚。编码任务接受率高、加速明显,创意写作接受率低、反而变慢,这个结论对本地跑模型的开发者有直接参考价值。正文没披露测试硬件和具体 prompt,但数据量够大,可以先信一半。

5月10日星期日

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

5月9日星期六

AI HOT 精选

EMO:让专家模型自己长出模块,用八分之一专家就能干活

AllenAI 放出了一个叫 EMO 的混合专家模型(MoE),总参数量 140 亿,每次推理只激活 10 亿参数。它最大的不同是训练时没按人类划好的学科(比如数学、代码)去分专家,而是让模型自己从 1 万亿 token 的数据里长出模块。结果是,跑特定任务时你只用挑出 12.5% 的专家,性能就接近全模型水平;而同样架构、同样数据训出来的普通 MoE...

推荐理由:AllenAI 和 Hugging Face 放出的 EMO,是个 14B 总参数、1B 活跃参数的 MoE 模型,用 1 万亿 token 训练。亮点是跑任务时只激活 12.5% 的专家,推理成本压得很低。不过正文没披露具体 benchmark 成绩和路由策略细节,这点先别太激动。它更像一个研究发布,不是前沿模型发布,所以给 featured 低档。

5月8日星期五

r/LocalLLaMA

警惕:Hugging Face 上的 Open-OSS/privacy-filter 仓库实为窃密木马

Reddit 用户发帖警告,Hugging Face 上名为 Open-OSS/privacy-filter 的仓库是信息窃取器。它伪装成 OpenAI 的隐私过滤器,通过 loader.py 拉取 PowerShell 脚本,再下载一个 EXE 文件并利用 Windows 任务计划程序运行。发帖者已向微软和 Hugging Face 举报,帖子提到 ...

推荐理由:HKR 三项都成立:伪装成 OpenAI 隐私过滤器的恶意模型有明确的 Windows 执行链,对本地部署用户来说是个实在的供应链风险。信息源目前只有 Reddit 用户报告,缺少官方确认,所以重要性停在 73 分 featured 档位是合理的。

5月7日星期四

r/LocalLLaMA

Reddit 实测:双卡跑大模型,PCIe 带宽可能没你想的那么吃紧

用户 ziphnor 用两张 RTX 5060 Ti 16GB 跑 vLLM,开启张量并行(TP=2)处理 32k 上下文预填充。实测 PCIe 峰值带宽只跑到 3–4 GB/s,大约占满一条 PCIe 4.0 x4 通道的 40%–50%。预填充速度在不同设置下分别达到约 840–850、1500 和 1600–1700 tokens/s。帖子没提解...

推荐理由:这篇 Reddit 实测值得一看,因为它用具体数字回应了一个常见焦虑:双卡跑大模型,PCIe 带宽到底够不够。ziphnor 拿 2 张 RTX 5060 Ti 16GB 在 vLLM 里开张量并行,32k 上下文预填充时 PCIe 峰值只有 3–4 GB/s,就算把链路砍到 PCIe 4.0 x4,实际也只用了 40–50% 的带宽。三组模型的预填充速度分别约 840–850、1500、1600–1700 tokens/s,说明瓶颈不在 PCIe 线速上。我会先打个折:正文没披露解码阶段的带宽,那才是持续通信的大头,这点先别太激动。真正该盯的是张...

5月6日星期三

r/LocalLLaMA

Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍,48GB 显存可跑 26 万上下文

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者分享了一个 llama.cpp 的 PR,为 Qwen 3.6 27B 模型添加了 MTP(多令牌预测)支持,实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化,这让一...

推荐理由:HKR 三项都站得住:提速和长上下文对本地 agent 是实打实的吸引力,帖子里机制和数字都列清楚了,成本优势也直接。不过只有 Reddit 单源,配置也有点折腾,所以放在 featured 低位。

r/LocalLLaMA

Gemma 4 出了 MTP 草稿模型,解码速度翻倍但输出质量不变

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token,再由主模型并行验证,相当于让模型“先猜后验”,最终解码速度能提一倍,而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了,正文没披露具体模型尺寸、硬件要求或实测延迟数据。

推荐理由:H、K、R 都站得住:钩子是 2 倍低延迟解码,有检查点和机制说明,不是画饼。它不是旗舰模型发布,属于实用更新,75 分放在 featured 低位合理。

5月5日星期二

r/LocalLLaMA

SenseNova-U1-8B-MoT 开源多模态架构引发讨论,去掉 VE 和 VAE 的单体设计是亮点还是噱头?

商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型,能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构,把传统多模态模型里常见的 VE(视觉编码器)和 VAE(变分自编码器)都去掉了,支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升,但帖子正文没给出...

推荐理由:HKR 三项都踩中了:架构钩子够具体,一个 8B 模型把理解和生成揉在一起,还砍掉了 VE/VAE;信息增量有,但缺实测分数和部署成本,所以分数压在 72–77 这个区间。我会先打个折,没看到跑分和许可就别急着全信,但方向值得盯。

r/LocalLLaMA

Hugging Face 发了个交互式指南,横向对比不同框架下的强化学习训练环境

Hugging Face 的后训练团队花了一个月,用 verifiers、OpenEnv、Nemo-Gym、OpenRewards 等几套框架分别搭了强化学习环境,然后实际训模型来看哪种方案在扩展时更顺手。他们把这个过程做成了交互式指南,方便你点进去对比。不过正文没给出具体的基准分数、模型规模或训练成本,所以没法判断哪套方案效果更好或更省钱,目前更像一...

推荐理由:我会先打个折:正文没给具体基准分数、模型规模和训练成本,所以没法判断哪个框架真的更省钱或更稳。但 Hugging Face 花一个月亲自下场踩坑,把不同 RL 环境框架的差异和扩展轴摆出来,对正在搭训练流程的团队有实操参考价值。这点先别太激动,等他们把量化结果补上才算完整。

4月30日星期四

r/LocalLLaMA

Qwen 发布 Qwen-Scope,用稀疏自编码器给 Qwen 3.5 模型做“内部体检”

Qwen 团队开源了 Qwen-Scope,这是一套针对 Qwen 3.5 系列(从 2B 到 35B MoE)的稀疏自编码器(SAE)。SAE 的作用是把模型内部那些纠缠在一起的激活信号拆解开,变成一个个相对独立的“特征”,方便人去看懂和调试。这次放出的 SAE 覆盖了模型所有层的残差流,还专门标出了一个叫 Feature #6159 的特征,跟中文...

推荐理由:我会先打个折:这不是新模型,所以重要性不会冲到顶。但 Qwen 官方放 SAE 这件事本身挺实在,等于给开发者开了个后门去看模型内部在想什么。覆盖范围从 2B 到 35B MoE,全层残差流都扫了,不是只挑几层做样子。Feature #6159 的例子也直观,能让人立刻联想到怎么用这些特征去修模型行为。唯一要留个心的是许可证里对移除安全过滤的态度,正文没细说具体限制条款,但既然提了,用的时候就得自己掂量。整体上,对做模型调试和可解释性的人来说,这是一份能直接上手试的工具级发布。

r/LocalLLaMA

inclusionAI 在 Hugging Face 开源了 Ling-2.6-1T,一个 1 万亿参数的模型

这个模型用了 MLA 和线性注意力,还加了一个叫“上下文过程冗余抑制”的技术,目的是降低思维链推理时的计算开销。帖子提到了 AIME26 和 SWE-bench Verified 两个基准,但正文没披露具体分数,所以实际表现还不清楚。另外,Reddit 原帖被网络屏蔽了,目前只能看到标题和简介,更多细节得去 Hugging Face 模型页翻。

推荐理由:我会先打个折:正文只提了覆盖 AIME26、SWE-bench Verified 等基准,但没给具体分数,所以模型到底多强现在说不准。能上 featured 是因为万亿参数开源本身就有信号意义,加上 MLA+Linear Attention 和 CPRS 这两个技术点,对做推理优化的人有参考价值。没给分这件事让它到不了 P1,但架构信息和开源动作足够让圈内人留意。