跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 121–140 条 · 共 179 条

6月2日星期二

AI HOT 精选

Holo3.1 发布:一套能在本地快速跑起来的电脑/手机操作模型

H公司把他们的电脑操作模型升级到了 Holo3.1,这次主打的是“哪里都能跑”。模型基于 Qwen 系列,一口气放出 0.8B、4B、9B 和 35B-A3B 四个尺寸,并且首次提供了 FP8、Q4 GGUF 和 NVFP4 这些压缩版本,方便直接在个人设备上做本地推理。35B-A3B 的旗舰版在 AndroidWorld 测试里拿到了 79.3% 的...

推荐理由:Holo3.1 把电脑操作智能体做成了本地可跑的版本,而且最小模型只有 0.8B 参数,对想在个人设备上试水的开发者来说门槛很低。四个尺寸加三种量化格式一起发,部署灵活度拉满,不是只给一个玩具。我会先打个折:正文没披露具体任务成功率或延迟数据,所以实际效果还得自己测。但就凭本地运行和量化支持这两点,已经够让做私有化部署的人点进去看了。

r/LocalLLaMA

NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型,能同时吃文字、图片、视频并生成视频、音频和动作指令

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face,这次发了两个尺寸:Nano 版 160 亿参数,Super 版 640 亿参数。它是个全模态世界模型,输入可以混着来——文字、图片、视频甚至动作轨迹都行,输出也不止视频,还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了,实际跑起来的硬件门槛...

推荐理由:我会先打个折:正文没披露 benchmark 分数、许可证和训练细节,所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上,这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说,输入支持动作轨迹、输出能直接给动作指令,说明它不只是生成漂亮画面,而是想往物理交互方向靠。这点先别太激动,因为没看到在真实机器人任务上的验证,但方向对,且开源降低了试错成本。

6月1日星期一

AI HOT 精选

JetBrains 发布 Mellum2:一个 12B 参数的混合专家模型,每次推理只激活 2.5B 参数

JetBrains 在 Hugging Face 上开源了 Mellum2,一个从零开始训练的混合专家模型。它总共有 120 亿参数,但每次计算只激活其中的 25 亿,这让它跑起来比同尺寸模型快了一倍多,适合对延迟和吞吐量要求高的场景。模型专门处理文本和代码,不做多模态,主要用在路由分发、外挂资料库检索、摘要和子智能体这些需要频繁调用模型但不必上大模型...

推荐理由:HKR 三项都过,但正文只给了 12B 和 MoE 这两个信息,没放跑分、没提许可证、没写上下文窗口,也没说怎么跟自家 IDE 集成。先按中等量级的模型发布处理,放在 featured 里偏低的档位。

5月31日星期日

r/LocalLLaMA

用 44 小时 RTX 5090 给 Gemma 4 E2B 做了 13 个“去限制”变体,有害指令成功率从 32% 飙到 82% 以上

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者 Abliterlitics 用 44 小时的 RTX 5090 算力,对 Gemma 4 E2B 模型做了 13 种不同强度的“去限制”(abliteration)处理。简单说,就是通过修改模型内部参数,削弱它对敏感问题的拒绝回答倾向。结果很直接:原版模型在 HarmBench 有害指令测...

推荐理由:我会先打个折:这只是一次个人发起的去审查实验,不是官方发布,结论别直接当生产依据。但文章把 13 个变体的基准分、GPU 开销和有害指令通过率都列清楚了,读起来像朋友在群里甩了一份跑分记录。对想了解 Gemma 4 安全边界、或者自己动手做 abliration 的人,这份数据比泛泛的讨论有用得多。

5月29日星期五

r/LocalLLaMA

Liquid AI 发布 LFM2.5-8B-A1B,一个 80 亿参数、支持 12.8 万 token 上下文的模型

Liquid AI 放出了新模型 LFM2.5-8B-A1B。它用 380 亿个 token 做预训练,之后又做了大规模强化学习,上下文窗口能塞进 12.8 万个 token。词汇表翻了一倍,对非拉丁语系的 token 切分更友好。模型已经挂在 Hugging Face 上。不过 Reddit 原帖被网络策略挡了,正文没披露具体的基准跑分、推理成本和强...

推荐理由:我会先打个折:正文没给任何跑分、许可证和部署限制,所以别急着下结论。亮点是 8B/A1B 这个尺寸配 128K 上下文,38T token 的预训练量也算扎实,加上大规模 RL 调过,对想在本地跑长文本、又不想烧太多卡的人有吸引力。但没基准测试就没法判断实际水平,这点先别太激动。

5月28日星期四

r/LocalLLaMA

英伟达 LocateAnything:用并行框解码做视觉定位,号称比 Qwen3-VL 快 10 倍

英伟达放出了一个叫 LocateAnything-3B 的模型,专门做视觉语言定位——就是给张图、说句话,模型把对应物体用框标出来。它主打“并行框解码”,不像传统方法一个个框串行生成,所以速度上来了,标题直接写比 Qwen3-VL 快 10 倍。不过帖子正文只给了 Hugging Face、GitHub、Demo 和项目链接,没披露具体跑分设置和准确率...

推荐理由:我会先打个折:正文基本就是标题加三个链接,没有完整评测设置,也没给召回率、准确率这些质量指标,所以“快 10 倍”目前只能当官方说法看。但 Nvidia 开源一个 3B 的视觉定位模型,用并行框解码把速度拉起来,这件事本身对做实时视频分析、端侧部署的人挺实用。先放进 featured,等有第三方跑分再更新判断。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。

r/LocalLLaMA

有人整理了一份1030亿token的Usenet语料,覆盖1980到2013年,全是真人发言、没有AI污染

一个叫OwnerByDane的用户放出了一套从Usenet新闻组扒下来的语料,总规模1031亿token,包含4.08亿条帖子,横跨18347个新闻组,时间从1980年一直拉到2013年。这套数据最大的卖点是“前互联网时代、纯人类产出、零AI生成内容”,对想避开模型训练数据被AI输出污染的开发者来说,算是个稀缺资源。目前可以免费下载每个新闻组层级500...

推荐理由:我会先打个折:这事目前只在 Reddit 上发酵,完整语料要授权才拿得到,也没有第三方验证或跑过 benchmark,所以分数没给更高。但它的卖点很硬——103B token 的纯人类对话,时间跨度 33 年,对做微调、研究语言演变或者想避开合成数据的人都有吸引力。样本已经挂在 Hugging Face 上,作者还拿它微调了 Gemma 模型,至少说明能用。这点先别太激动,但如果授权条款不苛刻,这个语料库的价值不小。

5月27日星期三

r/LocalLLaMA

8 个开源模型在 MMO 里挂了 10 天机,放出了 9.3 万条事件日志

Firespawn Studios 在《Null Epoch》第 0 赛季里放了 25 个 AI 智能体,分别跑在 8 个开源模型上,连续运行了 10 天。他们公开了大约 9.3 万条记录的事件数据集,其中约 70% 的动作都附带了模型当时的推理或决策理由。不过,Reddit 原帖的正文内容被网络屏蔽了,目前看不到具体的实验结论和模型表现对比,只能从标...

推荐理由:Firespawn Studios 把 8 个开权重模型丢进 MMO 里当 agent 跑了整整 10 天,攒了 9.3 万条事件数据,这事本身比跑分有意思——因为不是测单次问答,是看模型能不能在持续变化的环境里记住东西、做出连贯决策。我会先打个折:信息来自 Reddit,不是正式论文,实验细节和失败案例正文没展开,所以别当严谨研究来读。但 25 个 agent、8 个模型、10 天的规模,加上数据公开,对想测 agent 长期稳定性和记忆的人是个现成的素材包。

AI HOT 精选

Reachy Mini 机器人现在能完全在本地跑语音对话了

Hugging Face 给 Reachy Mini 机器人配了一套纯本地运行的语音对话方案,数据不用上传云端。他们用 speech-to-speech 库搭了一条流水线:先靠 Silero VAD 检测有没有人在说话,再用 Parakeet-TDT 把语音转成文字,接着交给大模型想怎么回,最后让 Qwen3-TTS 把文字念出来。这套东西通过一个兼容...

推荐理由:HKR 三项都成立:有个清晰的本地机器人语音钩子,技术栈细节给得实在,对边缘端语音代理场景有直接吸引力。范围就限定在 Reachy Mini 的语音交互上,所以放在 featured 档。

AI HOT 精选

TRL 新增增量权重同步:只传模型变化的部分,每步传输量从 1.2GB 降到 20-35MB

异步强化学习训练有个很现实的问题:每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB,换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现,在两次优化步骤之间,大约 99% 的 bf16 权重其实完全没变,真正变动的部分很小。他们合入了 TRL 的一个 PR,做法是把变动的权重打包成稀疏...

推荐理由:Hugging Face 在 TRL 里合了一个增量权重同步的 PR,用稀疏 safetensors 只传变化的部分,Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说,这个压缩比很实在,能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据,所以“万亿参数”目前更像一个能力上限的表述,实际效果还得看后续验证。整体是训练基础设施层面的改进,对从业者有用,但还没到必须全员关注的程度。

r/LocalLLaMA

PrismML 放出二值/三值 Bonsai Image 4B:1-bit 文生图扩散模型,浏览器里就能跑

PrismML 发布了 Bonsai Image 4B 的二值和三值版本,把文生图扩散 Transformer 的权重压到 1-bit 或三值,模型体积约 3GB。作为对比,FLUX.2 Klein 4B 大概要 16GB。Reddit 帖子里给了浏览器端 WebGPU 本地运行的 demo 链接,模型用 Apache-2.0 协议开源。不过帖子正文被...

推荐理由:PrismML 这个 Bonsai Image 4B 把文生图 DiT 压到 1-bit 和三值,模型约 3GB,能在浏览器 WebGPU 上完全本地跑,Apache-2.0 开源。我会先打个折:Reddit 信源、实验室发布,实际出图质量和速度还没第三方验证,这点先别太激动。但技术方向上,低比特量化做到浏览器可跑,对本地推理和隐私场景确实挺省钱,所以给 featured 低位。

5月25日星期一

AI HOT 精选

Hugging Face 发了一篇术语辨析,把智能体的模型、脚手架和线束三层结构讲清楚了

这篇博客把智能体拆成了三层:模型(就是大语言模型本身)、脚手架(通过提示词和工具描述来定义模型的行为逻辑)和线束(负责实际跑模型调用、工具调用和控制循环的代码)。作者认为现在行业里这些词被混用得厉害,比如有人把整个智能体叫脚手架,有人把执行层叫线束,这篇就是想给个实用的参照,不是要定死标准。文章还顺带理了上下文工程、策略、技能、子智能体这些常被模糊使用...

推荐理由:Hugging Face 这篇把 agent 拆成三层:模型本身、Scaffolding(定义行为)和 Harness(管工具调用与控制循环)。这个分法解决了一个很实际的痛点——现在聊 agent 的人经常把“怎么调用工具”和“谁在控制循环”搅在一起,文章直接划了条线。我会先打个折:正文没给出具体的实现案例或性能对比,更像概念梳理,所以重要性停在 72 分。对正在搭 agent 架构的从业者来说,这篇能当一张参考图用,但别指望它直接告诉你代码怎么写。

5月23日星期六

r/LocalLLaMA

美团 LongCat 放出视频数字人模型 1.5 版,换用 Whisper 做语音驱动,推理步数压到 8 步

美团 LongCat 在 Hugging Face 上发了 LongCat-Video-Avatar-1.5,模型权重用 MIT 协议开源。它能做音频驱动视频、音频加图片驱动视频,还能接着一段视频往后生成。这版把语音编码器从 Wav2Vec2 换成了 Whisper-Large,理论上对语音的理解会更准。推理部分用 DMD2 蒸馏把步数降到了 8 NF...

推荐理由:我会先打个折:这不算行业地震级别的发布,但对做开源视频数字人的团队来说是个实在的更新。H、K、R 三条都站得住——美团 LongCat 把模型权重用 MIT 协议放出来,推理压到 8 NFE,意味着本地跑起来的门槛低了不少。技术上,它把语音编码器从 Wav2Vec2 换成 Whisper-Large,对中文语音的适配可能会更好,但正文没给出具体的对比测试数据,这点先别太激动。如果是真的省钱又好用,对想自己搭数字人、不想走云端 API 的开发者来说,是个值得上手试试的选项。

5月22日星期五

AI HOT 精选

大模型在生产环境会“说胡话”,但大部分跑分测试根本不查这个

Dharma-AI 在 Hugging Face 发了篇博文,说现在的大语言模型上线后经常出现文本退化——输出内容来回重复、前言不搭后语或者逻辑崩掉。这种故障直接影响用户体感和模型能不能用,但主流基准测试基本没把这类问题纳入评分。文章呼吁业界在评估体系里加上对文本退化的系统追踪和量化指标,正文没披露具体的指标设计或实验数据。

推荐理由:HKR 三项都过了,但这篇帖子只披露了故障模式和基准盲区,没给样本量、具体指标或复现方法,信息密度偏低,放在 featured 里靠下的位置比较合适。

5月21日星期四

r/LocalLLaMA

HRM 1B:一个用极低成本训练的小模型,性能号称能打 2B-7B 的开源选手

Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...

推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。

5月20日星期三

Hacker News 首页

字节跳动开源 Lance:一个模型同时搞定图片和视频的理解、生成与编辑

Lance 是字节跳动放出的一个多模态研究项目,把看图、看视频、生成图片、生成视频和编辑这些事塞进了同一个模型里。模型激活参数只有 3B,个头不大,训练用了不到 128 张 GPU,对想复现或微调的人来说门槛不算高。代码、论文和模型权重都公开了,但项目页没写具体的 benchmark 跑分和商用许可条款,这点先别太激动,得自己去翻论文和 HF 页面确认。

推荐理由:字节跳动的 Lance 把图像和视频的生成、理解塞进一个模型,激活参数 3B,训练用了不到 128 块 GPU。我会先打个折:正文没披露 benchmark 成绩、没放真实生成样本,授权协议也没说清楚,所以现在只能当研究发布看,别急着对标成熟产品。但单模型覆盖多模态这个方向,对想省部署成本的小团队确实有吸引力。

5月19日星期二

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

AI HOT 精选

IBM 在 Hugging Face 上线开放智能体排行榜,直接对比整套系统谁更省钱能干

IBM Research 做了一个开放排行榜,不只看模型本身,而是把智能体整套系统(模型、工具、规划、记忆、纠错)拉出来比。它用六个不同场景的基准测试来打分,同时公布质量和运行成本,让你知道哪个方案真值得部署。正文没披露具体模型分数、数据集大小和评测日期。

推荐理由:我会先打个折:信息量其实不多,更像一个预告。但“开放智能体排行榜”这个动作本身有话题性,因为 agent 评测一直缺公开基准,IBM 把它挂上 Hugging Face,至少让对比有了个起点。正文没披露分数和数据集规模,所以别急着拿它当权威结论,先当个信号看。

5月17日星期日

r/LocalLLaMA

用 85 个 GPU 小时,把 Qwen3.6-27B 的 5 种“去安全限制”方法拉出来比了比

这篇 Reddit 帖子被网络屏蔽了,正文内容没拿到,只能根据标题和现有摘要说个大概。作者花了 85 个 GPU 小时,在 Qwen3.6-27B 模型上对比了 5 种 abliteration(去掉模型安全限制)方法,跑了一堆基准测试、HarmBench 安全评测、KL 散度(看输出分布变化)和权重分析。摘要里提到,Huihui 方法对模型原本能力的...

推荐理由:这篇不是实验室通稿,是实打实的 85 GPU 小时对比实验。5 种去审查方法在 Qwen3.6-27B 上跑完,给出了基准测试掉分、KL 散度和安全拒答移除率三个维度的数据。Huihui 掉分最少,Heretic 最像原版,但所有变体都几乎把安全护栏拆干净了——这点先别太激动,正文没披露这些变体在真实对抗场景下的表现,也没说拆掉拒答后模型会不会乱说话。对想用开源模型又需要绕过安全限制的人,这份对比能省不少试错成本。