跳到正文

#Hugging Face

今日 0 条

6月7日星期日

AI HOT 精选

五个实验室,五个心智:用小模型搭了个会内幕交易的金融宫斗剧

这个项目用四家不同实验室的小模型(OpenAI 的 gpt-oss-20b、OpenBMB 的 MiniCPM3-4B、NVIDIA 的 Nemotron-Mini-4B 和一个自己微调的 0.5B Qwen)分别扮演市场里的不同角色,玩家则充当幕后金主,可以放贷、散布真假内幕消息、做空和贿赂。模型之间的差异本身就是卖点,让市场博弈更像真的吵架而不是念...

推荐理由:我会先打个折:这只是个实验项目,不是产品。但它的切入点很巧——用小模型之间的差异来制造博弈感,而不是硬靠 prompt 演。技术细节也够实在,vLLM 版本冲突、0.5B 模型的表现数据都摆出来了,做 agent 的人能直接参考。正文没披露微调那 0.5B Qwen 的具体数据配方,这点先别太激动。整体值得一看,放在低 featured 合理。

6月3日星期三

NVIDIA 博客

NVIDIA 在 CVPR 发了三篇物理 AI 论文:抓取、自动驾驶和游戏里练出来的智能体

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。

6月1日星期一

AI HOT 精选

JetBrains 发布 Mellum2:一个 12B 参数的混合专家模型,每次推理只激活 2.5B 参数

JetBrains 在 Hugging Face 上开源了 Mellum2,一个从零开始训练的混合专家模型。它总共有 120 亿参数,但每次计算只激活其中的 25 亿,这让它跑起来比同尺寸模型快了一倍多,适合对延迟和吞吐量要求高的场景。模型专门处理文本和代码,不做多模态,主要用在路由分发、外挂资料库检索、摘要和子智能体这些需要频繁调用模型但不必上大模型...

推荐理由:HKR 三项都过,但正文只给了 12B 和 MoE 这两个信息,没放跑分、没提许可证、没写上下文窗口,也没说怎么跟自家 IDE 集成。先按中等量级的模型发布处理,放在 featured 里偏低的档位。

5月28日星期四

r/LocalLLaMA

英伟达 LocateAnything:用并行框解码做视觉定位,号称比 Qwen3-VL 快 10 倍

英伟达放出了一个叫 LocateAnything-3B 的模型,专门做视觉语言定位——就是给张图、说句话,模型把对应物体用框标出来。它主打“并行框解码”,不像传统方法一个个框串行生成,所以速度上来了,标题直接写比 Qwen3-VL 快 10 倍。不过帖子正文只给了 Hugging Face、GitHub、Demo 和项目链接,没披露具体跑分设置和准确率...

推荐理由:我会先打个折:正文基本就是标题加三个链接,没有完整评测设置,也没给召回率、准确率这些质量指标,所以“快 10 倍”目前只能当官方说法看。但 Nvidia 开源一个 3B 的视觉定位模型,用并行框解码把速度拉起来,这件事本身对做实时视频分析、端侧部署的人挺实用。先放进 featured,等有第三方跑分再更新判断。

5月27日星期三

r/LocalLLaMA

8 个开源模型在 MMO 里挂了 10 天机,放出了 9.3 万条事件日志

Firespawn Studios 在《Null Epoch》第 0 赛季里放了 25 个 AI 智能体,分别跑在 8 个开源模型上,连续运行了 10 天。他们公开了大约 9.3 万条记录的事件数据集,其中约 70% 的动作都附带了模型当时的推理或决策理由。不过,Reddit 原帖的正文内容被网络屏蔽了,目前看不到具体的实验结论和模型表现对比,只能从标...

推荐理由:Firespawn Studios 把 8 个开权重模型丢进 MMO 里当 agent 跑了整整 10 天,攒了 9.3 万条事件数据,这事本身比跑分有意思——因为不是测单次问答,是看模型能不能在持续变化的环境里记住东西、做出连贯决策。我会先打个折:信息来自 Reddit,不是正式论文,实验细节和失败案例正文没展开,所以别当严谨研究来读。但 25 个 agent、8 个模型、10 天的规模,加上数据公开,对想测 agent 长期稳定性和记忆的人是个现成的素材包。

5月21日星期四

r/LocalLLaMA

HRM 1B:一个用极低成本训练的小模型,性能号称能打 2B-7B 的开源选手

Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...

推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。

5月20日星期三

Hacker News 首页

字节跳动开源 Lance:一个模型同时搞定图片和视频的理解、生成与编辑

Lance 是字节跳动放出的一个多模态研究项目,把看图、看视频、生成图片、生成视频和编辑这些事塞进了同一个模型里。模型激活参数只有 3B,个头不大,训练用了不到 128 张 GPU,对想复现或微调的人来说门槛不算高。代码、论文和模型权重都公开了,但项目页没写具体的 benchmark 跑分和商用许可条款,这点先别太激动,得自己去翻论文和 HF 页面确认。

推荐理由:字节跳动的 Lance 把图像和视频的生成、理解塞进一个模型,激活参数 3B,训练用了不到 128 块 GPU。我会先打个折:正文没披露 benchmark 成绩、没放真实生成样本,授权协议也没说清楚,所以现在只能当研究发布看,别急着对标成熟产品。但单模型覆盖多模态这个方向,对想省部署成本的小团队确实有吸引力。

5月15日星期五

r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

r/LocalLLaMA

inclusionAI 在 Hugging Face 上放出了 Ring-2.6-1T,一个 1 万亿参数、支持多档推理强度的模型

Ring-2.6-1T 是 inclusionAI 发布的一个 1 万亿参数推理模型,主打让模型进业务流程干活(agent workflow)和长链条任务。它提供 high 和 xhigh 两档推理强度,训练时用了异步强化学习加 IcePop 算法来稳住训练过程。不过 Reddit 原帖被网络屏蔽,正文没披露更多技术细节、实际跑分或硬件需求,这点先别太激动。

推荐理由:我会先打个折:正文没给任何跑分、没提许可证、也没说推理到底要多少卡,所以只能算个信号,不能当结论。1T 参数加上两档推理强度,说明 inclusionAI 在试着让大模型按需出力——开低档省资源,开高档拼质量。Async RL 和 IcePop 这两个训练名是新的,但没解释具体怎么训、省了多少成本,这点先别太激动。整体看,消息本身有料,但缺验证,暂时放在 featured 的下沿比较合适。

5月13日星期三

量子位 · 公众号

字节提出 GRN,让生图模型像人一样边画边改,不再死磕扩散和自回归

字节跳动的技术团队搞了个叫 GRN(生成式精炼网络)的新架构,想给视觉生成找第三条路,不跟扩散模型和自回归模型硬卷。它的核心思路是让模型先生成一张粗糙的图,再反复精修,就像画师先铺大色块再慢慢抠细节。为了解决反复修图容易把图修糊、错误越攒越多的问题,他们用了三项技术:HBQ(分层二元量化)把图片压成更紧凑的离散编码,减少信息损耗;全局精炼让模型每次修改...

推荐理由:字节这篇 GRN 想走扩散和自回归之外的第三条路,核心卖点是让模型像人画画一样边生成边修改。我会先打个折:130M 参数不算大,gFID 从 3.56 涨到 3.79,画质有小幅下降,但推理步数从 50 步压到平均 24 步,省了将近一半,这个取舍在轻量场景里可能划算。技术上有三个动作:HBQ 解决量化带来的画质损失,全局精炼缓解一步步画下去误差越攒越多的问题,复杂度采样让简单区域少画几步、复杂区域多画几步,不再固定步数。正文没披露在更大模型或更高分辨率上的表现,也没给实际推理延迟的毫秒数,所以现在只能说在小模型上验证了思路。对做图像生成落地、想降...

5月10日星期日

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

5月9日星期六

AI HOT 精选

EMO:让专家模型自己长出模块,用八分之一专家就能干活

AllenAI 放出了一个叫 EMO 的混合专家模型(MoE),总参数量 140 亿,每次推理只激活 10 亿参数。它最大的不同是训练时没按人类划好的学科(比如数学、代码)去分专家,而是让模型自己从 1 万亿 token 的数据里长出模块。结果是,跑特定任务时你只用挑出 12.5% 的专家,性能就接近全模型水平;而同样架构、同样数据训出来的普通 MoE...

推荐理由:AllenAI 和 Hugging Face 放出的 EMO,是个 14B 总参数、1B 活跃参数的 MoE 模型,用 1 万亿 token 训练。亮点是跑任务时只激活 12.5% 的专家,推理成本压得很低。不过正文没披露具体 benchmark 成绩和路由策略细节,这点先别太激动。它更像一个研究发布,不是前沿模型发布,所以给 featured 低档。

5月5日星期二

r/LocalLLaMA

Hugging Face 发了个交互式指南,横向对比不同框架下的强化学习训练环境

Hugging Face 的后训练团队花了一个月,用 verifiers、OpenEnv、Nemo-Gym、OpenRewards 等几套框架分别搭了强化学习环境,然后实际训模型来看哪种方案在扩展时更顺手。他们把这个过程做成了交互式指南,方便你点进去对比。不过正文没给出具体的基准分数、模型规模或训练成本,所以没法判断哪套方案效果更好或更省钱,目前更像一...

推荐理由:我会先打个折:正文没给具体基准分数、模型规模和训练成本,所以没法判断哪个框架真的更省钱或更稳。但 Hugging Face 花一个月亲自下场踩坑,把不同 RL 环境框架的差异和扩展轴摆出来,对正在搭训练流程的团队有实操参考价值。这点先别太激动,等他们把量化结果补上才算完整。

4月30日星期四

r/LocalLLaMA

Qwen 发布 Qwen-Scope,用稀疏自编码器给 Qwen 3.5 模型做“内部体检”

Qwen 团队开源了 Qwen-Scope,这是一套针对 Qwen 3.5 系列(从 2B 到 35B MoE)的稀疏自编码器(SAE)。SAE 的作用是把模型内部那些纠缠在一起的激活信号拆解开,变成一个个相对独立的“特征”,方便人去看懂和调试。这次放出的 SAE 覆盖了模型所有层的残差流,还专门标出了一个叫 Feature #6159 的特征,跟中文...

推荐理由:我会先打个折:这不是新模型,所以重要性不会冲到顶。但 Qwen 官方放 SAE 这件事本身挺实在,等于给开发者开了个后门去看模型内部在想什么。覆盖范围从 2B 到 35B MoE,全层残差流都扫了,不是只挑几层做样子。Feature #6159 的例子也直观,能让人立刻联想到怎么用这些特征去修模型行为。唯一要留个心的是许可证里对移除安全过滤的态度,正文没细说具体限制条款,但既然提了,用的时候就得自己掂量。整体上,对做模型调试和可解释性的人来说,这是一份能直接上手试的工具级发布。

4月19日星期日

机器之心 · 公众号

MIA 记忆智能体框架:让 AI 干活不再“失忆”,边用边学

上海一个研究团队搞了个叫 MIA 的记忆框架,想让 AI 智能体在干活时能记住经验、持续进步,而不是每次重启都像失忆一样。它把记忆分成参数记忆和非参数记忆两种,用交替强化学习来更新,还支持边测试边学习。团队说在 7 个数据集上拿了最好成绩,但具体分数正文没给出来。核心思路是把记忆当成能力内化,不光是翻旧账。

推荐理由:我会先打个折:文章说在 7 个数据集上拿了最佳,但没放具体数字,也没说跟哪些基线比、差距多大,这点先别太激动。真正有意思的是思路——把记忆从“翻之前的缓存”升级成“边干活边内化能力”,用 Manager–Planner–Executor 架构和交替强化学习让模型在开放任务里持续变强。对做 Agent 的人来说,这个方向比刷榜更有看头,但复现细节和验证强度目前还看不清。