跳到正文

#Hugging Face

今日 0 条

9月22日星期二

9月3日星期四

Hugging Face 博客

用 100 步 GRPO 微调 3.5 亿参数模型,结构化输出合规率从 22.6% 提到 29.7%

Hugging Face 和 Liquid AI 发了一份实操指南,拿 LFM2.5-350M 这个小模型做实验。他们用 TRL 库跑 GRPO(一种按组比较、挑好回答来优化的强化学习方法),只用了 500 条样本、训练 100 步,在免费 Colab GPU 上就能跑完。在 IFStruct 结构化输出基准上,模型按指定格式返回有效结果的比例从 22...

推荐理由:一份实操向的教程,数字具体、方法可复现,H 和 K 都站得住。但内容只对微调工程师有用,缺乏破圈潜力,R 不成立。放在 featured 档给 72 分合理。

8月26日星期三

Hugging Face 博客

Hugging Face 教你微调多向量嵌入模型:一张 RTX 3090、14.5 小时,就能在自家数据上打败通用检索器

Sentence Transformers v6.0 新增了 MultiVectorEncoder 模型类型,专门做 ColBERT 那种“晚交互”检索——也就是查询和文档各自编码成多个向量,最后再逐 token 算分,比单向量模型更精细。这篇博客手把手教你怎么微调这种模型,作者用一张 RTX 3090(24GB 显存)只跑了 14.5 小时,训练出一...

8月25日星期二

Hugging Face 博客

Gradio 出了个 gr.Workflow:把 AI 流水线变成能拖拽的画布,每一步结果都看得见

Gradio 新推出的 gr.Workflow 让你用节点图的方式搭 AI 流水线,每个中间步骤的结果都会直接显示在画布上,不用再靠打印日志来排查哪一步出了错。它同时也是一个 REST API,每个节点自带接口,一行命令就能部署到 Hugging Face Spaces。文章展示了四个可跑的 Demo:用 Qwen-Image-Edit 做图片编辑、把...

8月20日星期四

OpenAI News

OpenAI 成立战略未来团队,探讨 AI 会不会让普通人失去议价权

OpenAI 新开了一个叫“AI Futures”的博客,背后是一个小规模的战略未来团队。他们想研究一个核心问题:当国家可以用自动驾驶系统代替士兵警察去投射武力,用数据中心产出的收入代替从人身上收的税,个人在权力格局里的位置还剩多少。文章作者 Dean Ball 的观点是,哪怕投票、宪法这些形式都还在,只要权力不再需要大规模的人来配合和同意,人的自主权...

推荐理由:OpenAI 新开了一个叫“AI Futures”的博客,背后是一个小规模的战略未来团队,第一篇由 Dean Ball 执笔。文章没讲技术指标,而是提了一个很直白的问题:当国家不再需要大规模的人来配合和同意,就能靠自主系统投射武力和靠数据中心收租子,个人手里还剩什么牌。我会先打个折,这只是一篇博客开张,不是研究成果,正文也没给出具体推演路径,所以重要性卡在 78。但它的分析框架清晰,不是公关稿,值得从业者看一眼。

8月13日星期四

Hugging Face 博客

Hugging Face 用 1200 人加编程智能体复现了 2200 篇 ICML 论文,发现审稿人没空看的证明,复现时真查出了问题

Hugging Face 搞了一场 19 天的黑客松,1200 多人带着 Claude Code、Codex 这类编程智能体,把 ICML 2026 接收的论文挑了 2226 篇来复现,覆盖了大会近三分之一。他们让智能体读论文、写代码、跑实验,然后汇报结果。一篇拿了 spotlight 的论文,审稿人自己承认没仔细检查证明,结果在这次复现里被抓住了真实...

推荐理由:Hugging Face搞了场大规模复现实验,让编程智能体读论文、写代码、跑结果,还顺手揪出一篇spotlight论文的证明错误。我会先打个折:正文只给了标题和摘要,复现成功率、智能体具体怎么干活这些关键数据都没披露,所以别急着下结论说智能体审稿靠谱。但光是这个规模和那个审稿人漏掉的错误,就足够让学界捏把汗了。

8月7日星期五

OpenAI News

OpenAI 说未发布模型 Astra 可能摸到“高危”网络攻击门槛

OpenAI 在 8 月 7 日公布,内部测试发现即将推出的模型 Astra 在自主编程和网络安全上进步明显,昨晚他们判断已经不能排除模型达到自家安全框架里的“高危”级别。这个级别意味着模型能自己找漏洞、写攻击程序,在没人帮忙的情况下攻破现实中加固过的系统,或者只给一个大致目标就能策划并执行全新的端到端攻击。OpenAI 确认 Astra 没参与之前 ...

推荐理由:OpenAI 在 8 月 7 号发了篇博文,说他们内部测试下一代模型 Astra 时,发现这模型在写代码和搞网络安全上进步太猛,已经踩到了自家安全框架里“高危”的红线。我会先打个折,因为正文没披露具体测试细节和样本量,但光凭 OpenAI 自己站出来说“我们还没发布的模型可能已经能自己找漏洞、攻破加固系统了”,这在行业里就是个大新闻。之前没哪个头部实验室这么干过,等于提前给整个圈子敲了警钟。文章里对“高危”的定义写得很清楚,不是空泛的担忧,而是给出了具体的能力描述,这对做安全对齐和关注政策的人有直接参考价值。

7月16日星期四

Hugging Face 博客

Hugging Face 披露一起由全自动 AI 智能体发起的生产环境入侵事件

7 月 16 日,Hugging Face 公开了一次安全事件:一个全自动 AI 智能体系统通过恶意数据集侵入了他们的生产环境。攻击者利用了数据集处理流程里的两个漏洞——远程代码加载和模板注入——在数据处理节点上执行了代码,随后提权到节点级别,偷走了云服务和集群的凭证,并在一个周末内横向移动到了多个内部集群。整个攻击由智能体框架自动执行了数万次操作,指...

推荐理由:Hugging Face 官方自己披露的这次事件,是头一回有真实案例把全自动 AI 智能体攻击生产环境的完整链条摆出来。标题本身就够抓人,正文把漏洞细节、攻击步骤和影响范围都交代清楚了。三个维度全中:标题制造悬念,正文给出具体技术细节,而且直接关系到所有在 AI 平台上干活的人。我会先打个折——正文没披露攻击者身份和具体损失金额,但就凭这是首次公开的同类事件,重要性和紧迫感都拉满了。

7月15日星期三

Hugging Face 博客

Thinking Machines 发布 Inkling:一个万亿参数、原生多模态的开源模型

Inkling 是一个总参数量约 1 万亿(975B)、每次推理激活 41B 参数的混合专家(MoE)模型,能直接吃进文字、图片和音频,支持 100 万 token 的上下文窗口。它用 45 万亿个多模态 token 训练,还内置了多 token 预测(MTP)投机解码层来加速推理。模型提供了 BF16 和压缩后的 NVFP4 两种版本,Hugging...

推荐理由:Thinking Machines 这家新面孔一上来就扔了个近万亿参数的多模态 MoE 模型,规格写得挺满:975B 总参、41B 激活、100 万上下文、45T token 训练量,还自带投机解码加速。硬指标和实用性都有料,所以 H 和 K 都站得住。但团队没品牌积累,没故事可讲,R 这块确实弱,大家会先打个折观望。

6月17日星期三

Hugging Face 博客

Hugging Face 发布 ARD 发现工具,让 AI 代理能自己搜工具、技能和其他代理

Hugging Face 上线了 Discover Tool,这是 ARD(代理资源发现)规范的一个参考实现。ARD 是一份由微软、谷歌、GoDaddy、Hugging Face 等共同起草的开放草案,解决的是当前代理生态里一个很实际的问题:现在用 MCP 工具、A2A 代理或技能,都得靠人提前写好配置、指定好地址,代理自己不会找。ARD 相当于在它们...

推荐理由:ARD 瞄准的是代理工具发现这个真实痛点,背后有微软、谷歌、Hugging Face 等跨厂商背书,还给了可用的参考实现。没打更高分是因为它目前还是开放草案,不是正式标准,文章也没说清楚谁会跟进落地、生态铺开要多久。

6月3日星期三

NVIDIA 博客

NVIDIA 在 CVPR 发了三篇物理 AI 论文:抓取、自动驾驶和游戏里练出来的智能体

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。

4月29日星期三

NVIDIA 博客

英伟达发布 Nemotron 3 Nano Omni:一个模型同时看懂图文、听懂语音,做 AI 代理时吞吐量号称是同类 9 倍

英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni,一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构(MoE),实际激活的参数量是 3B,配合 Conv3D 和 EVS 技术来处理音视频,上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下,跑 A...

推荐理由:NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里,还开放了权重和训练技术。我会先打个折:9 倍效率提升是跟谁比、测什么任务,正文没细说,这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置,加上直接上 Hugging Face 和 OpenRouter,对想用开源方案搭多模态 agent 的团队确实省事。单信源,信息够用但不算独家,所以放在 featured 里。

4月24日星期五

Hugging Face 博客

DeepSeek-V4 发布:百万 token 上下文,这次是给干活用的 agent 准备的

DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...

推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。

4月23日星期四

Hugging Face 博客

在 Chrome 插件里跑本地 AI:一份给开发者的架构避坑指南

Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...

推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。

3月24日星期二

Mistral AI

Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。

3月12日星期四

NVIDIA 博客

英伟达开源 Nemotron 3 Super:120B 模型只激活 12B 参数,跑 agent 任务吞吐量翻五倍

英伟达发了 Nemotron 3 Super,一个总参数量 120B、但每次推理只激活 12B 参数的混合专家模型。它用了混合 MoE、隐式 MoE 和一次预测多个 token 的技术,上下文窗口拉到 100 万 token。官方说在跑 agent 这类多步骤任务时,吞吐量比之前方案高 5 倍;如果搭配 Blackwell 的 NVFP4 精度,推理速...

推荐理由:这是一条扎实的模型发布消息,H、K、R 三点都踩中了。H 靠 5 倍吞吐这个具体承诺抓眼球;K 把参数量、激活量、上下文长度、训练规模和硬件对比都列清楚了,信息密度高;R 在于开放权重和配方,不是只给个模型让你猜。没给更高分是因为关键性能数据都来自 NVIDIA 自家博客,还没看到第三方验证,这点先别太激动。

2月20日星期五

Hugging Face 博客

GGML 和 llama.cpp 团队加入 Hugging Face,本地跑大模型的项目会继续独立运营

Hugging Face 宣布 GGML 和 llama.cpp 的团队正式加入公司。Georgi Gerganov 和他的团队会继续把全部时间花在维护 llama.cpp 上,项目的技术方向和社区管理保持完全独立,不会变成闭源。这次合作最实际的变化是,他们会把 transformers 库里的模型定义更顺滑地接到 llama.cpp 里,目标是做到近...

推荐理由:我会先打个折:正文只说了团队加入和方向,没给时间表、团队规模和商业条款,所以别当成交割日来看。但这件事确实值得盯——HF 把 GGML/llama.cpp 团队收进来,等于把本地推理最核心的工程力量绑定了,同时承诺保持 100% 开源和社区自主。真正有意思的是技术对接:如果 transformers 的模型定义能一键落到 llama.cpp,对开发者来说省掉一大截适配工作。这点先别太激动,等他们真把“单击发布”做出来再说。

2月5日星期四

Mistral AI

Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。

推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,可据此判断实时语音应用的选型空间。

1月6日星期二

NVIDIA 博客

NVIDIA 把跑千亿参数大模型的机器塞进了桌面

NVIDIA 在 CES 上展示了两台桌面设备 DGX Spark 和 DGX Station,能在本地跑 1000 亿到 1 万亿参数的开源模型。DGX Station 有 775GB 的统一内存,可以把模型压缩到 NVFP4 格式,压缩率最高 70%,跑 llama.cpp 时推理速度平均提升 35%。现场还演示了每秒处理 25 万个 token ...

推荐理由:HKR 三项都站得住:桌面跑大模型的 hook 够强,性能数字和演示数据把事实撑住了,而且整件事指向本地开发闭环能不能替代部分云端迭代这个真问题。不过说到底这是英伟达的产品发布,性能证据都来自厂商自己的演示,我会先打个折,所以重要性停在 75 分。

NVIDIA 博客

NVIDIA 一口气开源了一堆模型、数据和工具,覆盖智能体、机器人、自动驾驶和生物医药

NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...

推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...

2025年10月22日星期三

Hugging Face 博客

Hugging Face 接入 VirusTotal,给 Hub 上 220 万个模型和数据集仓库做恶意文件扫描

Hugging Face 宣布和 VirusTotal 合作,开始持续扫描 Hub 上超过 220 万个公开的模型和数据集仓库。你打开仓库或文件页面时,Hub 会自动比对文件哈希值,从 VirusTotal 拉回该文件是否被标记为恶意、有多少家引擎报毒,以及相关的威胁情报。整个过程不会把原始文件内容发给 VirusTotal。这相当于在下载前多了一道安...

推荐理由:HKR 三项都站得住:220 万仓库的扫描规模、基于哈希的轻量集成方式、以及把威胁判断前移到下载环节,对从业者来说都是直接可用的信息。没进必写是因为正文没披露误报率、扫描延迟和后续处置流程,这几个缺口会让实际落地效果打个折扣,先别太激动。

2025年10月21日星期二

Hugging Face 博客

Hugging Face 的 AI Sheets 现在能直接处理图片了

AI Sheets 是一个开源表格工具,之前只能处理文字,现在加入了视觉能力。你可以把图片(比如收据、文档、产品图)直接拖进表格,用自然语言让模型帮你提取里面的信息、生成描述、甚至编辑图片。它背后调用的是 Inference Providers 上的几千个开源模型。你在表格里手动改错、点“赞”的操作,会被当成少样本示例来优化后续结果。处理完的数据可以导...

推荐理由:Hugging Face 给 AI Sheets 加了视觉能力,现在你可以在表格里直接分析图片、抽信息、生成和编辑图像。我会先打个折:正文没披露延迟和并发限制,实际用起来可能没那么丝滑。真正该盯的是它把视觉任务放进同一个数据清洗流,而且人工修正能自动变成 few-shot 数据,这点挺省钱。不过别太激动,这还是个工具层面的改进,没到改写规则的程度。

2025年6月10日星期二

Mistral AI

Mistral AI 发布首款推理模型 Magistral,含 24B 开源版与企业版

Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。

推荐理由:Mistral 首款推理模型给出双版本参数与 AIME2024 成绩,可据此判断其开源与商用定位。