oMLX 作者加入 Hugging Face,专攻苹果芯片上的大模型推理
oMLX 的作者 Jun Kim 加入 Hugging Face,专职支持 MLX 社区。oMLX 是苹果 MLX 框架的扩展库,能让大模型在 Mac 上跑得更高效。正文没披露具体合作细节或后续计划。
oMLX 的作者 Jun Kim 加入 Hugging Face,专职支持 MLX 社区。oMLX 是苹果 MLX 框架的扩展库,能让大模型在 Mac 上跑得更高效。正文没披露具体合作细节或后续计划。
Hugging Face 和 Liquid AI 发了一份实操指南,拿 LFM2.5-350M 这个小模型做实验。他们用 TRL 库跑 GRPO(一种按组比较、挑好回答来优化的强化学习方法),只用了 500 条样本、训练 100 步,在免费 Colab GPU 上就能跑完。在 IFStruct 结构化输出基准上,模型按指定格式返回有效结果的比例从 22...
推荐理由:一份实操向的教程,数字具体、方法可复现,H 和 K 都站得住。但内容只对微调工程师有用,缺乏破圈潜力,R 不成立。放在 featured 档给 72 分合理。
Sentence Transformers v6.0 新增了 MultiVectorEncoder 模型类型,专门做 ColBERT 那种“晚交互”检索——也就是查询和文档各自编码成多个向量,最后再逐 token 算分,比单向量模型更精细。这篇博客手把手教你怎么微调这种模型,作者用一张 RTX 3090(24GB 显存)只跑了 14.5 小时,训练出一...
Gradio 新推出的 gr.Workflow 让你用节点图的方式搭 AI 流水线,每个中间步骤的结果都会直接显示在画布上,不用再靠打印日志来排查哪一步出了错。它同时也是一个 REST API,每个节点自带接口,一行命令就能部署到 Hugging Face Spaces。文章展示了四个可跑的 Demo:用 Qwen-Image-Edit 做图片编辑、把...
OpenAI 新开了一个叫“AI Futures”的博客,背后是一个小规模的战略未来团队。他们想研究一个核心问题:当国家可以用自动驾驶系统代替士兵警察去投射武力,用数据中心产出的收入代替从人身上收的税,个人在权力格局里的位置还剩多少。文章作者 Dean Ball 的观点是,哪怕投票、宪法这些形式都还在,只要权力不再需要大规模的人来配合和同意,人的自主权...
推荐理由:OpenAI 新开了一个叫“AI Futures”的博客,背后是一个小规模的战略未来团队,第一篇由 Dean Ball 执笔。文章没讲技术指标,而是提了一个很直白的问题:当国家不再需要大规模的人来配合和同意,就能靠自主系统投射武力和靠数据中心收租子,个人手里还剩什么牌。我会先打个折,这只是一篇博客开张,不是研究成果,正文也没给出具体推演路径,所以重要性卡在 78。但它的分析框架清晰,不是公关稿,值得从业者看一眼。
Hugging Face 搞了一场 19 天的黑客松,1200 多人带着 Claude Code、Codex 这类编程智能体,把 ICML 2026 接收的论文挑了 2226 篇来复现,覆盖了大会近三分之一。他们让智能体读论文、写代码、跑实验,然后汇报结果。一篇拿了 spotlight 的论文,审稿人自己承认没仔细检查证明,结果在这次复现里被抓住了真实...
推荐理由:Hugging Face搞了场大规模复现实验,让编程智能体读论文、写代码、跑结果,还顺手揪出一篇spotlight论文的证明错误。我会先打个折:正文只给了标题和摘要,复现成功率、智能体具体怎么干活这些关键数据都没披露,所以别急着下结论说智能体审稿靠谱。但光是这个规模和那个审稿人漏掉的错误,就足够让学界捏把汗了。
OpenAI 在 8 月 7 日公布,内部测试发现即将推出的模型 Astra 在自主编程和网络安全上进步明显,昨晚他们判断已经不能排除模型达到自家安全框架里的“高危”级别。这个级别意味着模型能自己找漏洞、写攻击程序,在没人帮忙的情况下攻破现实中加固过的系统,或者只给一个大致目标就能策划并执行全新的端到端攻击。OpenAI 确认 Astra 没参与之前 ...
推荐理由:OpenAI 在 8 月 7 号发了篇博文,说他们内部测试下一代模型 Astra 时,发现这模型在写代码和搞网络安全上进步太猛,已经踩到了自家安全框架里“高危”的红线。我会先打个折,因为正文没披露具体测试细节和样本量,但光凭 OpenAI 自己站出来说“我们还没发布的模型可能已经能自己找漏洞、攻破加固系统了”,这在行业里就是个大新闻。之前没哪个头部实验室这么干过,等于提前给整个圈子敲了警钟。文章里对“高危”的定义写得很清楚,不是空泛的担忧,而是给出了具体的能力描述,这对做安全对齐和关注政策的人有直接参考价值。
7 月 16 日,Hugging Face 公开了一次安全事件:一个全自动 AI 智能体系统通过恶意数据集侵入了他们的生产环境。攻击者利用了数据集处理流程里的两个漏洞——远程代码加载和模板注入——在数据处理节点上执行了代码,随后提权到节点级别,偷走了云服务和集群的凭证,并在一个周末内横向移动到了多个内部集群。整个攻击由智能体框架自动执行了数万次操作,指...
推荐理由:Hugging Face 官方自己披露的这次事件,是头一回有真实案例把全自动 AI 智能体攻击生产环境的完整链条摆出来。标题本身就够抓人,正文把漏洞细节、攻击步骤和影响范围都交代清楚了。三个维度全中:标题制造悬念,正文给出具体技术细节,而且直接关系到所有在 AI 平台上干活的人。我会先打个折——正文没披露攻击者身份和具体损失金额,但就凭这是首次公开的同类事件,重要性和紧迫感都拉满了。
Inkling 是一个总参数量约 1 万亿(975B)、每次推理激活 41B 参数的混合专家(MoE)模型,能直接吃进文字、图片和音频,支持 100 万 token 的上下文窗口。它用 45 万亿个多模态 token 训练,还内置了多 token 预测(MTP)投机解码层来加速推理。模型提供了 BF16 和压缩后的 NVFP4 两种版本,Hugging...
推荐理由:Thinking Machines 这家新面孔一上来就扔了个近万亿参数的多模态 MoE 模型,规格写得挺满:975B 总参、41B 激活、100 万上下文、45T token 训练量,还自带投机解码加速。硬指标和实用性都有料,所以 H 和 K 都站得住。但团队没品牌积累,没故事可讲,R 这块确实弱,大家会先打个折观望。
Hugging Face 上线了 Discover Tool,这是 ARD(代理资源发现)规范的一个参考实现。ARD 是一份由微软、谷歌、GoDaddy、Hugging Face 等共同起草的开放草案,解决的是当前代理生态里一个很实际的问题:现在用 MCP 工具、A2A 代理或技能,都得靠人提前写好配置、指定好地址,代理自己不会找。ARD 相当于在它们...
推荐理由:ARD 瞄准的是代理工具发现这个真实痛点,背后有微软、谷歌、Hugging Face 等跨厂商背书,还给了可用的参考实现。没打更高分是因为它目前还是开放草案,不是正式标准,文章也没说清楚谁会跟进落地、生态铺开要多久。
这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...
推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。
英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni,一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构(MoE),实际激活的参数量是 3B,配合 Conv3D 和 EVS 技术来处理音视频,上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下,跑 A...
推荐理由:NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里,还开放了权重和训练技术。我会先打个折:9 倍效率提升是跟谁比、测什么任务,正文没细说,这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置,加上直接上 Hugging Face 和 OpenRouter,对想用开源方案搭多模态 agent 的团队确实省事。单信源,信息够用但不算独家,所以放在 featured 里。
DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...
推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。
Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...
推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。
推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。
英伟达发了 Nemotron 3 Super,一个总参数量 120B、但每次推理只激活 12B 参数的混合专家模型。它用了混合 MoE、隐式 MoE 和一次预测多个 token 的技术,上下文窗口拉到 100 万 token。官方说在跑 agent 这类多步骤任务时,吞吐量比之前方案高 5 倍;如果搭配 Blackwell 的 NVFP4 精度,推理速...
推荐理由:这是一条扎实的模型发布消息,H、K、R 三点都踩中了。H 靠 5 倍吞吐这个具体承诺抓眼球;K 把参数量、激活量、上下文长度、训练规模和硬件对比都列清楚了,信息密度高;R 在于开放权重和配方,不是只给个模型让你猜。没给更高分是因为关键性能数据都来自 NVIDIA 自家博客,还没看到第三方验证,这点先别太激动。
Hugging Face 宣布 GGML 和 llama.cpp 的团队正式加入公司。Georgi Gerganov 和他的团队会继续把全部时间花在维护 llama.cpp 上,项目的技术方向和社区管理保持完全独立,不会变成闭源。这次合作最实际的变化是,他们会把 transformers 库里的模型定义更顺滑地接到 llama.cpp 里,目标是做到近...
推荐理由:我会先打个折:正文只说了团队加入和方向,没给时间表、团队规模和商业条款,所以别当成交割日来看。但这件事确实值得盯——HF 把 GGML/llama.cpp 团队收进来,等于把本地推理最核心的工程力量绑定了,同时承诺保持 100% 开源和社区自主。真正有意思的是技术对接:如果 transformers 的模型定义能一键落到 llama.cpp,对开发者来说省掉一大截适配工作。这点先别太激动,等他们真把“单击发布”做出来再说。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,可据此判断实时语音应用的选型空间。
NVIDIA 在 CES 上展示了两台桌面设备 DGX Spark 和 DGX Station,能在本地跑 1000 亿到 1 万亿参数的开源模型。DGX Station 有 775GB 的统一内存,可以把模型压缩到 NVFP4 格式,压缩率最高 70%,跑 llama.cpp 时推理速度平均提升 35%。现场还演示了每秒处理 25 万个 token ...
推荐理由:HKR 三项都站得住:桌面跑大模型的 hook 够强,性能数字和演示数据把事实撑住了,而且整件事指向本地开发闭环能不能替代部分云端迭代这个真问题。不过说到底这是英伟达的产品发布,性能证据都来自厂商自己的演示,我会先打个折,所以重要性停在 75 分。
NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...
推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...
Hugging Face 宣布和 VirusTotal 合作,开始持续扫描 Hub 上超过 220 万个公开的模型和数据集仓库。你打开仓库或文件页面时,Hub 会自动比对文件哈希值,从 VirusTotal 拉回该文件是否被标记为恶意、有多少家引擎报毒,以及相关的威胁情报。整个过程不会把原始文件内容发给 VirusTotal。这相当于在下载前多了一道安...
推荐理由:HKR 三项都站得住:220 万仓库的扫描规模、基于哈希的轻量集成方式、以及把威胁判断前移到下载环节,对从业者来说都是直接可用的信息。没进必写是因为正文没披露误报率、扫描延迟和后续处置流程,这几个缺口会让实际落地效果打个折扣,先别太激动。
AI Sheets 是一个开源表格工具,之前只能处理文字,现在加入了视觉能力。你可以把图片(比如收据、文档、产品图)直接拖进表格,用自然语言让模型帮你提取里面的信息、生成描述、甚至编辑图片。它背后调用的是 Inference Providers 上的几千个开源模型。你在表格里手动改错、点“赞”的操作,会被当成少样本示例来优化后续结果。处理完的数据可以导...
推荐理由:Hugging Face 给 AI Sheets 加了视觉能力,现在你可以在表格里直接分析图片、抽信息、生成和编辑图像。我会先打个折:正文没披露延迟和并发限制,实际用起来可能没那么丝滑。真正该盯的是它把视觉任务放进同一个数据清洗流,而且人工修正能自动变成 few-shot 数据,这点挺省钱。不过别太激动,这还是个工具层面的改进,没到改写规则的程度。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型给出双版本参数与 AIME2024 成绩,可据此判断其开源与商用定位。