跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 61–80 条 · 共 329 条

8月14日星期五

Hacker News 首页

GLM-5.3:只靠后期训练,把开源模型的编程和漏洞利用能力拉到一线

GLM-5.3 和上一代用的是同一个基座模型,所有提升全来自后期训练。编程能力在内部 Z.ai Code Bench 上比 5.2 高了 50%,Terminal Bench 3.0 从 4.6 分跳到 28.3 分。更意外的是漏洞利用能力涨得比预期快:ExploitGym 2 小时得分从 29 涨到 105,6 小时从 39 涨到 130。团队把原因...

推荐理由:GLM-5.3 和上一代用同一个基座,所有提升全靠后期训练。编程分涨了50%,终端操作从基本不会(4.6分)变成能干活(28.3分)。更扎眼的是漏洞利用:2小时得分从29跳到105,6小时从39跳到130。团队自己说这块能力涨得比预期快,我会先打个折——内部评测的绝对值不能直接跟外部基准比,但涨幅摆在那里。正文没披露后期训练具体用了什么方法和数据,这点信息缺口挺大。

8月13日星期四

Latent Space

xAI 发布 Grok 4.6 和 Grok Bot,AI 同事赛道来了个狠角色

xAI 一口气发了两个东西:新模型 Grok 4.6,和一个能直接登你的工具、像人一样操作、最后交活儿的早期测试版 Grok Bot。Grok 4.6 是个 1.5 万亿参数的模型,在 AA-Briefcase 这个知识工作基准测试里,分数跟 GPT-5.6 Sol Max 差不多,但便宜一大截:输入每百万 token 2 美元,输出 6 美元。训练上...

推荐理由:Grok 4.6 在知识工作基准上追平 GPT-5.6 Sol Max,价格却砍到零头,这个性价比信号很强。同时发布的 Grok Bot 直接杀进 AI 队友战场,背后是前 Cursor 团队,早期口碑还行。没给更高分是因为 Bot 还在早期测试,正文没披露具体完成率和稳定性数据,实际干活能力得再观察。

Computing Life · Share · 鸭哥调研

DeepSeek 开源 DSH:把 agent 的控制循环做成了可热插拔的插件,为 AI 自进化铺路

DeepSeek 在 8 月 13 日开源了它的第一个 agent harness,叫 DSH。它跟 Codex、Claude Code 这些现有工具最大的不同,是把 agent 的核心控制循环(agent loop)本身做成了一个可以在运行中随时替换的插件。这意味着,AI 在干活时不仅能调用新工具,理论上还能给自己换一套全新的思考或协作流程。为了支撑...

推荐理由:DSH 把 agent 的控制循环做成了运行时可替换的插件,这确实是个架构层面的新想法,不是营销话术。但这篇文章是第三方分析,不是官方发布,DSH 目前也没有任何生产环境的验证记录,所以按规则先打个折,归到较低一档。

AI HOT 精选

阿里首次把 Qwen-Max 级别的模型权重放出来了,总参数 2.4 万亿,每次只激活 950 亿

阿里 Qwen 团队开源了 Qwen3.8-2.4T-A95B,这是他们第一次把云端最强模型级别的权重直接公开。模型用了混合专家架构,总共 2.4 万亿参数,但每次计算只激活其中的 950 亿,所以跑起来比同体量的稠密模型省算力。它原生支持 26 万多 token 的上下文,能一口气处理整本小说,还能扩展到 101 万 token。训练时加入了多 to...

推荐理由:阿里第一次把云端旗舰模型完整开源,2.4T MoE、激活95B、原生256K上下文,这几个指标放在一起分量很重。三个维度都踩中了:头部大厂罕见动作、技术上有具体新东西、对国内开发者生态有直接拉动。没给更高分是因为目前只有公告,还没看到第三方实测跑分和实际部署反馈,我会先打个折,等社区验证了再往上调。

8月12日星期三

Hugging Face 博客

Liquid AI 开源 LFM2.5-VL-3B,一个能在本地跑的视觉语言模型,主打屏幕理解和工具调用

Liquid AI 放出了 LFM2.5-VL-3B,一个 30 亿参数的视觉语言模型,可以直接在你自己的电脑或手机上跑。它不搞长链条推理,直接给答案,适合需要实时响应的场景。这次主要升级了四个能力:能看懂各种设备的屏幕界面、用自然语言圈出图片里的物体、同时理解多张图片,以及大幅强化了工具调用(不管带不带图片都能用)。官方给了跑分对比和 CPU/GPU...

推荐理由:Liquid AI 发了一个30亿参数的视觉模型,主打本地推理和实时响应,给了四个明确的能力升级和跑分对比。H 和 K 都踩中了,但品牌号召力在视觉领域偏弱,R 没起来,分数刚好卡在 featured 门槛上。

Hacker News 首页

Nvidia 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard:一个 300 亿参数的小模型,专跑多智能体系统里的专...

Nvidia 给 Nemotron 3 系列加了个新模型 Nemotron 3.5 Lightning,300 亿参数,用的是混合专家架构(MoE,把模型拆成多个小专家,每次只激活一部分,省算力)。它不负责统筹全局,而是在多智能体系统里干代码审查、安全告警监控这类专项高并发的活。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%。模型...

推荐理由:Nvidia 这次没走通用大模型的路子,而是发了个 30B 的 MoE 模型 Nemotron 3.5 Lightning,定位是多智能体系统里的专项工人,比如做代码审查、监控安全告警。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%,还开源了调度工具 NeMo Switchyard。我会先打个折——这些数字都来自 Nvidia 自己的博客,没有第三方实测,而且 Nvidia 的模型生态在开发者里的实际采用率远不如几家头部 lab。但“给智能体系统做专项加速”这个思路本身值得关注,对正在搭多智能体工作流的人是个可参考的选项。

8月11日星期二

Mistral AI

Mistral 推出区域推理端点与 Priority Tier,并接入 GLM-5.2 等第三方开源模型

Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

推荐理由:Mistral 把区域推理端点、SLA 服务层级与第三方开源模型接入放在同一套基础设施上,读者可据此判断欧洲主权 AI 的落地路径。

8月10日星期一

Hacker News 首页

扎克伯格点名 OpenAI 和 Google,说封闭模型玩不过开源,Meta 下一代 Llama 继续全开源

扎克伯格在内部会议上直接点名 OpenAI 和 Google,认为长期来看开源模型会赢。他确认 Meta 的下一代 Llama 会保持完全开源,同时把 AI 团队打散并入产品部门,想加快发布节奏。具体发布时间和模型参数都没说。

推荐理由:扎克伯格内部讲话直接点名 OpenAI 和 Google,确认 Llama 会继续完全开源,还透露 AI 团队正被并入产品组。冲突感、组织变动和明确立场,三条都占全了。不过具体发布时间和模型参数都没说,所以我会先打个折,给到 78 分。

AI HOT 精选

SGLang 第一时间适配 Meta 的本地智能体模型 Muse Glimmer,单卡 RTX 5090 跑到每秒 1452 个 token

Meta 发布了 Muse Glimmer,一个 300 亿参数的多模态模型,专门为在本地硬件上跑智能体工作流设计。SGLang 推理框架在发布当天就提供了支持,并做了针对性优化。在单张 RTX 5090 显卡上,用 NVFP4 量化格式搭配 DFlash 投机解码技术,每个用户的解码速度能达到每秒 236 个 token,总吞吐量冲到每秒 1452 ...

推荐理由:Meta 发新模型本身是行业事件,但这篇文章的重点是 SGLang 的推理优化,不是模型本身。好在性能数字够硬,236 tok/s 和 1452 tok/s 这两个数让它的信息密度够上 featured。不过受众窄,只对搞本地推理的人有吸引力,所以 r 给了 false。

Hacker News 首页

Meta 开源 Muse Glimmer:一个能在本地单 GPU 上跑的 30B agent 模型

Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了。这是一个 30B 参数的模型,专门为常驻本地的 agent 工作流设计,小到能在 Mac 或 PC 的单张消费级显卡上跑。用 4-bit 量化能把模型压到 20 GB 以下,在 24 GB 或 32 GB 显存里还能留出空间给 KV cache 和视觉编码器。训练上,...

推荐理由:Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了,一个 30B 参数、专为本地 agent 工作流设计的模型。4-bit 量化后不到 20 GB,能在单张消费级显卡上跑,还留出显存给 KV cache 和视觉编码器。定位很明确——不是通用聊天模型,而是常驻本地的 agent 引擎。我会先打个折:目前只有发布博客的信息,没有第三方跑分和实际部署反馈,所以分数没往上拉。但开源协议、显存占用和本地 agent 这个组合,对自部署和隐私敏感场景确实有吸引力。

AI HOT 精选

NVIDIA 开源 NemotronLabs VoiceChat 11B:一个模型搞定语音对话,抢话延迟约 450 毫秒,还能边聊边调工具

NVIDIA 把 NemotronLabs VoiceChat 11B 的权重和代码都公开了。这是一个 110 亿参数、端到端的语音模型,不再走传统的“语音识别转文字、大模型思考、文字转语音”流水线,而是把听和说塞进同一个网络里流式处理。实测抢话反应延迟是 448 毫秒,基本跟人对话的节奏差不多。它支持全双工,也就是双方可以同时说话、随时打断,模型能实...

推荐理由:NVIDIA 这次把 NemotronLabs VoiceChat 11B 完整开源,448 毫秒的打断反应时间和全双工能力是硬指标,不是刷榜。但原文像产品发布稿,没有第三方对比测试,也没说清楚工具调用在嘈杂环境下的成功率。我会先打个折:技术方向对,实际落地效果还得等社区跑完分再看。

8月8日星期六

AI HOT 精选

腾讯混元把自家线上推理用的高性能算子开源了,并合进了 SGLang 主干

腾讯混元 AI Infra 团队把他们在生产环境里打磨的 Attention、Router GEMM 和 MoE 算子打包成 HPC-Ops 开源,并直接合入了 SGLang 的主分支。这些算子专门针对混合专家模型(MoE)推理里的三个性能瓶颈:解码时不同请求的上下文长度差异巨大,静态分配计算任务会导致 GPU 空等;路由计算对精度敏感,算得不准会选错...

推荐理由:腾讯混元把自家生产环境里打磨的 Attention、Router GEMM 和 MoE 算子开源,直接合进了 SGLang 主分支。三个优化分别解决 MoE 推理时不同请求混跑导致的 GPU 空等、路由计算精度与速度的取舍、以及内存搬运和计算串行的问题,每个点都给了具体的技术做法。对做推理部署的人来说,代码已经在主流框架里,拉下来就能用,实用价值高。不过正文没给出具体的性能对比数字,这点先别太激动,得自己跑一下看实际收益。

Hacker News 首页

Oracle 禁止外部贡献者往 OpenJDK 提交 AI 生成的代码,但自家老板却说公司代码已经是 AI 在写了

Oracle 给 OpenJDK 社区立了新规矩:你可以私下用大模型辅助调试和审查代码,但别把 AI 生成的代码提交到仓库或合并请求里,理由是安全、可靠性和知识产权风险。这跟公司内部的口径完全相反——创始人 Larry Ellison 刚说过 Oracle 的代码现在由 AI 模型来写,联席 CEO Mike Sicilia 也夸 AI 工具让小团队交...

推荐理由:这条新闻最抓人的点就是 Oracle 自己打自己脸——一边在财报会上吹 AI 写代码多牛,一边在开源项目里把 AI 生成的代码当毒药。禁令本身不是空泛的抵制,而是给了具体边界:私下调试审查可以,但别把 AI 吐出来的东西直接塞进仓库。理由也说得直白,就是怕安全漏洞、版权纠纷和代码不可靠。对从业者来说,这不是一个简单的政策更新,而是把大公司内部对 AI 代码的真实态度撕开了一个口子:嘴上说全用,实际在关键项目上根本不敢放行。正文没披露 Oracle 或 OpenJDK 维护者的直接声明,所以先别急着下结论说社区会炸锅,但这个矛盾本身已经够值得关注了。

8月7日星期五

Hacker News 首页

Herdr 加入 YC F26,开源 agent 运行时继续免费

Herdr 是一个让命令行编程 agent 持久运行、跨机器不掉线的运行时和终端界面。独立开发者 Can Celik 一个人把它做到了 2.5 万 GitHub 星标和 34 万次下载,现在决定加入 Y Combinator 的 F26 批次,把它做成一家公司。运行时本身继续用 Apache-2.0 协议免费开放,核心保持小巧,其他功能全走插件——目前...

推荐理由:独立开发者把命令行 agent 运行时做到 2.5 万星标、34 万次下载,然后加入 YC F26,同时核心继续用 Apache-2.0 开源。故事有对比、有数字、有开源承诺,对 agent 开发者有参考价值。扣分项:这只是一篇博客公告,不是产品发布,正文没披露 YC 之后的具体商业化路径。

AI HOT 精选

谷歌、亚马逊、微软等联手发布 Agent Plugins 1.0.0,统一智能体插件的打包格式

Agent Plugins 1.0.0 是一个开源、不绑定厂商的规范,用来把智能体的技能(Agent Skills)和 MCP 服务器(给模型调外部工具的服务)打包成一个可移动的目录。谷歌加入了由亚马逊、Cursor、微软、OpenAI 和 Vercel 组成的核心维护组。这个格式刻意做得很轻:plugin.json 只声明名字和规范版本,技能放在 s...

推荐理由:五家大厂联手推一个统一的 agent 插件规范,跨源信号很强,对生态有实际影响。但毕竟只是规范发布,不是能跑的产品,落地效果还得看,所以分数先打个折,定在 78。

8月6日星期四

Hacker News 首页

Prime Intellect 开源 Prime Agent:让模型自己管上下文、调工具、派子代理的编程外挂

Prime Intellect 把 Prime Agent 完整开源了,一条 curl 命令就能装。这东西本质上是个给代码模型用的外挂框架,核心做了两件事:一是把上下文当成变量、把调用子代理当成函数,让模型在一个常驻的 IPython 环境里自己写程序操作自己的记忆和工具,这样跑再久也不会弄丢之前的信息;二是允许模型在运行过程中随时增删改自己的提示词、...

推荐理由:Prime Intellect 开源了一个代码代理框架,架构上有个明确的钩子:让模型在常驻 IPython 环境里把自己的记忆和提示词当成可编程的东西来操作。H 和 K 都打中了——安装门槛低、设计思路清晰,对 agent 开发者是实打实的参考。R 偏弱,因为 Prime Intellect 本身不是顶级实验室,身份带来的传播力有限。整体符合 featured 标准。

8月5日星期三

Hacker News 首页

一块 8 美元的 ESP32-S3 单片机,自己跑完了一个字符级 Transformer 的完整训练

这个项目把训练循环整个塞进了一颗 8 美元的 ESP32-S3 芯片里,不是只做推理,连反向传播都是用 C 语言手写的。代码库只提交了 6 次,没公布参数量、数据集大小和训练时长,所以别把它当实用工具看。它更像一个极限工程演示——在单片机上把模型训练跑通,这件事本身就够疯。

推荐理由:在 8 美元的 ESP32-S3 上跑完整训练循环,连反向传播都用 C 手写,这是个极限工程演示,H 和 K 都拉满。但仓库只有 6 次提交,参数量、数据集大小、训练时长一概没提,实用价值几乎为零,R 不成立。给 72 分放在 featured 档,是因为这件事够疯,但信息缺口太大,我会先打个折。

Hacker News 首页

Flowise 宣布停止开发,仓库将在 8 月归档

Flowise 团队发公告说他们要关停项目了。他们观察到开发者现在更倾向用 Claude Code 这类能直接写代码的 AI 助手来处理复杂任务,而 Flowise 这种拖拽式的低代码工作流一碰到复杂逻辑就容易卡住。具体时间线是:7 月 29 号冻结代码,不再合并新功能;8 月 10 号把 GitHub 仓库归档,虽然代码还能看,但 issue 和 P...

推荐理由:Flowise 关停不是普通的产品下架,它是一个标志性开源项目主动承认被代码助手取代。团队没找借口,直接说拖拽式低代码处理复杂任务时力不从心,而 Claude Code 这类工具更灵活。这个判断来自一线开发者自己的观察,比第三方分析更有说服力。我会先打个折:公告里没提用户量、收入这些数据,所以关停到底是趋势使然还是项目自身运营问题,正文没披露。但即便如此,一个知名项目用关停来印证行业转向,对从业者的参考价值很高,值得放在 featured 位置。

AI HOT 精选

LLM 0.32 发布:推理过程能看见了,日志不再重复存长文本,还接入了 OpenAI 和 Anthropic 的服务端工具

Simon Willison 发布了 LLM 0.32,这是项目发布以来最大的一次更新。现在跑推理模型时,模型的“思考过程”会输出到 stderr,不会混进标准输出里,方便你把干净结果直接管道给其他工具。新默认模型换成了便宜够用的 GPT-5.6 Luna。工具调用方面,可以直接用 OpenAI 的代码解释器和网页搜索,Anthropic 插件也补上了...

推荐理由:LLM 0.32 是一次对开发者真正有用的更新,推理轨迹隔离和内容寻址日志都是实打实的体验提升。没给更高分是因为它属于工具层改进,不是模型能力或行业格局变化。

8月4日星期二

Hacker News 首页

Soup:一个命令就能在 4GB 显存的笔记本上微调 8B 模型

Soup 把大语言模型的微调流程打包成一个命令行工具,最低只要 4GB 显存就能跑。它底层用了 QLoRA(一种省显存的微调方法)和 Unsloth 加速,支持 Llama、Mistral、Qwen 这些主流的 8B 模型。你准备好 JSONL 格式的数据集,写一个 YAML 配置文件,敲一句 `soup run` 就开始训练了。训练完还自带一个 St...

推荐理由:一个把 QLoRA 微调压到 4GB 显存、一句命令跑通的工具,实用性和知识性都到位,正好卡在 featured 门槛。但项目太新,没有社区验证或真实场景的 benchmark,争议性为零。如果后续有人贴出训练效果对比或社区开始用起来,分数会更有支撑。