跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 281–300 条 · 共 329 条

4月29日星期三

r/LocalLLaMA

商汤发布 SenseNova-U1:一个原生架构同时搞定看图理解和生图,不再靠外挂适配器

商汤放出了 SenseNova-U1 系列,主打“原生统一多模态”,意思是模型内部直接处理文字和图像,不用再像以前那样给语言模型外接一个图像适配器来翻译视觉信息。这次公开了 8B 和 A3B 两种 MoT(Mixture of Tokens)规格的权重,其中 A3B 的参数量更小,适合本地跑。官方说法是这套架构把视觉理解和生成塞进了同一个模型里,但 R...

推荐理由:HKR 三项都踩实了:单体架构替代适配器这个思路有看头,4 个 MoT 模型加开源权重是实打实的新料,本地可跑的多模态模型正好戳中当下热点。但正文没给任何基准分,来源又是 Reddit,信息缺口明显,所以分数压在 74 这个 featured 门槛上,先别急着往上抬。

X · @dotey(宝玉)

微软开源语音模型 VibeVoice-ASR 实测:一小时播客 8 分 45 秒转完,但 32GB 内存的 Mac 跑不动

Simon Willison 在 128GB 内存的 M5 Max MacBook Pro 上跑了社区做的 4-bit 量化版 VibeVoice-ASR,模型大小 5.71GB。转写一小时播客用了 8 分 45 秒,prefill 阶段内存峰值冲到 61.5GB,生成阶段稳定在 18GB 左右,所以普通 32GB 笔电基本没戏。这个 9B 参数模型最...

推荐理由:这篇不是新模型发布,而是 Simon Willison 拿微软 1 月开源的 VibeVoice-ASR 在自己机器上跑了一遍,给出了速度和内存的实测数字。我会先打个折:这只是单次测试,不代表所有场景,但 61.5GB 的内存峰值确实把 32GB 笔电劝退了,这点对想本地部署的人很关键。正文没提准确率对比,所以别当全面评测看,就当一份硬件门槛参考。

r/LocalLLaMA

小米放出 MiMo-V2.5:3100 亿总参数,每次只激活 150 亿的稀疏 MoE 模型

Reddit 上有人贴了小米 MiMo-V2.5 的 Hugging Face 链接,不是 Pro 版。架构是稀疏 MoE,总参数量 310B,每次推理只激活 15B 参数,相当于用 150 亿参数模型的计算量去撬动一个 3100 亿参数的知识容量。发帖人说它比更大的兄弟模型用了更“人性化”的配置,但正文没展开什么叫人性化,也没给显存需求、量化方案或跑...

推荐理由:这条消息的钩子很实在:310B 总参数但每次只激活 15B,意味着理论上比同体量稠密模型省资源,官方也说它比更大版本更适合普通配置跑。我会先打个折——正文只贴了个 Hugging Face 地址,没给显存占用、量化方式、任何基准测试,所以“普通配置”到底指什么配置完全不清楚。这点先别太激动,等实测数据出来再判断值不值得本地部署。

X · @dotey(宝玉)

AI 终端 Warp 把客户端代码开源了,OpenAI 是创始赞助商

Warp 是一个用 Rust 写的现代终端,有超过 70 万开发者用,核心卖点是把 AI 塞进命令行,你用自然语言说想干嘛,它帮你生成命令。这次开源的是客户端代码,走 AGPL 协议,服务端还是闭源的。比较特别的是他们的社区贡献流程:Warp 自家的云端 AI 平台 Oz 负责写代码、做规划、跑测试,人主要负责提想法和验证,等于在跑一个“人管方向、AI...

推荐理由:Warp 这次开源的是客户端代码,走 AGPL 协议,服务端没动,所以别理解成整个产品都开源了。OpenAI 当创始赞助商是个信号,但正文没展开双方具体怎么合作。真正有意思的是他们提的“人管方向、AI 干活”的贡献流程,不过目前还只是说法,没看到跑起来的例子。70 万开发者的数字说明用户盘子不小,Rust 重构也加分。整体是条扎实的开发者工具动态,不是模型或能力层的重大发布。

4月28日星期二

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

量子位 · 公众号

商汤开源 SenseNova-U1:不卷参数卷架构,把图像理解和生成塞进同一个模型

商汤放出了两个开源模型 SenseNova-U1,一个 8B 参数,另一个是总参数量 38B 的 MoE 版本,都用了一套叫 NEO-unify 的架构。它砍掉了传统的视觉编码器和 VAE,直接处理像素,在单张 H100 或 H200 上大概 9 秒能生成一张 2048×2048 的图。核心卖点是图文交错推理,也就是模型能边看文字边看图、边想边出图。不...

推荐理由:我会先打个折:正文没给图文交错思维链的具体效果和长文字渲染的实测,32K 上下文和连续图文 beta 也还是限制,别当成熟方案用。但去掉 VE/VAE 的像素直出设计确实有意思,9 秒出 2048 图的成本听着挺省,开源出来对做多模态的团队是个可拆可改的底子。

Hacker News 首页

小米开源 MiMo-V2.5-Pro,写代码的跑分紧挨着 Claude Opus 4.6

小米把 MiMo-V2.5-Pro 的模型权重放出来了。标题说它的编程能力在跑分上和 Claude Opus 4.6 差不多,文章举了个例子:北大计算机系的编译器大作业,学生通常要花几周,这个模型 4.3 小时跑完,233 个隐藏测试全过。V2.5-Pro 相比之前的 Flash 版,主要提升了长任务连贯性、能处理超过一千步的复杂任务,以及让模型进业务...

推荐理由:HKR 三项都通过,因为小米发编程/Agent 权重本身是实打实的动作,从业者会想看一眼。但信息缺口很大:没参数、没许可、没具体分数,只有标题说表现突出,所以我会先打个折,重要性停在 74 分 featured 门槛附近。

X · @op7418(歸藏)

小米把 MiMo-V2.5 系列模型全开源了,MIT 协议,随便商用和魔改

小米这次放出的 MiMo-V2.5 系列模型用了 MIT 开源协议,你可以直接拿来商用、做二次训练和微调,不用再额外申请授权。正文没披露模型参数量和跑分成绩,这点先别太激动。同时他们还搞了个 Orbit 100T Token 计划,分两块:一块是给 AI builder 的激励,申请通过最高能拿到 16 亿 Credits,价值 659 元;另一块是给...

推荐理由:这条消息对 AI builder 有实际价值:MIT 协议意味着可以放心商用和微调,Orbit 计划给的 Credits 额度不小,659 元的标价也算低。但我会先打个折——正文完全没提模型参数量、性能跑分,连基础尺寸都不知道,没法判断模型本身强不强。这点先别太激动,等评测出来再看。整体属于有料但缺关键验证,放在 featured 合适。

r/LocalLLaMA

微软放出 TRELLIS.2:一个开源 40 亿参数图生 3D 模型,能直接出带贴图的资产

微软在 Reddit 上发了个帖子,标题信息量挺大,但帖子正文被 403 屏蔽了,看不到具体细节。从标题看,TRELLIS.2 是个开源的图生 3D 模型,参数量 40 亿。它能生成最高 1536³ 分辨率的 PBR 纹理资产,也就是带物理渲染材质的 3D 模型,不是白模。技术路线上,它用了原生 3D VAE 做 16 倍空间压缩,这通常意味着生成效率...

推荐理由:标题信息量不小,但正文因为 Reddit 403 拿不到论文链接、许可证和具体评测,所以只能按标题给的事实来写。我会先打个折:1536³ 的 PBR 资产听起来挺省钱,但没看到跟现有方法的对比,这点先别太激动。40 亿参数配上 16 倍空间压缩,理论上推理会快一些,不过没实测数据就不好说实际延迟。整体判断挂在微软开源这个动作上,信息缺口是缺论文和基准,所以分数停在 featured 的底线。

4月27日星期一

Hacker News 首页

Utilyze 开源 GPU 监控工具,说比 nvtop 更准,能看出显卡是真忙还是在摸鱼

Systalyze 开源了一个叫 Utilyze 的 GPU 监控工具,专门解决 nvidia-smi 和 nvtop 那个老毛病:它们只告诉你显卡“有没有在干活”,不告诉你“干得有多满”。比如 H100 有 132 个流式多处理器、一万七千多个核,但只要有一个核在跑,利用率就敢报 100%,实际算力可能才用了 1%。Utilyze 会直接算你的 GP...

推荐理由:这篇抓住了 GPU 监控里一个很常见的坑:传统工具只看二值占用,不看有效计算效率。对跑生产负载的人来说,知道真实吞吐上限比看仪表盘数字重要得多。我会先打个折,因为工具来自一个还没被广泛验证的团队,正文也没披露具体开销有多“可忽略”,但选题和解释都到位,放在 featured 没问题。

Hacker News 首页

Dirac 这个开源编程助手在 TerminalBench 上拿了第一,靠的是省 token 和并行操作

Dirac 是一个专门抠上下文效率的编程助手,刚在 TerminalBench 上跑分拿了第一,用的模型是 Gemini-3-flash-preview。它说自己能把 API 调用成本压到其他同类工具的 20% 到 50%,主要靠三招:用哈希锚点来精准定位代码修改位置、把能并行的操作全并行跑、直接操作抽象语法树而不是整段重写。不过正文没披露 Termi...

推荐理由:HKR 三项都站得住:一个开源编程智能体声称在 TerminalBench 上拿了第一,还给出了具体模型和成本降幅,技术细节也没藏着。不过分数我压到 78,因为目前只有仓库自述,完整榜单分数和复现日志都没放出来,先别太激动。

OpenAI News

OpenAI 开源了一套叫 Symphony 的规范,把项目管理看板变成 AI 编程 agent 的指挥中心

OpenAI 放出了 Symphony,一个开源的 agent 编排规范。它的核心思路是把 Linear 这类任务看板当成控制面板,每个待办任务都会自动分配一个编程 agent 去干活,人只负责最后审查结果。OpenAI 内部团队用上后,合并的 PR 数量三周内涨了五倍。工程师不用再同时盯着好几个 agent 会话,避免了频繁切换上下文的痛苦。agen...

推荐理由:H 和 R 都站得住:OpenAI 开源一个 Codex 编排规范,对 agent 工作流有直接关联,issue 变常驻 agent 的设想也够具体。K 这边我会先打个折,因为许可、接口、可复现的机制全都没披露,现在只能当个方向性信号看,别太激动。

4月25日星期六

Hacker News 首页

Stash 开源了一个 AI 记忆层,让任何智能体都能记住你是谁、聊过什么、踩过哪些坑

Stash 是一个开源的持久化记忆层,用 PostgreSQL 加 pgvector 做存储,给 AI 智能体配了 28 个 MCP 工具和一套 6 步处理流水线。它跟外挂资料库(RAG)不一样:RAG 只会翻文档,Stash 会从对话里自动提炼事实、建知识图谱、跟踪目标和失败记录,还能发现前后矛盾的地方。记忆按层级命名空间分桶,用户、项目、智能体自省...

推荐理由:我会先打个折:这是个独立开发者的开源基础设施项目,不是大厂或平台级发布,所以分数停在 featured 低段。但 HKR 三项都站得住。钩子不是“像 ChatGPT 一样记住你”的标题党,而是把记忆层做成可移植的中间件,任何 agent 都能接。正文给了足够的技术细节,28 个工具、6 个阶段、pgvector 存储和命名空间隔离,架构看得见。对 agent 开发者来说,长期记忆、上下文成本和供应商锁定是实打实的痛点,这个项目直接回应了这些需求。

4月23日星期四

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

新智元 · 公众号

浙大开源多智能体叙事系统 OpenStory:把孙悟空扔进大观园,几分钟后角色全跑光了

浙大放出了一个叫 OpenStory 的多智能体系统,专门用来跑开放剧情。他们搭了个 1:1 的《红楼梦》大观园沙盒,把孙悟空塞进去当变量。结果几分钟内,记忆模块就把“孙悟空滥杀无辜”这条信息广播了出去,恐惧直接压过了角色的日常行为逻辑。王熙凤被物理移除后,恐慌连锁反应让整个大观园变成了空城。这个实验暴露的是多智能体系统里记忆和共识链路有多脆。不过正文...

推荐理由:我会先打个折:正文没写用了什么模型、怎么评测、实验能不能复现,所以别急着把它当成熟系统看。但这个故事本身很直观——孙悟空 Agent 被放进《红楼梦》1:1 数字沙盒,系统用记忆模块向所有活跃角色广播“孙悟空滥杀无辜”,恐惧权重直接压过日常行为逻辑,王熙凤被物理移除后,其他 Agent 集体逃离,大观园变空城。真正值得盯的不是孙悟空有多强,而是记忆广播和共识链路太脆弱:一条消息就能让整个 Agent 社会崩掉,说明多 Agent 之间的信息传递和信任机制几乎没有韧性。对做 Agent 安全、多智能体协作的人来说,这是一个很具体的压力测试案例,暴露了...

4月22日星期三

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

4月20日星期一

X · @Yuchenj_UW

Kimi K2.6 开源了,SWE-Bench Pro 跑分 58.6,声称超过 GPT-5.4 和 Claude Opus 4.6

Kimi K2.6 宣布开源,在 SWE-Bench Pro(一个测代码修 bug 能力的基准)上拿了 58.6 分。推文说这个分数压过了 GPT-5.4(xhigh 模式)和 Claude Opus 4.6(max effort 模式)。不过正文没披露模型权重、开源协议和具体的评测设置,可复现性要打个问号。发帖人觉得 Kimi 发版节奏越来越快,属于...

推荐理由:三条都踩中了:开源本身就是强钩子,SWE-Bench Pro 58.6 这个数可以验证但信息不全,开源对闭源的代码能力竞赛又是当下热点。分数我维持 81,因为目前看只有标题级信息,权重、许可证、评测设置全都没披露,先别太激动。

r/LocalLLaMA

用免费 Colab T4 和 Mac 给苹果端侧 3B 模型训练 LoRA 适配器

作者搭了一套 QLoRA 流程来微调苹果那个跑在手机上的 3B 模型,把显存需求从大约 24GB 压到 1GB 内存加 5GB 显存,免费版 Colab T4 或者一台 24GB 内存的 Mac 就能跑。帖子说 A100 跑 LoRA、T4 跑 QLoRA、Mac 跑 QLoRA 训出来的适配器效果差不多,都能把准确率从 40% 左右拉到 75%,如果...

推荐理由:一篇带名字的第一手实验,内存和准确率数字可复现,HKR 三项全中,比普通教程贴强。分数没上 85 是因为来源只是单篇 Reddit 帖子,权威性有限,跑分范围也窄。

r/LocalLLaMA

TRELLIS.2 图片转 3D 模型现在能在苹果芯片 Mac 上跑了,不用 NVIDIA 显卡

有开发者把微软的 TRELLIS.2 移植到了 Apple Silicon 上,用一张照片就能生成约 40 万个顶点的 3D 网格。在 24GB 内存的 M4 Pro 上跑一次大概 3 分半钟,其中贴图烘焙只要 18 秒。这次移植把原来五个依赖 CUDA 的扩展换成了 PyTorch MPS 和自定义后端,不再需要 NVIDIA 显卡或云端算力。不过正...

推荐理由:这是社区移植,不是微软官方发布,但三个点都站得住:不用 NVIDIA 就能在 Mac 上做图生 3D,给了 M4 Pro 24GB 的具体跑分,而且重写 5 个 CUDA 扩展这件事本身就说明工作量。来源是 Reddit 帖子,权威性一般,但信息够具体,先按 featured 处理。

Hacker News 首页

TRELLIS.2 图生 3D 模型现在能在 Mac 上跑了,不用 Nvidia 显卡

开发者 shivampkumar 把微软那个 40 亿参数的 TRELLIS.2 模型移植到了苹果芯片上,靠 PyTorch 的 MPS 后端驱动,一张图就能生成 3D 模型。他把原本依赖 Nvidia 硬件的 flash_attn、nvdiffrast 和自定义稀疏卷积算子全换成了纯 PyTorch 实现,包括稀疏 3D 卷积、SDPA 注意力机制和...

推荐理由:这不是微软官方模型发布,而是一个可复现的本地移植,对实际干活的人有参考价值。我会先打个折:3.5 分钟生成一个网格不算快,但考虑到不用联网、不用 Nvidia,这个结果挺实在。正文把替换掉的组件和替代方案都列清楚了,信息量够,所以放在 featured 而不是 p1。