跳到正文

#开源/仓库

今日 3 条

5月6日星期三

机器之心 · 公众号

明略开源两套工具,让 Mac 跑本地模型和操控桌面

明略科技放出了两个开源项目:Cider 和 Mano-P 1.0,都是给苹果 M 系列芯片用的。Cider 是个推理加速引擎,在 M5 Pro 上跑 Qwen3-VL-2B 时,把生成第一个 token 前的等待时间缩短了 57% 到 61%。Mano-P 1.0 是个能操作电脑界面的模型,72B 版本在 OSWorld 测试里拿了 58.2 分。不过...

推荐理由:我会先打个折:明略不是一线模型实验室,所以分数没往上拉。但选题本身够实用——Mac 本地跑视觉模型和 GUI 智能体,还给了可复现的提速数据和内存门槛。Cider 的 prefill 加速和 Mano-P 在 OSWorld 的成功率都有具体数字,16GB 设备准确率下降也写明了,不是纯 PR 稿。对想在 Apple Silicon 上折腾本地推理的人,这篇值得看一眼。

5月5日星期二

r/LocalLLaMA

SenseNova-U1-8B-MoT 开源多模态架构引发讨论,去掉 VE 和 VAE 的单体设计是亮点还是噱头?

商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型,能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构,把传统多模态模型里常见的 VE(视觉编码器)和 VAE(变分自编码器)都去掉了,支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升,但帖子正文没给出...

推荐理由:HKR 三项都踩中了:架构钩子够具体,一个 8B 模型把理解和生成揉在一起,还砍掉了 VE/VAE;信息增量有,但缺实测分数和部署成本,所以分数压在 72–77 这个区间。我会先打个折,没看到跑分和许可就别急着全信,但方向值得盯。

r/LocalLLaMA

微软 VibeVoice 语音合成与长音频转写被移植到纯 C++,推理不再需要 Python

LocalAI 把微软的 VibeVoice 模型用 ggml 重写成 C++ 版本,叫 vibevoice.cpp,支持 CPU、CUDA、Metal 和 Vulkan 推理,不用装 Python 环境。语音合成这边,给一段 30 秒的参考录音就能克隆声音,输出 24kHz 的语音。语音识别部分用的是一个 7B 模型,能处理长音频并区分不同说话人,结...

推荐理由:这条更新对做本地音频部署的人有用,给出了具体的运行数字和限制。我会先打个折:它来自社区移植,不是微软官方动作,而且缺少流式支持这点在实时场景里是硬伤。整体在 72–77 分 featured 档位合理,不值得当天必写,但值得放进雷达。

r/LocalLLaMA

FastDMS 把 KV 缓存压到 1/5~1/8,跑得比 vLLM BF16/FP8 还快

FastDMS 放出了一个 MIT 许可的实现,核心是把模型推理时占显存的 KV 缓存压到原来的 1/5 到 1/8。在 8K 上下文长度下,Llama-3.2-1B 用 6.4 倍压缩后困惑度是 9.200;Qwen3-8B 在压缩系数 c=1 时,KV 缓存从 1.406 GiB 直接降到 0.184 GiB。和很多只算字节数的方案不同,它真的把淘...

推荐理由:我会先打个折,这个项目目前只给了 Llama-3.2-1B 的复现实验,更大规模模型的验证还没看到,所以别急着当通用方案。但它的钩子确实强:KV 缓存压缩 6.4 倍,同时推理速度还比 vLLM 的 BF16/FP8 快,这跟“压缩必降速”的直觉对着干。正文给出了具体的 PPL 和显存占用对比,数字可追溯。真正值得盯的是它回收了被踢掉的物理槽位,不只是账面上少占点字节,这对长上下文推理的显存管理是实打实的改进。来源是开源实现和 Reddit 讨论,不是厂商通稿,信息可信度还行,但权威性一般,所以分数定在 80 这个区间。

5月4日星期一

r/LocalLLaMA

用 Hermes Agent 和 qwen3.6-35b 在本地跑深度研究,生成了 21 页报告

一位 Reddit 用户用 Hermes Agent 框架搭配 qwen3.6-35b-a3b 的 Q6_K 量化版,在单张 RTX 4060 上跑了 6 轮循环、超过 5 小时,生成了一份 21 页的研究报告。生成速度约每秒 28 个 token。仓库里放了提示词、脚本、中间产物和最终报告。正文没披露报告具体主题和结论质量,也没说这 5 小时里人工干...

推荐理由:HKR 三项都站得住:这是一个带硬件型号、运行时长、生成速度和完整产物的本地 agent 实验。来源是 Reddit 个人分享,传播面有限,所以分数放在 72–77 的 featured 门槛区间,不往上拔。

量子位 · 公众号

DeepSeek-TUI 开源:一个用 Rust 写的终端版 DeepSeek 编程助手,GitHub 上拿了 2.3k 星

这是一个叫 DeepSeek-TUI 的终端工具,你可以把它理解成“DeepSeek 版的 Claude Code”,专门在命令行里帮你写代码、跑命令。项目用 Rust 开发,MIT 协议开源,目前主要对接 DeepSeek V4 模型,支持 100 万 token 的上下文窗口。它有个叫 RLM 的功能,能把大任务拆成最多 16 个 V4 Flash...

推荐理由:我会先打个折:2.3k 星在 GitHub 不算爆款,但标题蹭 Claude Code 的热度很精准,加上 Rust 实现和 MIT 协议,对在意可控性和成本的开发者有吸引力。正文没披露实际延迟和任务完成率,所以性能先别太激动。真正值得盯的是缓存成本——未命中 token 价格是命中的 10 倍,如果是真的,对高频编码场景挺省钱。影响面集中在开发者群体,所以重要性给到 75 是合理的。

r/LocalLLaMA

一个 4.5 亿参数的视觉模型在卫星上跑野火检测,瓶颈不是模型质量,是带宽

作者 PauLabartaBajo 搭了一套端到端的野火预防管线,把 4.5 亿参数的视觉语言模型 LFM2.5-VL 直接部署在卫星上做推理。核心约束是卫星下行带宽太窄,传不了大尺寸多光谱图像,所以方案反过来:在轨跑模型,只下传一份 JSON 格式的风险评估结果。管线用 Sentinel-2 的 RGB 和短波红外(SWIR)图像拼成输入——SWIR...

推荐理由:我会先打个折:这是单人 PoC,只在 22 个地点跑过模拟轨道,正文没披露真实卫星上的延迟和误报率,所以别当成熟方案看。但它的思路很清晰——把算力留在天上,只传结论不传图,带宽省得不是一点半点。用 450M 小模型而不是大模型,也说明在轨推理的硬件约束有多硬。对关注边缘部署和遥感落地的从业者,这个方向值得跟,但验证还差得远。

5月3日星期日

r/LocalLLaMA

开源代理 rosetta-llm 让 Claude Code 能调用任意模型

DataNebula 开源了一个叫 rosetta-llm 的代理,它像一个翻译网关,让 Claude Code 可以跟不同厂商的模型对话。它负责把 Anthropic Messages、OpenAI Chat 和 OpenAI Responses 这三种接口格式互相转换,并且通过 signature 字段把加密的推理过程来回传递,保证多轮对话时不会丢...

推荐理由:这是个 Reddit 开源工具帖,没披露 star 数、实际用量或任何基准测试结果,所以我会先打个折。技术点本身有意思:用 signature 字段回传加密 reasoning,试图保住 thinking block 的保真度,让多轮 agent 的 prompt-cache 不失效——这点如果真跑通了挺省钱。但正文没给出验证数据,也没说支持哪些模型、延迟增加多少,目前只能当个有潜力的工具看,分数停在中等偏上合理。

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

量子位 · 公众号

清华 AIR 开源具身智能仿真框架 GS-Playground,一块 4090 能同时跑 2048 个场景

清华 AIR DISCOVER 实验室和合作方开源了 GS-Playground,已被 RSS 2026 接收。这个框架把批量 3D 高斯泼溅渲染和并行物理引擎绑在一起,专门解决机器人训练时视觉仿真的算力瓶颈。在 RTX 4090 上,640×480 分辨率能跑到每秒一万帧,同时并行跑 2048 个场景;50 个人形机器人的基准测试里也能维持每秒 10...

推荐理由:这篇是清华 AIR DISCOVER Lab 开源的具身智能仿真框架 GS-Playground,论文被 RSS 2026 录用。我会先打个折:它解决的是仿真渲染的吞吐问题,不是直接训出一个更强的机器人模型,所以重要性到不了模型发布那档。但它的数字确实硬——单卡 RTX 4090 在 640×480 下渲染能冲到 10000 FPS,最多并行跑 2048 个场景,50 个人形机器人基准也能稳住 1015 FPS。真正值得盯的是他们把 3D 高斯泼溅的批渲染跟物理仿真并行耦合起来了,这比单纯吹 FPS 更有工程价值。正文没披露大规模训练后的策略迁移效...

r/LocalLLaMA

Reddit 网友用纯 C++17 手搓了一个 83 万参数的 Transformer,不用 PyTorch 也不用 BLAS,单核 CPU 训练 76 分钟

一个叫 Suspicious_Gap1121 的 Reddit 用户放出了 Quadtrix.cpp,一个用 C++17 从零写的 GPT 风格模型,总共 83 万参数。模型结构是 4 层、4 个注意力头、宽度 200 维,一次能看 128 个字符的上下文。他在单核 CPU 上拿 3140 万个字符训练了 76.2 分钟,验证损失降到 1.6371 n...

推荐理由:我会先打个折:这就是个个人练手项目,0.83M 参数离实用还远,别拿它跟正经模型比性能。但它的看点不在规模,而在把整个训练管线——LayerNorm、attention、Q/K/V、dropout、AdamW——全部手写反传,不用自动微分,不用 BLAS 加速,单核 CPU 跑通。正文没披露生成效果,也没给权重文件,所以只能当教学级实现来看。对 AI 从业者来说,这东西像一份可运行的底层教案,把平时被框架藏起来的细节全摊开了。

5月2日星期六

r/LocalLLaMA

Semvec:把聊天记录压成固定大小的“语义状态”,上下文再长也不涨 token

一个开发者在 Reddit 上发了个叫 Semvec 的项目,思路是把对话历史从无限增长的文本流换成固定大小的语义向量,每次推理只传这个压缩后的状态。他给出的 48 轮基准测试里,token 用量大概砍掉了 76%,而且第 10 轮和第 10000 轮的输入开销一样大。项目兼容 OpenAI 接口的模型,也接了 MCP、Claude Code、Curs...

推荐理由:这是个 Reddit 自发布项目,数据来自作者自己的基准,没有第三方验证,所以我会先打个折,不当成行业级事件。但它的思路挺省钱的:用固定大小的语义向量替代无限增长的对话历史,token 减少约 76%,而且第 10 轮和第 10000 轮输入量一样,对跑长链 agent 的人有参考价值。HKR 三项都满足,冲突、数字和治理/竞争伦理的神经都碰到了,只是目前没有裁决或产品级变动,所以保持在 featured 而不是更高优先级。

r/LocalLLaMA

有人在 Windows 上直接用 vLLM 跑 Qwen3.6-27B,单张 RTX 3090 跑到 72 tok/s

Reddit 用户 One_Slip1455 发了个原生 Windows 版 vLLM 启动器,不用 WSL 也不用 Docker。在一张 RTX 3090 上跑 Qwen3.6-27B(INT4 量化),短上下文能到 72 tok/s;上下文拉到约 2.5 万 token 时速度 64.5 tok/s,12.7 万 token 时还有 53.4 to...

推荐理由:HKR 三项都成立:原生 Windows 跑 27B 模型是钩子,帖子里有可验证的速度和上下文数字,而且直击本地推理省钱这个痛点。不过来源只有 Reddit 单帖,没有官方背书或产品级变动,所以放在 featured 低位是合理的。

量子位 · 公众号

腾讯混元开源 440MB 翻译模型,手机离线跑,自称翻译质量超谷歌

腾讯混元放出了一个叫 Hy-MT1.5-1.8B-1.25bit 的翻译模型,把原本 1.8B 参数的模型压到了 440MB,能在骁龙 888、8GB 内存的安卓手机上离线跑。它支持 33 种语言、1056 个翻译方向。压缩的关键是一种叫 Sherry 1.25 比特量化的技术,做法是每 4 个权重里,3 个用 1 比特存,1 个直接置零。官方说翻译质...

推荐理由:我会先打个折:这是个垂直翻译模型,不是基础模型大更新,所以没到 P1。但亮点很实在——1.8B 模型压到 440MB,靠的是 1.25-bit Sherry 量化,每 4 个参数里 3 个用 1-bit、1 个直接置零,这种压缩方式少见。正文给了骁龙 888、8GB 内存的离线跑分,不是空口说白话。翻译质量超谷歌这点先别太激动,正文没披露具体测试集和对比条件,但如果是真的,端侧翻译的性价比会明显拉高。

5月1日星期五

r/LocalLLaMA

PFlash:在 RTX 3090 上跑 128K 上下文,预填充比 llama.cpp 快 10 倍

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时,首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”,挑出最重要的 5% 文本片段喂给大模型,省掉了大量无关计算。整个方案用 ...

推荐理由:HKR 三项都踩中了,但这是单条 Reddit 帖子,质量验证只给了单针 NIAH 32K–128K 全通过,RULER 和多针结果没放出来,所以先放在 featured 门槛上。

新智元 · 公众号

一个开发者用10天婚假做了个AI世界生成器,一句话就能生成会自己运转的小镇

这个叫WorldX的项目,你输入一句话,它大概5分钟就能生成一个完整的AI世界。背后是一套6步地图生成流程,每个世界消耗约3万到18万个token。里面的NPC有自己的两层记忆和双轴情绪,会按Tick循环自主行动。比较有意思的是它用叠加标签加色差定位来做确定性坐标,让角色能真正走到具体位置而不是大概描述。不过正文没披露实际运行时的延迟和稳定性数据,这点...

推荐理由:我会先打个折,这是个独立项目不是大厂发布,所以分数压在75附近。但它的技术披露很实在,地图管线分6步、token消耗范围明确、坐标转换方案有工程参考价值,不是那种只放视频不说原理的展示。对正在折腾 Agent 记忆和世界生成的人,这篇文章能省不少试错时间,所以给 featured 没问题。

量子位 · 公众号

北大和快手可灵开源 OpenWorldLib,一个框架想统一视频生成、3D、机器人控制和推理

正文因为微信环境异常被拦截了,实际内容没抓到。从现有标题和英文摘要看,北大 DCAI 和快手可灵开源了一个叫 OpenWorldLib 的统一世界模型框架,把视频生成、3D 建模、VLA 机器人控制、多模态推理四类任务塞进一套 Pipeline 里。Pipeline 里分了 Operator、推理、合成、表征和记忆几个模块,支持前向和流式执行。核心看点...

推荐理由:HKR 三项都踩中了:框架覆盖四类任务、模块和推理模式交代得具体、落脚点在降低复现成本。但正文没给基准测试结果、没提实际部署规模或生态接入情况,所以分数先停在 78,别急着往上调。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

4月30日星期四

r/LocalLLaMA

inclusionAI 在 Hugging Face 开源了 Ling-2.6-1T,一个 1 万亿参数的模型

这个模型用了 MLA 和线性注意力,还加了一个叫“上下文过程冗余抑制”的技术,目的是降低思维链推理时的计算开销。帖子提到了 AIME26 和 SWE-bench Verified 两个基准,但正文没披露具体分数,所以实际表现还不清楚。另外,Reddit 原帖被网络屏蔽了,目前只能看到标题和简介,更多细节得去 Hugging Face 模型页翻。

推荐理由:我会先打个折:正文只提了覆盖 AIME26、SWE-bench Verified 等基准,但没给具体分数,所以模型到底多强现在说不准。能上 featured 是因为万亿参数开源本身就有信号意义,加上 MLA+Linear Attention 和 CPRS 这两个技术点,对做推理优化的人有参考价值。没给分这件事让它到不了 P1,但架构信息和开源动作足够让圈内人留意。

X · @dotey(宝玉)

Hermes Agent 的记忆系统拆解:它用四层设计避开了 OpenClaw 的坑

Hermes Agent 的记忆不是一套,而是四套:高度浓缩的提示词记忆(MEMORY.md 和 USER.md)、可搜索的 SQLite 历史会话存档、像程序记忆一样运作的技能管理,以及可选的 Honcho 深层用户建模。核心思路是冷热分离——把最常用的信息压进极小的提示词快照里(加起来约 1,300 个 Token),以保住大模型的提示词缓存、降低...

推荐理由:这篇文章不是产品发布,更像一篇技术拆解,把 Hermes Agent 的记忆系统讲得很清楚。我会先打个折:它来自单一信源,没有第三方验证,但给出的四层结构、字符限制和缓存优先思路对实际做 agent 的人有参考价值。正文没披露性能对比数据,所以别把它当评测看,当成一个设计思路的分享就好。

4月29日星期三

量子位 · 公众号

UCL 等团队开源 Avenir-Web,一个不用额外训练就让网页智能体干活更稳的框架,在 ONLINE-MIND2WEB 上跑到 53.7%

Avenir-Web 是 UCL、普林斯顿和爱丁堡大学一起开源的一个网页智能体框架,主打不训练、直接给模型套上就能用。它在 ONLINE-MIND2WEB 这个包含 136 个网站、300 个真实在线任务的测试里,成功率做到了 53.7%。对比一下,用 Gemini 3 Pro 跑的时候,它比 Claude Computer Use 3.7 的 47....

推荐理由:HKR 三项都站得住:标题有记忆点,数字和对比够具体,选题踩中网页智能体可靠性和模型选型这两个从业者高频焦虑点。这是开源研究发布,不是大厂模型首发,82 分放在 78–84 区间合理。

r/LocalLLaMA

商汤发布 SenseNova-U1:一个原生架构同时搞定看图理解和生图,不再靠外挂适配器

商汤放出了 SenseNova-U1 系列,主打“原生统一多模态”,意思是模型内部直接处理文字和图像,不用再像以前那样给语言模型外接一个图像适配器来翻译视觉信息。这次公开了 8B 和 A3B 两种 MoT(Mixture of Tokens)规格的权重,其中 A3B 的参数量更小,适合本地跑。官方说法是这套架构把视觉理解和生成塞进了同一个模型里,但 R...

推荐理由:HKR 三项都踩实了:单体架构替代适配器这个思路有看头,4 个 MoT 模型加开源权重是实打实的新料,本地可跑的多模态模型正好戳中当下热点。但正文没给任何基准分,来源又是 Reddit,信息缺口明显,所以分数压在 74 这个 featured 门槛上,先别急着往上抬。

X · @dotey(宝玉)

微软开源语音模型 VibeVoice-ASR 实测:一小时播客 8 分 45 秒转完,但 32GB 内存的 Mac 跑不动

Simon Willison 在 128GB 内存的 M5 Max MacBook Pro 上跑了社区做的 4-bit 量化版 VibeVoice-ASR,模型大小 5.71GB。转写一小时播客用了 8 分 45 秒,prefill 阶段内存峰值冲到 61.5GB,生成阶段稳定在 18GB 左右,所以普通 32GB 笔电基本没戏。这个 9B 参数模型最...

推荐理由:这篇不是新模型发布,而是 Simon Willison 拿微软 1 月开源的 VibeVoice-ASR 在自己机器上跑了一遍,给出了速度和内存的实测数字。我会先打个折:这只是单次测试,不代表所有场景,但 61.5GB 的内存峰值确实把 32GB 笔电劝退了,这点对想本地部署的人很关键。正文没提准确率对比,所以别当全面评测看,就当一份硬件门槛参考。

r/LocalLLaMA

小米放出 MiMo-V2.5:3100 亿总参数,每次只激活 150 亿的稀疏 MoE 模型

Reddit 上有人贴了小米 MiMo-V2.5 的 Hugging Face 链接,不是 Pro 版。架构是稀疏 MoE,总参数量 310B,每次推理只激活 15B 参数,相当于用 150 亿参数模型的计算量去撬动一个 3100 亿参数的知识容量。发帖人说它比更大的兄弟模型用了更“人性化”的配置,但正文没展开什么叫人性化,也没给显存需求、量化方案或跑...

推荐理由:这条消息的钩子很实在:310B 总参数但每次只激活 15B,意味着理论上比同体量稠密模型省资源,官方也说它比更大版本更适合普通配置跑。我会先打个折——正文只贴了个 Hugging Face 地址,没给显存占用、量化方式、任何基准测试,所以“普通配置”到底指什么配置完全不清楚。这点先别太激动,等实测数据出来再判断值不值得本地部署。

X · @dotey(宝玉)

AI 终端 Warp 把客户端代码开源了,OpenAI 是创始赞助商

Warp 是一个用 Rust 写的现代终端,有超过 70 万开发者用,核心卖点是把 AI 塞进命令行,你用自然语言说想干嘛,它帮你生成命令。这次开源的是客户端代码,走 AGPL 协议,服务端还是闭源的。比较特别的是他们的社区贡献流程:Warp 自家的云端 AI 平台 Oz 负责写代码、做规划、跑测试,人主要负责提想法和验证,等于在跑一个“人管方向、AI...

推荐理由:Warp 这次开源的是客户端代码,走 AGPL 协议,服务端没动,所以别理解成整个产品都开源了。OpenAI 当创始赞助商是个信号,但正文没展开双方具体怎么合作。真正有意思的是他们提的“人管方向、AI 干活”的贡献流程,不过目前还只是说法,没看到跑起来的例子。70 万开发者的数字说明用户盘子不小,Rust 重构也加分。整体是条扎实的开发者工具动态,不是模型或能力层的重大发布。

4月28日星期二

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

量子位 · 公众号

商汤开源 SenseNova-U1:不卷参数卷架构,把图像理解和生成塞进同一个模型

商汤放出了两个开源模型 SenseNova-U1,一个 8B 参数,另一个是总参数量 38B 的 MoE 版本,都用了一套叫 NEO-unify 的架构。它砍掉了传统的视觉编码器和 VAE,直接处理像素,在单张 H100 或 H200 上大概 9 秒能生成一张 2048×2048 的图。核心卖点是图文交错推理,也就是模型能边看文字边看图、边想边出图。不...

推荐理由:我会先打个折:正文没给图文交错思维链的具体效果和长文字渲染的实测,32K 上下文和连续图文 beta 也还是限制,别当成熟方案用。但去掉 VE/VAE 的像素直出设计确实有意思,9 秒出 2048 图的成本听着挺省,开源出来对做多模态的团队是个可拆可改的底子。

Hacker News 首页

小米开源 MiMo-V2.5-Pro,写代码的跑分紧挨着 Claude Opus 4.6

小米把 MiMo-V2.5-Pro 的模型权重放出来了。标题说它的编程能力在跑分上和 Claude Opus 4.6 差不多,文章举了个例子:北大计算机系的编译器大作业,学生通常要花几周,这个模型 4.3 小时跑完,233 个隐藏测试全过。V2.5-Pro 相比之前的 Flash 版,主要提升了长任务连贯性、能处理超过一千步的复杂任务,以及让模型进业务...

推荐理由:HKR 三项都通过,因为小米发编程/Agent 权重本身是实打实的动作,从业者会想看一眼。但信息缺口很大:没参数、没许可、没具体分数,只有标题说表现突出,所以我会先打个折,重要性停在 74 分 featured 门槛附近。

X · @op7418(歸藏)

小米把 MiMo-V2.5 系列模型全开源了,MIT 协议,随便商用和魔改

小米这次放出的 MiMo-V2.5 系列模型用了 MIT 开源协议,你可以直接拿来商用、做二次训练和微调,不用再额外申请授权。正文没披露模型参数量和跑分成绩,这点先别太激动。同时他们还搞了个 Orbit 100T Token 计划,分两块:一块是给 AI builder 的激励,申请通过最高能拿到 16 亿 Credits,价值 659 元;另一块是给...

推荐理由:这条消息对 AI builder 有实际价值:MIT 协议意味着可以放心商用和微调,Orbit 计划给的 Credits 额度不小,659 元的标价也算低。但我会先打个折——正文完全没提模型参数量、性能跑分,连基础尺寸都不知道,没法判断模型本身强不强。这点先别太激动,等评测出来再看。整体属于有料但缺关键验证,放在 featured 合适。

r/LocalLLaMA

微软放出 TRELLIS.2:一个开源 40 亿参数图生 3D 模型,能直接出带贴图的资产

微软在 Reddit 上发了个帖子,标题信息量挺大,但帖子正文被 403 屏蔽了,看不到具体细节。从标题看,TRELLIS.2 是个开源的图生 3D 模型,参数量 40 亿。它能生成最高 1536³ 分辨率的 PBR 纹理资产,也就是带物理渲染材质的 3D 模型,不是白模。技术路线上,它用了原生 3D VAE 做 16 倍空间压缩,这通常意味着生成效率...

推荐理由:标题信息量不小,但正文因为 Reddit 403 拿不到论文链接、许可证和具体评测,所以只能按标题给的事实来写。我会先打个折:1536³ 的 PBR 资产听起来挺省钱,但没看到跟现有方法的对比,这点先别太激动。40 亿参数配上 16 倍空间压缩,理论上推理会快一些,不过没实测数据就不好说实际延迟。整体判断挂在微软开源这个动作上,信息缺口是缺论文和基准,所以分数停在 featured 的底线。

4月27日星期一

Hacker News 首页

Utilyze 开源 GPU 监控工具,说比 nvtop 更准,能看出显卡是真忙还是在摸鱼

Systalyze 开源了一个叫 Utilyze 的 GPU 监控工具,专门解决 nvidia-smi 和 nvtop 那个老毛病:它们只告诉你显卡“有没有在干活”,不告诉你“干得有多满”。比如 H100 有 132 个流式多处理器、一万七千多个核,但只要有一个核在跑,利用率就敢报 100%,实际算力可能才用了 1%。Utilyze 会直接算你的 GP...

推荐理由:这篇抓住了 GPU 监控里一个很常见的坑:传统工具只看二值占用,不看有效计算效率。对跑生产负载的人来说,知道真实吞吐上限比看仪表盘数字重要得多。我会先打个折,因为工具来自一个还没被广泛验证的团队,正文也没披露具体开销有多“可忽略”,但选题和解释都到位,放在 featured 没问题。

Hacker News 首页

Dirac 这个开源编程助手在 TerminalBench 上拿了第一,靠的是省 token 和并行操作

Dirac 是一个专门抠上下文效率的编程助手,刚在 TerminalBench 上跑分拿了第一,用的模型是 Gemini-3-flash-preview。它说自己能把 API 调用成本压到其他同类工具的 20% 到 50%,主要靠三招:用哈希锚点来精准定位代码修改位置、把能并行的操作全并行跑、直接操作抽象语法树而不是整段重写。不过正文没披露 Termi...

推荐理由:HKR 三项都站得住:一个开源编程智能体声称在 TerminalBench 上拿了第一,还给出了具体模型和成本降幅,技术细节也没藏着。不过分数我压到 78,因为目前只有仓库自述,完整榜单分数和复现日志都没放出来,先别太激动。

OpenAI News

OpenAI 开源了一套叫 Symphony 的规范,把项目管理看板变成 AI 编程 agent 的指挥中心

OpenAI 放出了 Symphony,一个开源的 agent 编排规范。它的核心思路是把 Linear 这类任务看板当成控制面板,每个待办任务都会自动分配一个编程 agent 去干活,人只负责最后审查结果。OpenAI 内部团队用上后,合并的 PR 数量三周内涨了五倍。工程师不用再同时盯着好几个 agent 会话,避免了频繁切换上下文的痛苦。agen...

推荐理由:H 和 R 都站得住:OpenAI 开源一个 Codex 编排规范,对 agent 工作流有直接关联,issue 变常驻 agent 的设想也够具体。K 这边我会先打个折,因为许可、接口、可复现的机制全都没披露,现在只能当个方向性信号看,别太激动。

4月25日星期六

Hacker News 首页

Stash 开源了一个 AI 记忆层,让任何智能体都能记住你是谁、聊过什么、踩过哪些坑

Stash 是一个开源的持久化记忆层,用 PostgreSQL 加 pgvector 做存储,给 AI 智能体配了 28 个 MCP 工具和一套 6 步处理流水线。它跟外挂资料库(RAG)不一样:RAG 只会翻文档,Stash 会从对话里自动提炼事实、建知识图谱、跟踪目标和失败记录,还能发现前后矛盾的地方。记忆按层级命名空间分桶,用户、项目、智能体自省...

推荐理由:我会先打个折:这是个独立开发者的开源基础设施项目,不是大厂或平台级发布,所以分数停在 featured 低段。但 HKR 三项都站得住。钩子不是“像 ChatGPT 一样记住你”的标题党,而是把记忆层做成可移植的中间件,任何 agent 都能接。正文给了足够的技术细节,28 个工具、6 个阶段、pgvector 存储和命名空间隔离,架构看得见。对 agent 开发者来说,长期记忆、上下文成本和供应商锁定是实打实的痛点,这个项目直接回应了这些需求。

4月23日星期四

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

新智元 · 公众号

浙大开源多智能体叙事系统 OpenStory:把孙悟空扔进大观园,几分钟后角色全跑光了

浙大放出了一个叫 OpenStory 的多智能体系统,专门用来跑开放剧情。他们搭了个 1:1 的《红楼梦》大观园沙盒,把孙悟空塞进去当变量。结果几分钟内,记忆模块就把“孙悟空滥杀无辜”这条信息广播了出去,恐惧直接压过了角色的日常行为逻辑。王熙凤被物理移除后,恐慌连锁反应让整个大观园变成了空城。这个实验暴露的是多智能体系统里记忆和共识链路有多脆。不过正文...

推荐理由:我会先打个折:正文没写用了什么模型、怎么评测、实验能不能复现,所以别急着把它当成熟系统看。但这个故事本身很直观——孙悟空 Agent 被放进《红楼梦》1:1 数字沙盒,系统用记忆模块向所有活跃角色广播“孙悟空滥杀无辜”,恐惧权重直接压过日常行为逻辑,王熙凤被物理移除后,其他 Agent 集体逃离,大观园变空城。真正值得盯的不是孙悟空有多强,而是记忆广播和共识链路太脆弱:一条消息就能让整个 Agent 社会崩掉,说明多 Agent 之间的信息传递和信任机制几乎没有韧性。对做 Agent 安全、多智能体协作的人来说,这是一个很具体的压力测试案例,暴露了...

4月22日星期三

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

4月20日星期一

X · @Yuchenj_UW

Kimi K2.6 开源了,SWE-Bench Pro 跑分 58.6,声称超过 GPT-5.4 和 Claude Opus 4.6

Kimi K2.6 宣布开源,在 SWE-Bench Pro(一个测代码修 bug 能力的基准)上拿了 58.6 分。推文说这个分数压过了 GPT-5.4(xhigh 模式)和 Claude Opus 4.6(max effort 模式)。不过正文没披露模型权重、开源协议和具体的评测设置,可复现性要打个问号。发帖人觉得 Kimi 发版节奏越来越快,属于...

推荐理由:三条都踩中了:开源本身就是强钩子,SWE-Bench Pro 58.6 这个数可以验证但信息不全,开源对闭源的代码能力竞赛又是当下热点。分数我维持 81,因为目前看只有标题级信息,权重、许可证、评测设置全都没披露,先别太激动。

r/LocalLLaMA

用免费 Colab T4 和 Mac 给苹果端侧 3B 模型训练 LoRA 适配器

作者搭了一套 QLoRA 流程来微调苹果那个跑在手机上的 3B 模型,把显存需求从大约 24GB 压到 1GB 内存加 5GB 显存,免费版 Colab T4 或者一台 24GB 内存的 Mac 就能跑。帖子说 A100 跑 LoRA、T4 跑 QLoRA、Mac 跑 QLoRA 训出来的适配器效果差不多,都能把准确率从 40% 左右拉到 75%,如果...

推荐理由:一篇带名字的第一手实验,内存和准确率数字可复现,HKR 三项全中,比普通教程贴强。分数没上 85 是因为来源只是单篇 Reddit 帖子,权威性有限,跑分范围也窄。

r/LocalLLaMA

TRELLIS.2 图片转 3D 模型现在能在苹果芯片 Mac 上跑了,不用 NVIDIA 显卡

有开发者把微软的 TRELLIS.2 移植到了 Apple Silicon 上,用一张照片就能生成约 40 万个顶点的 3D 网格。在 24GB 内存的 M4 Pro 上跑一次大概 3 分半钟,其中贴图烘焙只要 18 秒。这次移植把原来五个依赖 CUDA 的扩展换成了 PyTorch MPS 和自定义后端,不再需要 NVIDIA 显卡或云端算力。不过正...

推荐理由:这是社区移植,不是微软官方发布,但三个点都站得住:不用 NVIDIA 就能在 Mac 上做图生 3D,给了 M4 Pro 24GB 的具体跑分,而且重写 5 个 CUDA 扩展这件事本身就说明工作量。来源是 Reddit 帖子,权威性一般,但信息够具体,先按 featured 处理。