跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 261–280 条 · 共 329 条

5月5日星期二

r/LocalLLaMA

SenseNova-U1-8B-MoT 开源多模态架构引发讨论,去掉 VE 和 VAE 的单体设计是亮点还是噱头?

商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型,能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构,把传统多模态模型里常见的 VE(视觉编码器)和 VAE(变分自编码器)都去掉了,支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升,但帖子正文没给出...

推荐理由:HKR 三项都踩中了:架构钩子够具体,一个 8B 模型把理解和生成揉在一起,还砍掉了 VE/VAE;信息增量有,但缺实测分数和部署成本,所以分数压在 72–77 这个区间。我会先打个折,没看到跑分和许可就别急着全信,但方向值得盯。

r/LocalLLaMA

微软 VibeVoice 语音合成与长音频转写被移植到纯 C++,推理不再需要 Python

LocalAI 把微软的 VibeVoice 模型用 ggml 重写成 C++ 版本,叫 vibevoice.cpp,支持 CPU、CUDA、Metal 和 Vulkan 推理,不用装 Python 环境。语音合成这边,给一段 30 秒的参考录音就能克隆声音,输出 24kHz 的语音。语音识别部分用的是一个 7B 模型,能处理长音频并区分不同说话人,结...

推荐理由:这条更新对做本地音频部署的人有用,给出了具体的运行数字和限制。我会先打个折:它来自社区移植,不是微软官方动作,而且缺少流式支持这点在实时场景里是硬伤。整体在 72–77 分 featured 档位合理,不值得当天必写,但值得放进雷达。

r/LocalLLaMA

FastDMS 把 KV 缓存压到 1/5~1/8,跑得比 vLLM BF16/FP8 还快

FastDMS 放出了一个 MIT 许可的实现,核心是把模型推理时占显存的 KV 缓存压到原来的 1/5 到 1/8。在 8K 上下文长度下,Llama-3.2-1B 用 6.4 倍压缩后困惑度是 9.200;Qwen3-8B 在压缩系数 c=1 时,KV 缓存从 1.406 GiB 直接降到 0.184 GiB。和很多只算字节数的方案不同,它真的把淘...

推荐理由:我会先打个折,这个项目目前只给了 Llama-3.2-1B 的复现实验,更大规模模型的验证还没看到,所以别急着当通用方案。但它的钩子确实强:KV 缓存压缩 6.4 倍,同时推理速度还比 vLLM 的 BF16/FP8 快,这跟“压缩必降速”的直觉对着干。正文给出了具体的 PPL 和显存占用对比,数字可追溯。真正值得盯的是它回收了被踢掉的物理槽位,不只是账面上少占点字节,这对长上下文推理的显存管理是实打实的改进。来源是开源实现和 Reddit 讨论,不是厂商通稿,信息可信度还行,但权威性一般,所以分数定在 80 这个区间。

5月4日星期一

r/LocalLLaMA

用 Hermes Agent 和 qwen3.6-35b 在本地跑深度研究,生成了 21 页报告

一位 Reddit 用户用 Hermes Agent 框架搭配 qwen3.6-35b-a3b 的 Q6_K 量化版,在单张 RTX 4060 上跑了 6 轮循环、超过 5 小时,生成了一份 21 页的研究报告。生成速度约每秒 28 个 token。仓库里放了提示词、脚本、中间产物和最终报告。正文没披露报告具体主题和结论质量,也没说这 5 小时里人工干...

推荐理由:HKR 三项都站得住:这是一个带硬件型号、运行时长、生成速度和完整产物的本地 agent 实验。来源是 Reddit 个人分享,传播面有限,所以分数放在 72–77 的 featured 门槛区间,不往上拔。

量子位 · 公众号

DeepSeek-TUI 开源:一个用 Rust 写的终端版 DeepSeek 编程助手,GitHub 上拿了 2.3k 星

这是一个叫 DeepSeek-TUI 的终端工具,你可以把它理解成“DeepSeek 版的 Claude Code”,专门在命令行里帮你写代码、跑命令。项目用 Rust 开发,MIT 协议开源,目前主要对接 DeepSeek V4 模型,支持 100 万 token 的上下文窗口。它有个叫 RLM 的功能,能把大任务拆成最多 16 个 V4 Flash...

推荐理由:我会先打个折:2.3k 星在 GitHub 不算爆款,但标题蹭 Claude Code 的热度很精准,加上 Rust 实现和 MIT 协议,对在意可控性和成本的开发者有吸引力。正文没披露实际延迟和任务完成率,所以性能先别太激动。真正值得盯的是缓存成本——未命中 token 价格是命中的 10 倍,如果是真的,对高频编码场景挺省钱。影响面集中在开发者群体,所以重要性给到 75 是合理的。

r/LocalLLaMA

一个 4.5 亿参数的视觉模型在卫星上跑野火检测,瓶颈不是模型质量,是带宽

作者 PauLabartaBajo 搭了一套端到端的野火预防管线,把 4.5 亿参数的视觉语言模型 LFM2.5-VL 直接部署在卫星上做推理。核心约束是卫星下行带宽太窄,传不了大尺寸多光谱图像,所以方案反过来:在轨跑模型,只下传一份 JSON 格式的风险评估结果。管线用 Sentinel-2 的 RGB 和短波红外(SWIR)图像拼成输入——SWIR...

推荐理由:我会先打个折:这是单人 PoC,只在 22 个地点跑过模拟轨道,正文没披露真实卫星上的延迟和误报率,所以别当成熟方案看。但它的思路很清晰——把算力留在天上,只传结论不传图,带宽省得不是一点半点。用 450M 小模型而不是大模型,也说明在轨推理的硬件约束有多硬。对关注边缘部署和遥感落地的从业者,这个方向值得跟,但验证还差得远。

5月3日星期日

r/LocalLLaMA

开源代理 rosetta-llm 让 Claude Code 能调用任意模型

DataNebula 开源了一个叫 rosetta-llm 的代理,它像一个翻译网关,让 Claude Code 可以跟不同厂商的模型对话。它负责把 Anthropic Messages、OpenAI Chat 和 OpenAI Responses 这三种接口格式互相转换,并且通过 signature 字段把加密的推理过程来回传递,保证多轮对话时不会丢...

推荐理由:这是个 Reddit 开源工具帖,没披露 star 数、实际用量或任何基准测试结果,所以我会先打个折。技术点本身有意思:用 signature 字段回传加密 reasoning,试图保住 thinking block 的保真度,让多轮 agent 的 prompt-cache 不失效——这点如果真跑通了挺省钱。但正文没给出验证数据,也没说支持哪些模型、延迟增加多少,目前只能当个有潜力的工具看,分数停在中等偏上合理。

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

量子位 · 公众号

清华 AIR 开源具身智能仿真框架 GS-Playground,一块 4090 能同时跑 2048 个场景

清华 AIR DISCOVER 实验室和合作方开源了 GS-Playground,已被 RSS 2026 接收。这个框架把批量 3D 高斯泼溅渲染和并行物理引擎绑在一起,专门解决机器人训练时视觉仿真的算力瓶颈。在 RTX 4090 上,640×480 分辨率能跑到每秒一万帧,同时并行跑 2048 个场景;50 个人形机器人的基准测试里也能维持每秒 10...

推荐理由:这篇是清华 AIR DISCOVER Lab 开源的具身智能仿真框架 GS-Playground,论文被 RSS 2026 录用。我会先打个折:它解决的是仿真渲染的吞吐问题,不是直接训出一个更强的机器人模型,所以重要性到不了模型发布那档。但它的数字确实硬——单卡 RTX 4090 在 640×480 下渲染能冲到 10000 FPS,最多并行跑 2048 个场景,50 个人形机器人基准也能稳住 1015 FPS。真正值得盯的是他们把 3D 高斯泼溅的批渲染跟物理仿真并行耦合起来了,这比单纯吹 FPS 更有工程价值。正文没披露大规模训练后的策略迁移效...

r/LocalLLaMA

Reddit 网友用纯 C++17 手搓了一个 83 万参数的 Transformer,不用 PyTorch 也不用 BLAS,单核 CPU 训练 76 分钟

一个叫 Suspicious_Gap1121 的 Reddit 用户放出了 Quadtrix.cpp,一个用 C++17 从零写的 GPT 风格模型,总共 83 万参数。模型结构是 4 层、4 个注意力头、宽度 200 维,一次能看 128 个字符的上下文。他在单核 CPU 上拿 3140 万个字符训练了 76.2 分钟,验证损失降到 1.6371 n...

推荐理由:我会先打个折:这就是个个人练手项目,0.83M 参数离实用还远,别拿它跟正经模型比性能。但它的看点不在规模,而在把整个训练管线——LayerNorm、attention、Q/K/V、dropout、AdamW——全部手写反传,不用自动微分,不用 BLAS 加速,单核 CPU 跑通。正文没披露生成效果,也没给权重文件,所以只能当教学级实现来看。对 AI 从业者来说,这东西像一份可运行的底层教案,把平时被框架藏起来的细节全摊开了。

5月2日星期六

r/LocalLLaMA

Semvec:把聊天记录压成固定大小的“语义状态”,上下文再长也不涨 token

一个开发者在 Reddit 上发了个叫 Semvec 的项目,思路是把对话历史从无限增长的文本流换成固定大小的语义向量,每次推理只传这个压缩后的状态。他给出的 48 轮基准测试里,token 用量大概砍掉了 76%,而且第 10 轮和第 10000 轮的输入开销一样大。项目兼容 OpenAI 接口的模型,也接了 MCP、Claude Code、Curs...

推荐理由:这是个 Reddit 自发布项目,数据来自作者自己的基准,没有第三方验证,所以我会先打个折,不当成行业级事件。但它的思路挺省钱的:用固定大小的语义向量替代无限增长的对话历史,token 减少约 76%,而且第 10 轮和第 10000 轮输入量一样,对跑长链 agent 的人有参考价值。HKR 三项都满足,冲突、数字和治理/竞争伦理的神经都碰到了,只是目前没有裁决或产品级变动,所以保持在 featured 而不是更高优先级。

r/LocalLLaMA

有人在 Windows 上直接用 vLLM 跑 Qwen3.6-27B,单张 RTX 3090 跑到 72 tok/s

Reddit 用户 One_Slip1455 发了个原生 Windows 版 vLLM 启动器,不用 WSL 也不用 Docker。在一张 RTX 3090 上跑 Qwen3.6-27B(INT4 量化),短上下文能到 72 tok/s;上下文拉到约 2.5 万 token 时速度 64.5 tok/s,12.7 万 token 时还有 53.4 to...

推荐理由:HKR 三项都成立:原生 Windows 跑 27B 模型是钩子,帖子里有可验证的速度和上下文数字,而且直击本地推理省钱这个痛点。不过来源只有 Reddit 单帖,没有官方背书或产品级变动,所以放在 featured 低位是合理的。

量子位 · 公众号

腾讯混元开源 440MB 翻译模型,手机离线跑,自称翻译质量超谷歌

腾讯混元放出了一个叫 Hy-MT1.5-1.8B-1.25bit 的翻译模型,把原本 1.8B 参数的模型压到了 440MB,能在骁龙 888、8GB 内存的安卓手机上离线跑。它支持 33 种语言、1056 个翻译方向。压缩的关键是一种叫 Sherry 1.25 比特量化的技术,做法是每 4 个权重里,3 个用 1 比特存,1 个直接置零。官方说翻译质...

推荐理由:我会先打个折:这是个垂直翻译模型,不是基础模型大更新,所以没到 P1。但亮点很实在——1.8B 模型压到 440MB,靠的是 1.25-bit Sherry 量化,每 4 个参数里 3 个用 1-bit、1 个直接置零,这种压缩方式少见。正文给了骁龙 888、8GB 内存的离线跑分,不是空口说白话。翻译质量超谷歌这点先别太激动,正文没披露具体测试集和对比条件,但如果是真的,端侧翻译的性价比会明显拉高。

5月1日星期五

r/LocalLLaMA

PFlash:在 RTX 3090 上跑 128K 上下文,预填充比 llama.cpp 快 10 倍

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时,首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”,挑出最重要的 5% 文本片段喂给大模型,省掉了大量无关计算。整个方案用 ...

推荐理由:HKR 三项都踩中了,但这是单条 Reddit 帖子,质量验证只给了单针 NIAH 32K–128K 全通过,RULER 和多针结果没放出来,所以先放在 featured 门槛上。

新智元 · 公众号

一个开发者用10天婚假做了个AI世界生成器,一句话就能生成会自己运转的小镇

这个叫WorldX的项目,你输入一句话,它大概5分钟就能生成一个完整的AI世界。背后是一套6步地图生成流程,每个世界消耗约3万到18万个token。里面的NPC有自己的两层记忆和双轴情绪,会按Tick循环自主行动。比较有意思的是它用叠加标签加色差定位来做确定性坐标,让角色能真正走到具体位置而不是大概描述。不过正文没披露实际运行时的延迟和稳定性数据,这点...

推荐理由:我会先打个折,这是个独立项目不是大厂发布,所以分数压在75附近。但它的技术披露很实在,地图管线分6步、token消耗范围明确、坐标转换方案有工程参考价值,不是那种只放视频不说原理的展示。对正在折腾 Agent 记忆和世界生成的人,这篇文章能省不少试错时间,所以给 featured 没问题。

量子位 · 公众号

北大和快手可灵开源 OpenWorldLib,一个框架想统一视频生成、3D、机器人控制和推理

正文因为微信环境异常被拦截了,实际内容没抓到。从现有标题和英文摘要看,北大 DCAI 和快手可灵开源了一个叫 OpenWorldLib 的统一世界模型框架,把视频生成、3D 建模、VLA 机器人控制、多模态推理四类任务塞进一套 Pipeline 里。Pipeline 里分了 Operator、推理、合成、表征和记忆几个模块,支持前向和流式执行。核心看点...

推荐理由:HKR 三项都踩中了:框架覆盖四类任务、模块和推理模式交代得具体、落脚点在降低复现成本。但正文没给基准测试结果、没提实际部署规模或生态接入情况,所以分数先停在 78,别急着往上调。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

4月30日星期四

r/LocalLLaMA

inclusionAI 在 Hugging Face 开源了 Ling-2.6-1T,一个 1 万亿参数的模型

这个模型用了 MLA 和线性注意力,还加了一个叫“上下文过程冗余抑制”的技术,目的是降低思维链推理时的计算开销。帖子提到了 AIME26 和 SWE-bench Verified 两个基准,但正文没披露具体分数,所以实际表现还不清楚。另外,Reddit 原帖被网络屏蔽了,目前只能看到标题和简介,更多细节得去 Hugging Face 模型页翻。

推荐理由:我会先打个折:正文只提了覆盖 AIME26、SWE-bench Verified 等基准,但没给具体分数,所以模型到底多强现在说不准。能上 featured 是因为万亿参数开源本身就有信号意义,加上 MLA+Linear Attention 和 CPRS 这两个技术点,对做推理优化的人有参考价值。没给分这件事让它到不了 P1,但架构信息和开源动作足够让圈内人留意。

X · @dotey(宝玉)

Hermes Agent 的记忆系统拆解:它用四层设计避开了 OpenClaw 的坑

Hermes Agent 的记忆不是一套,而是四套:高度浓缩的提示词记忆(MEMORY.md 和 USER.md)、可搜索的 SQLite 历史会话存档、像程序记忆一样运作的技能管理,以及可选的 Honcho 深层用户建模。核心思路是冷热分离——把最常用的信息压进极小的提示词快照里(加起来约 1,300 个 Token),以保住大模型的提示词缓存、降低...

推荐理由:这篇文章不是产品发布,更像一篇技术拆解,把 Hermes Agent 的记忆系统讲得很清楚。我会先打个折:它来自单一信源,没有第三方验证,但给出的四层结构、字符限制和缓存优先思路对实际做 agent 的人有参考价值。正文没披露性能对比数据,所以别把它当评测看,当成一个设计思路的分享就好。

4月29日星期三

量子位 · 公众号

UCL 等团队开源 Avenir-Web,一个不用额外训练就让网页智能体干活更稳的框架,在 ONLINE-MIND2WEB 上跑到 53.7%

Avenir-Web 是 UCL、普林斯顿和爱丁堡大学一起开源的一个网页智能体框架,主打不训练、直接给模型套上就能用。它在 ONLINE-MIND2WEB 这个包含 136 个网站、300 个真实在线任务的测试里,成功率做到了 53.7%。对比一下,用 Gemini 3 Pro 跑的时候,它比 Claude Computer Use 3.7 的 47....

推荐理由:HKR 三项都站得住:标题有记忆点,数字和对比够具体,选题踩中网页智能体可靠性和模型选型这两个从业者高频焦虑点。这是开源研究发布,不是大厂模型首发,82 分放在 78–84 区间合理。