跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 241–260 条 · 共 329 条

5月10日星期日

r/LocalLLaMA

ByteBell 开源了一套代码索引方案:用 LLM 给每个文件生成语义信息存进图数据库,比向量、语法树和暴力塞上下文都管用

他们试了三种路线:向量相似度搜代码、用抽象语法树(AST)结构化匹配、以及直接把代码块塞进大窗口模型。最后发现,让 LLM 先给每个文件提炼出用途、摘要、业务背景、实体、类、函数、关键词和依赖关系,存到 Neo4j 图数据库里,再用全文搜索去查,效果最好。正文没披露具体评测指标和对比数据,这点先别太激动。工程上有个省钱设计:用 SHA-256 比对文件...

推荐理由:我会先打个折:文章来自 Reddit 分享,没有给出系统性的对比数据和量化指标,所以不能当正式评测看。但它的价值在于把一条反直觉的工程结论讲清楚了——向量、AST、暴力塞上下文都试过,最后是语义图赢了。做法也够具体:逐文件跑 LLM 摘要写入 Neo4j,用 SHA-256 diff 做增量更新,只重建改过的文件。这对正在搭代码检索或 agent 的人是个直接可抄的思路,踩坑记录比方法论更有用。信息缺口是没披露用了哪个模型做摘要、图查询的延迟和成本也没给,这点先别太激动。

r/LocalLLaMA

网友用一张 RTX PRO 6000 工作站显卡跑起了 DeepSeek V4 Pro

Reddit 用户 fairydreaming 发帖说,他在自己机器上跑通了 DeepSeek V4 Pro。用的是一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡,搭配修改过的 llama.cpp CUDA 分支。模型文件是 Q4_K_M 量化版,体积 859GB。他分享的日志显示,在 1M 上下文窗口下,生成速度跑到每秒 ...

推荐理由:我会先打个折:这是 Reddit 单帖,没有第三方复现,稳定性、量化损失、长上下文下的实际效果都还没谱。但帖子里把文件大小、上下文长度、生成速度和运行分支全摊出来了,对想自己折腾本地推理的人来说,比很多官方博客都直接。单卡跑 859GB 模型这件事本身就是一个信号——大模型本地化的硬件门槛在往下走,这点先别太激动,但值得盯着。

r/LocalLLaMA

BeeLlama.cpp:用 DFlash 和 TurboQuant 让 Qwen 3.6 27B 在单张 3090 上跑 20 万上下文,速度翻倍

Anbeeld 发了一个 llama.cpp 的分支 BeeLlama.cpp,主要加了 DFlash(一种省显存的注意力机制)和 TurboQuant(更快的量化方案),还支持推理和视觉任务。标题里说在单张 RTX 3090 或 4090 上跑 Qwen 3.6 27B 的 Q5 量化版,能塞进 20 万 token 的上下文,速度比原版快 2 到 ...

推荐理由:我会先打个折:这些数字来自 Reddit 标题和摘要,没有独立复现,135 tps 的峰值在什么输入长度、什么 batch 下跑的也没说清楚。但就算打个七折,单张 3090 把 27B 模型塞进 200k 上下文还能跑到可用的速度,对个人开发者和小团队确实省钱。BeeLlama.cpp 看起来是在 llama.cpp 上做了 DFlash 和 TurboQuant 的工程优化,正文没披露具体技术细节和稳定性测试,这点先别太激动。整体算一次值得关注的本地推理更新,所以放在低位的 featured。

5月9日星期六

AI HOT 精选

YC 老板 Garry Tan 开源了自己的 AI 系统 GBrain,五个月读了 20 多本书,管着 10 万页知识

Garry Tan 把 GBrain 放上了 GitHub,这是他给自己搭的一套个人 AI 操作系统,想做成能持续增值的“第二大脑”。系统按任务拆成几个模块:Book Mirror 负责深度处理书籍,Meeting Prep 自动做会前预习,五个月啃完 20 多本书,结构化知识库超过 10 万页,还在涨。架构上分三层——轻量路由层决定用哪个模型、可组合...

推荐理由:Garry Tan 把自用的 GBrain 开源,这件事我会先打个折——正文没披露 repo 活跃度、具体架构和有没有测试,所以别当成熟产品看。但亮点在于他真用了 5 个月,啃了 20 多本书、攒了 10 万页以上的结构化知识,说明系统至少跑通了个人知识复利这条链路。对想用模型管自己资料的人来说,这是个有参考价值的开源起点,不是公关稿。

AI HOT 精选

Redis 作者用几千行 C 代码把 DeepSeek V4 Flash 塞进 MacBook,跑出 27 tok/s

Antirez 开源了一个叫 ds4 的推理引擎,专门给 DeepSeek V4 Flash 用。代码只有几千行 C,能在 128GB 内存的 MacBook Pro 上跑 100 万 token 上下文的模型。他用了三招:对 MoE 专家做不对称 2-bit 量化来压缩模型体积;把 KV Cache 搬到高速 SSD 上,绕开内存不够的问题;再给苹果...

推荐理由:Antirez 开源了一个叫 ds4 的原生推理引擎,几千行 C 代码,在 128GB 内存的 MacBook Pro 上跑 DeepSeek V4 Flash,1M 上下文实测跑到 27 tok/s。我会先打个折,这个速度是在特定硬件和模型上跑出来的,换台机器不一定能复现,但至少证明了不用显卡也能把大模型跑起来。正文没披露量化精度和功耗,这点先别太激动。整体看,这是一个很强的开源推理信号,对关注本地部署和隐私的团队有参考价值。

新智元 · 公众号

港中文开源 ArbiterOS:在模型动手前先拦一刀,高危操作拦截率拉到 92.95%

港中文 CURE 实验室把 ArbiterOS 开源了,这是一个给 AI 智能体(Agent)用的运行时治理内核。它的思路很直接:不让模型直接拿到执行权,而是在模型生成操作指令后、系统真正执行前,插一层拦截、解析、治理和观测。在 OpenClaw 的安全测试任务上,这套机制把高危步骤的拦截率从原来的 6.17% 提到了 92.95%。正文没披露具体延迟...

推荐理由:这篇不是大厂模型发布,是港中文 CURE Lab 的一个开源 agent 安全内核。我会先打个折,因为目前只在 OpenClaw 一个环境上测过,泛化性还没验证。但它的切入点很巧——不是事后审核,而是运行时拦截高危步骤,把拦截率从 6.17% 拉到 92.95%,这个提升幅度够大,说明原来的 agent 几乎不设防。对做 agent 安全或工具调用治理的人来说,这是个能直接拿来改的参考方案。信息量够,数字有解释,没有吹概念,所以放在 featured 档,重要性给 80 是合适的。

机器之心 · 公众号

港科大和社区开源了 StarVLA,一个框架把主流视觉-语言-动作模型串了起来

StarVLA 把 VLA(视觉-语言-动作模型)里常用的主干网络、动作输出头、训练策略和评测接口都做成了可插拔的模块,不用再为不同论文各搭一套代码。仓库在 GitHub 上已经拿到 2.2k 星,支持的基准包括 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。正文没披露具体训练成本和...

推荐理由:我会先打个折:StarVLA 目前是框架级发布,不是新模型,所以权重不会给到模型首发那么高。但它的价值很实在——把多种 VLA 架构塞进同一套接口,训练和评估不用再东拼西凑,2.2k star 说明社区已经用脚投票了。正文没披露框架内各方法的横向对比数据,这点先别太激动,但统一工具这件事本身对机器人方向的工程效率提升是实打实的。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

5月8日星期五

Hacker News 首页

re_gent:给 AI 编程助手配一个 Git,能回滚、能查它为什么改文件

regent-vcs 开源了一个叫 re_gent 的工具,想给 AI 编程助手(目前只支持 Claude Code)加上类似 Git 的版本控制。它能记录 AI 为什么改某个文件、支持把整个对话过程回滚到之前的状态,还能用二分法定位 AI 的哪一步操作引入了问题。项目刚发布,正文没披露许可证、数据存储格式和具体安装步骤,目前只有 42 个星标和 2 ...

推荐理由:HKR 三条都站得住:Git 的类比让人一眼就懂,功能描述具体到删除追踪和 bisect,Claude Code 用户回退的痛点是真实存在的。不过正文没披露许可证、存储格式和安装方式,信息缺口明显,所以分数先打个折,放在 featured 这一档。

AI HOT 精选

Anthropic 把开源对齐测试工具 Petri 捐给了独立机构 Meridian Labs

Anthropic 把自家用来测模型有没有撒谎、拍马屁、配合危险请求的开源工具箱 Petri,转交给了非营利评测机构 Meridian Labs。这么做是为了让工具脱离 AI 公司,评测结果更中立、更让人信服。Petri 从 Claude Sonnet 4.5 起就参与内部对齐检查,英国 AI 安全研究所也用它来评估模型会不会破坏 AI 研究。这次同步...

推荐理由:Anthropic 把对齐测试工具 Petri 捐给 Meridian Labs,条件是保持独立性和公信力,这件事本身就挺有意思——相当于把裁判权从自己手里交出去。Petri 3.0 的核心改动是把审计模型和目标模型拆开,Dish 能接真实部署环境,再加上 Bloom 做行为评估,让独立审计有了实操基础。正文说多轮 VQA 压缩 90% 视觉 Token 精度不掉,这个数字如果经得起第三方复现,确实挺省钱。不过目前还没看到独立验证结果,我会先把这个判断挂在信息缺口上。整体来看,这件事对做多模态推理优化和安全评测的人都有参考价值,放在 feature...

AI HOT 精选

antirez 开源了 DeepSeek 4 Flash 的本地推理引擎,专跑在苹果芯片的 Metal 上

Redis 作者 antirez 在 GitHub 上放出了一个叫 ds4 的项目,是一个让 DeepSeek 4 Flash 模型在 Mac 上本地跑的推理引擎。它直接调用苹果的 Metal Performance Shaders 来降低延迟和内存占用,相当于给模型配了个更底层的加速驱动,而不是简单套个壳。不过项目页面没给出具体的跑分数据,实际快多少...

推荐理由:我会先打个折:正文没给任何延迟或内存占用的实测数字,所以性能到底多好现在说不准。但值得盯的不是又一个模型壳,而是这套 Metal 本地推理栈——它把推理引擎直接做进苹果的图形加速框架里,思路比多数套壳方案更底层。对想在 Mac 上离线跑模型的人来说,这是个能省钱的路线,只是验证还得等社区跑出数据。

5月7日星期四

AI HOT 精选

商汤 SenseNova-U1 开源 8 步蒸馏 LoRA,扩散模型推理从 23 秒压到 2 秒

商汤把扩散模型常用的 100 步生成流程蒸馏到只剩 8 步,GPU 上跑一张图从 23 秒降到 2 秒,快了 11 倍。做法是训了一个 LoRA 权重,直接挂到模型上就能用,不用改原模型结构。配套给了 ComfyUI 工作流,覆盖文生图、改图和交错生成。正文没提具体画质对比和什么显卡跑的,这点先别太激动。核心信号不是参数堆得多大,而是用蒸馏换延迟,让扩...

推荐理由:我会先打个折:这只是图像生成领域的推理加速,不是通用模型突破,所以放在featured而不是P1。但它的钩子很实在——用8步蒸馏LoRA把扩散模型从100步砍到8步,GPU推理从23秒压到2秒,还直接支持ComfyUI。对干活的人来说,这意味着同样的卡能多跑十几倍的图,或者低配机器也能玩。正文没披露蒸馏用了多少样本、LoRA参数量多大,这点先别太激动,但开源这一步本身就让验证成本很低。

r/LocalLLaMA

在单张 RTX 3090 Ti 上跑 Qwen3.5/3.6 的 NextN MTP 投机解码指南

Reddit 用户分享了一个 llama.cpp 实操指南,用单张 RTX 3090 Ti 跑 Qwen3.5 和 3.6 的 NextN MTP(多 token 预测,一种让模型一次猜好几个词来加速生成的技术)。目前需要打两个还没合并的 PR:#22400 和 #22673。实测 Qwen3.6-35B-A3B-MTP 模型在 350W 功耗、170...

推荐理由:我会先打个折:这是 Reddit 个人指南,依赖两个没合进主线的 PR,稳定性没保证。但亮点很实在——单卡 3090 Ti 跑 35B 模型冲到 157 tok/s,还点出了 nextn=q8_0 量化覆盖这个坑,漏掉会输出乱码。对想在家用显卡上榨性能的 AI 从业者来说,这份功耗、频率、KV 缓存设置都给了,可操作性强。正文没披露模型精度损失和长文本下的速度衰减,这点先别太激动。

AI HOT 精选

Open Slide 用 React 写 PPT,让 AI 直接生成和修改幻灯片代码

Open Slide 是一个开源项目,把 PPT 当成 React 组件来写,工作流专门为 AI agent 设计。它用 React 组件库做扩展,方便接入各种图表。项目自带可视化编辑器,你可以手动改,AI 也能直接读你的批注来协同修改内容。它还集成了 SVGL 库,里面有 1500 多个品牌 Logo,做技术演示时直接拖就行。整体思路是让 AI 进到...

推荐理由:我会先打个折:正文没给出实际使用数据或上手测试,所以效果到底怎么样还不好说。但“PPT 变成可编程界面”这个思路本身值得关注,它把幻灯片从拖拽排版变成了代码生成,AI 能直接参与修改和迭代。1500+ Logo 库和评论驱动改稿这两个点让产品有了具体抓手,不只是又一个套壳工具。对经常做演示文档的人来说,省掉排版和反复调整的时间是实打实的价值。

r/LocalLLaMA

Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token

Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。

5月6日星期三

r/LocalLLaMA

CopilotKit:一套 MIT 开源的 React 组件,帮你给 AI 应用搭聊天界面和生成式 UI

CopilotKit 是一套 MIT 协议开源的 React 组件库,专门用来给 agent 类应用搭前端。它把聊天、流式输出、工具调用、人机协同(HITL)和生成式 UI 这些常见需求都做成了现成的积木块。项目在 GitHub 上有 3 万颗星。它支持 AG-UI 协议,可以对接 LangGraph、CrewAI、LlamaIndex 等后端框架,核...

推荐理由:HKR 三项都踩中了:MIT 开源、3 万星、AG-UI 把 UI 和后端解耦,对做 Agent 产品的人是个实在的钩子。分数压在 74 没往上拉,因为正文没给新版本号、没跑分、也没点名哪个生产环境在用,信息量就到这儿。

r/LocalLLaMA

Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍,48GB 显存可跑 26 万上下文

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者分享了一个 llama.cpp 的 PR,为 Qwen 3.6 27B 模型添加了 MTP(多令牌预测)支持,实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化,这让一...

推荐理由:HKR 三项都站得住:提速和长上下文对本地 agent 是实打实的吸引力,帖子里机制和数字都列清楚了,成本优势也直接。不过只有 Reddit 单源,配置也有点折腾,所以放在 featured 低位。

机器之心 · 公众号

阿里开源 PromptEcho:用冻结的视觉语言模型给文生图训练打分,省掉额外训练成本

PromptEcho 的做法很直接:拿一个现成的、参数冻结的 Qwen3-VL-32B 模型,让它“读”一遍原始提示词,算出模型自己生成这些词的概率(交叉熵),然后把这个概率的负值当作连续奖励信号,喂给文生图模型做训练。好处是不用再单独训一个评分模型,省事。在 5000 张海报测试里,文字准确率从 68% 提到了 75%。不过正文没披露这个奖励信号跟人...

推荐理由:我会先打个折:这不是一个新模型发布,而是训练侧的 reward 方法开源,所以重要性给 78 算合理。钩子在于冻结大模型直接当 reward 用,省成本;知识密度够,把 teacher-forcing CE 怎么变成连续 reward 讲明白了,还给了 10 万张图的规模和具体数字;相关性上,文生图圈对廉价 reward 和文字准确率这两个需求很实在,75% 虽然不算完美,但方向对。正文没披露这个 reward 方法在更大规模训练下的稳定性,这点先别太激动。

机器之心 · 公众号

DeepSeek版Claude Code登顶GitHub热榜,8700星,一个叫鲸鱼哥的开发者用Rust做了个终端工具

这个叫DeepSeek TUI的工具在GitHub上拿了8700多颗星,是开发者Hunter Bown(鲸鱼哥)用Rust写的,让你在本地终端里直接调用DeepSeek V4干活。它能聊天、改文件、跑shell命令、管任务。比较特别的是RLM模式:一次可以派发最多16个V4 Flash子任务,上下文窗口有100万token,操作前还有审批关卡,等于让模...

推荐理由:我会先打个折:这是个人项目,不是 DeepSeek 官方出品,稳定性和后续维护都还是未知数。但 8700 星的热度是实打实的,RLM 的并发和审批设计也给了具体的技术细节,不是空炒概念。对想省钱又想在终端里用 DeepSeek 干活的开发者来说,这东西值得盯一下,但暂时别把它当生产工具。

机器之心 · 公众号

明略开源两套工具,让 Mac 跑本地模型和操控桌面

明略科技放出了两个开源项目:Cider 和 Mano-P 1.0,都是给苹果 M 系列芯片用的。Cider 是个推理加速引擎,在 M5 Pro 上跑 Qwen3-VL-2B 时,把生成第一个 token 前的等待时间缩短了 57% 到 61%。Mano-P 1.0 是个能操作电脑界面的模型,72B 版本在 OSWorld 测试里拿了 58.2 分。不过...

推荐理由:我会先打个折:明略不是一线模型实验室,所以分数没往上拉。但选题本身够实用——Mac 本地跑视觉模型和 GUI 智能体,还给了可复现的提速数据和内存门槛。Cider 的 prefill 加速和 Mano-P 在 OSWorld 的成功率都有具体数字,16GB 设备准确率下降也写明了,不是纯 PR 稿。对想在 Apple Silicon 上折腾本地推理的人,这篇值得看一眼。