跳到正文

#开源/仓库

今日 3 条

5月16日星期六

Hacker News 首页

SANA-WM:一个 26 亿参数的开源世界模型,能根据单张图片和镜头轨迹生成 1 分钟 720p 可控视频

NVIDIA 放出了一个叫 SANA-WM 的开源模型,参数规模 26 亿,主打的是用一张图加一条镜头移动路线,直接生成长达一分钟的 720p 视频。它把长视频生成拆成两步:先用一个混合线性注意力的主干网络跑出长序列粗稿,再用一个 170 亿参数的精修模型去改善纹理、动作和后半段的画质。训练成本不算高,64 块 H100 跑 15 天,用了约 21.3...

推荐理由:标题说 SANA-WM 是个 2.6B 参数的开源世界模型,能生成 1 分钟 720p 视频。我会先打个折:正文只给了链接、9 分和 8 条评论,训练数据、许可证、推理成本、跟其他模型的对比跑分全都没披露。2.6B 这个尺寸在视频模型里算小的,如果真能稳定跑一分钟不崩,推理成本可能比较友好,但这点先别太激动,因为没看到任何实测证据。开源是个加分项,不过没写是什么许可证,商用能不能用还不清楚。整体看,这是个有话题度的发布,但信息缺口很大,实际能力得等更多细节出来才能判断。

AI HOT 精选

OpenClaw 团队跑着 100 个 AI 实例干活,完全不看 token 账单

OpenClaw 项目组把 AI 用量拉满,常驻约 100 个 Codex 实例,把代码审查、安全扫描、issue 去重归类、测试环境复现并录屏验证、从会议里自动建任务、垃圾评论过滤和性能回退监控全交给它们跑。他们用 clawpatch.ai 把项目拆成功能单元做审查,还接了 Vercel DeepSec 做安全分析。正文没披露具体花了多少钱,但明确说...

推荐理由:我会先打个折:这只是一条X上的分享,没有披露成本、效果指标或可复现的搭建方式,所以别当成熟方案看。但它的钩子很准——用约100个Codex实例同时干代码审查、安全分析、议题去重、测试复现、任务创建、垃圾过滤和性能回归监控这七件事,还明说“无视令牌成本”,对正在琢磨AI agent怎么落地的从业者来说,是个有参考价值的实操片段。H、K、R都成立,放在featured里偏低的位置刚好。

5月15日星期五

AI HOT 精选

X 把“为你推荐”的算法开源了,用的还是 Grok 同款 Transformer

X 在 GitHub 上公开了“For You”信息流的推荐管道,代码、预训练模型和内容理解服务都给了。核心是一套叫 Phoenix 的 Transformer 模型,基于 Grok 架构,负责给候选帖子打分。它会看用户最近跟谁互动,同时预测点赞、回复、转发这些行为的概率,揉成一个相关性分数。排序前会先捞候选内容,补上上下文,再让模型评分,最后做多样性...

推荐理由:HKR 三项都踩中了,但正文只说了开源和 Phoenix Transformer 打分机制,仓库细节、许可证、能不能复现都没提,所以先给 featured 里偏低的位子。

AI HOT 精选

飞书命令行工具 lark-cli 45 天 GitHub 破万星,AI 操作每一步都能预览和审查

飞书开源了一个叫 lark-cli 的命令行工具,45 天在 GitHub 上拿到超过一万颗星,是国内办公套件里第一个破万星的开源项目。这个工具让 AI 能直接在命令行里建群、建文档,而且每一步操作都会先展示出来让你确认,不是那种在云端黑盒执行的 MCP 模式。主干代码已经合并了 10 位外部开发者的贡献,对比钉钉和企业微信同类项目的外部贡献是零。这种...

推荐理由:我会先打个折:信息只来自一篇社交帖子,没披露实际使用量、贡献者数量或企业采纳数据,所以放在 featured 偏低的位置。但 45 天万星这个速度本身说明开发者对“AI 操作可见可控”这个方向有需求,工具形态是命令行,意味着可以嵌进自动化流程,这点比纯界面演示更实在。正文没提和钉钉同类能力的对比,也没说后续维护计划,先当一次开源动作看。

量子位 · 公众号

160行代码就能跑通LeCun的JEPA世界模型

一个叫keon/jepa的开源教学库把LeCun提出的JEPA世界模型拆成了5个独立变体,每个都用单个PyTorch文件实现,最短160行,最长278行,只依赖PyTorch和torchvision。其中iJEPA在CIFAR-10上跑了100轮,线性探测准确率52.7%,不算高,但胜在代码够短、能跑通。V-JEPA、C-JEPA和LeWorldMod...

推荐理由:我会先打个折:这不是新模型或新论文,是一个教学仓库,把 JEPA 的几个变体写成极简 PyTorch 单文件,方便看懂核心思路。亮点是代码量压到 160 行起步,依赖干净,适合想快速上手世界模型、又不想啃大项目的人。正文没披露训练数据或性能对比,所以别当生产级工具用,但作为学习材料够直接。

5月14日星期四

r/LocalLLaMA

单卡跑通一句话生成电影级短片:FLUX.2 出角色,Wan2.2 做动画,带自动质检和 9 语配音

这个叫 StudioMI300 的开源流水线,把一句英文提示词变成 720p 短片,全程跑在一张 AMD Instinct MI300X 上。流程分 8 步:先用 FLUX.2 [klein] 生成角色关键帧,再用 Wan2.2-I2V 把静态图转成动画,中间加了一道视觉评分和自动重试的质检,最后配上音乐和 9 种语言的旁白。开发者把单条片子的生成时间...

推荐理由:HKR 三项都成立:帖子把一句提示词到成片的完整链路讲清楚了,有硬件型号、阶段数和压缩后的耗时,对想自己搭视频管线的开发者来说,省钱和可控这两点很抓人。不过来源只有 Reddit 单帖,没有第三方复现或更多验证,所以分数没再往上走。

AI HOT 精选

腾讯开源 Agent Memory:用“任务地图”和上下文卸载,让 Token 消耗降低 61%

腾讯云开源了 TencentDB Agent Memory,专门解决 AI Agent 在长任务里上下文窗口被快速撑爆的问题。核心思路分两步:一是用 Mermaid 流程图把任务执行过程画成一张可折叠、可展开的“任务地图”,让 Agent 随时知道自己在哪、哪些步骤有依赖;二是做上下文卸载,把工具返回的完整结果存到外部文件,上下文里只留一行摘要和索引路...

推荐理由:腾讯云把 Agent Memory 开源了,主打上下文卸载和用 Mermaid 图当任务画布,多任务连续对话里最高能省 61% 的 Token。这个数字对跑生产级 Agent 的团队来说挺实在,不是实验室刷榜。不过正文没给出对比基准和测试场景细节,实际能省多少得自己测。整体不是大模型发布那种量级,但作为成本优化工具,放在 featured 里提醒一下同行是合适的。

量子位 · 公众号

摩尔线程把 SGLang 的 MUSA 后端合进了主线,还拉来核心开发者一起聊了聊

摩尔线程办了一场 SGLang × MUSA 线下交流会,宣布 MUSA 后端已经并入 SGLang 主分支。截至 5 月 12 日,他们一共提了 47 个 PR,其中 41 个被合并。不过正文因为环境验证问题没能加载出来,具体技术细节和现场讨论内容暂时看不到。

推荐理由:我会先打个折:这不是模型发布,也不是平台级大更新,更像推理后端生态的一次实质性进展。但 47 个 PR、41 个合入的数字说明摩尔线程不是挂个名,是真在往 SGLang 主线里交代码。对国内做推理部署的人来说,MUSA 后端进主线意味着以后用 SGLang 时多了一条国产卡的路,这点先别太激动,正文没披露实际性能对比和线上规模,但至少代码层面已经打通了。

AI HOT 精选

OpenSquilla 用本地路由和缓存把大模型传输量砍掉九成以上

OpenSquilla 这个开源项目把模型路由决策放在本地跑,不花 token 就能判断问题难易:简单问题丢给便宜模型,复杂问题才上强模型。它靠增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下。记忆模块会在上下文快满时自动挑重点压缩,还支持混合检索。正文没披露具体测试场景和模型阵容,所以这 90% 的降幅在什么任务上测出来的还不清楚...

推荐理由:我会先打个折:信息来自一篇 X 上的项目帖,仓库实际活跃度、测试环境和局限性正文都没披露,所以别急着全信。但它的思路很实在——用本地路由和缓存把要传给大模型的 Token 砍掉九成,等于把“外挂资料库”和推理优化打包成一个开源工具。对正在想办法压推理成本的小团队来说,哪怕只实现一半效果也值得关注。

r/LocalLLaMA

商汤发布 SenseNova-U1-A3B-MoT,一个模型搞定看图、推理和生成

商汤在 Hugging Face 上放出了 SenseNova-U1-A3B-MoT 模型,同时提供了 A3B MoT、8B MoT 和 0.4B LoRA 权重链接。按官方说法,这套模型用 NEO-unify 架构把多模态理解、推理和生成统一到一个模型家族里。不过 Reddit 原帖被网络屏蔽了,正文没披露具体性能数据、训练细节和实际跑分,想试的话得...

推荐理由:SenseNova 在 Hugging Face 扔了一套多模态模型权重,A3B MoT、8B MoT 加一个 0.4B LoRA,主打 NEO-unify 架构,说能把看图、推理和生成塞进一个模型。我会先打个折:正文没给任何 benchmark 分数,也没写清楚开源协议,所以性能好坏和商用限制现在全是问号。亮点是 LoRA 权重只有 0.4B,对想用消费级显卡跑多模态任务的人挺友好,这点先别太激动,等实测出来再看。整体属于有料但缺关键信息的发布,给个 featured 低段位合理。

5月13日星期三

AI HOT 精选

开源 psql_bm25s:让 PostgreSQL 做 BM25 检索,比 pg_search 快 23 倍

团队把 psql_bm25s 开源了,它是一个 PostgreSQL 原生访问方法,直接在数据库里跑精确的 BM25 检索。在标准基准测试上,它比 pg_search 快大约 23 倍。这个速度提升意味着,在多智能体系统里,检索不再拖后腿,也不用额外烧钱,智能体查数据能快很多。正文没披露具体测试用的数据集、硬件配置和查询类型,所以这个 23 倍先打个折看。

推荐理由:我会先打个折:这是单方开源发布,没有独立复现和线上生产环境的约束说明,所以别急着当最终结论。但“23 倍”这个数字确实抓人,它说明用原生访问方法在 Postgres 里跑 BM25 可以省掉不少外部依赖和延迟,对把 Postgres 既当主库又当检索库的团队是个省钱省运维的信号。正文没披露并发写入下的性能退化、索引构建耗时和资源占用,这点先别太激动。

r/LocalLLaMA

小米把 1 万亿参数的 MiMo-V2.5-Pro 开源了,但自己跑真的划算吗?

小米放出了 MiMo-V2.5-Pro,参数总量 1.02 万亿,但每次推理只激活 420 亿参数,上下文窗口能塞进 100 万个 token,用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务,走 API 总共花了 70.12 美元,处理了约 3.87 亿个 token,缓存命中率高达 96.3%。这个命中率说明大部分请求其实...

推荐理由:我会先打个折:正文没披露 MiMo-V2.5-Pro 的评测跑分,所以性能好坏只能靠参数规模猜。但这条信息本身够直接——小米把一个 1.02 万亿参数、42B 激活的模型开源,另一边作者用 Claude Code 跑了 125 次会话,3.87 亿 token 花了 70.12 美元,缓存命中率 96.3%。这两组数字摆在一起,自建成本和 API 开销的对比就出来了。对做工程的人,这种一手成本数据比技术报告更有参考价值。

新智元 · 公众号

清华系开源 MiniCPM-V 4.6:1.3B 多模态模型,一张 4090 就能全量微调

面壁智能、清华和 OpenBMB 放出了 MiniCPM-V 4.6,一个 13 亿参数的多模态模型。它最大的卖点是能在一张 RTX 4090 显卡上完成全量微调,不用再靠低秩适配这类折中方案。模型提供了两种视觉 token 压缩模式:4 倍压缩追求精度,16 倍压缩追求速度,让开发者自己按场景选。正文没披露具体的训练数据量和详细评测基准,这点先别太激...

推荐理由:HKR 三项都成立:一条具体的开源多模态模型发布,给了参数量、硬件条件和 token 压缩方案,把本地微调成本压到一张消费级显卡。不是前沿大厂的旗舰发布,但实用性强,82 分合理。

r/LocalLLaMA

有人把 Transformer 语言模型塞进了原装 Game Boy Color 里跑

maddiedreese 把 Andrej Karpathy 的 TinyStories-260K 模型成功跑在了一台没改过硬件的 Game Boy Color 上。他用 INT8 量化权重、定点数运算,把模型和 KV 缓存塞进 MBC5 卡带的 bank-switched ROM 和 SRAM 里,全程不靠手机、电脑、Wi-Fi 或云端推理。不过输出...

推荐理由:一个 Reddit 硬件 hack,把 TinyStories-260K 塞进原装 Game Boy Color,用 INT8 和定点数学跑推理,KV cache 放在卡带 SRAM 里。输出慢到没法用,而且基本是乱码,所以别当产品看。但能在这种老设备上把 transformer 跑起来,本身就挺酷,技术细节也给得实在,适合当一条有趣的行业花絮。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

5月12日星期二

AI HOT 精选

开放模型生态如何滚起雪球

作者 Nathan Lambert 从中国 AI 圈几乎全员开源的现状出发,聊了聊开放模型生态真正的省钱逻辑。核心判断是:造前沿模型的大头成本不在最终训练,而在研发试错,这部分算力开销可能占到 80%。中国各家实验室通过详细技术报告和刻意分享,相当于帮同行排了雷,避免重复烧钱做实验,形成了一种靠信息共享降低未来研发成本的复合增长。文章也指出,开源 AI...

推荐理由:这篇文章不是产品发布,而是一篇评论,核心观点是开源模型生态正在自我强化。我会先打个折:正文没披露下载量的绝对基数,200% 的环比增长到底是从 1 万涨到 3 万还是从 100 万涨到 300 万,差别很大,这点先别太激动。但它把开源模型的扩散、微调、再发布串成一个复合增长飞轮,这个框架比单纯报数字更有价值。对做模型选型和成本估算的从业者来说,这个趋势意味着国产开源模型的可用性在快速爬坡,值得关注。

AI HOT 精选

想让 AI 当个人管家?先得把你在淘宝、京东、美团上的消费记录弄出来

作者实测了五个主流消费平台的数据导出方法。淘宝自带导出功能;京东没有官方支持,但作者用 Codex 写了个 Chrome 插件,能一键导出订单,代码已开源在 GitHub;饿了么可以申请导出 Excel;美团外卖目前完全没办法导出;大众点评的收藏列表也能通过定制插件导出来。作者把京东和大众点评的工具都开源了,目的是让用户拿这些消费数据喂给 AI Age...

推荐理由:这篇文章不是平台官方发布,是一个开发者的实操记录,所以重要性停在 featured 档。但 H、K、R 三项都踩中了:用订单数据喂 AI 助手这个切入点够抓人,5 个平台的具体导出方式是新事实,开源工具直接降低了数据可移植性的实现成本。我会先打个折——正文没披露导出数据的字段完整度和后续清洗工作量,这点先别太激动,但作为动手参考已经够用。

机器之心 · 公众号

字节开源 DreamLite:0.39B 参数模型在 iPhone 上 3 秒出图,不用联网

DreamLite 是字节跳动开源的一个统一扩散模型,参数量只有 3.9 亿,能在 iPhone 17 Pro 上直接跑,生成或编辑一张 1024×1024 的图大约 3 秒。它靠 DMD2 蒸馏技术把推理压缩到 4 步,全程在手机本地完成,不依赖云端。正文没披露具体的显存占用和功耗数据,也没给出不同机型上的实测对比,所以“秒变画板”这个说法先打个折—...

推荐理由:字节把扩散模型压到 0.39B 参数,在 iPhone 17 Pro 上离线跑 1024×1024 生图和编辑,约 3 秒出结果,靠的是 4 步 DMD2 蒸馏把推理步数砍下来。我会先打个折:正文没披露功耗、内存占用和量化方案,也没给不同机型的对比,所以“手机秒变画板”这个说法先别太激动。但参数和实测平台都给了,比光喊口号实在。作为开源端侧方案,对在意离线、低延迟和隐私的开发者有参考价值,只是目前只有一篇 Reddit 帖子,没有论文或代码仓库链接,可信度要打个问号。

r/LocalLLaMA

Reddit 网友实测 288 次模型调用,把本地模型输出 JSON 时的各种翻车方式全整理了一遍,还写了个修复库

Reddit 用户 kexxty 用 OpenRouter 跑了 288 次结构化输出测试,覆盖 Llama 3、Mistral、Command R、DeepSeek、Qwen 等模型,发现本地模型和纯 API 模型在 JSON 上出的错其实差不多。他把这些失败归类后,写了一个叫 outputguard 的 Python 修复库,用 MIT 协议开源。...

推荐理由:HKR 三项都成立:288 次调用不是随便跑跑,outputguard 库和 15 步修复链给了可复用的实操细节。信息源是单篇 Reddit 帖子,没有第三方验证或论文背书,所以放在 72-77 的 featured 档位,不往上走。

5月11日星期一

AI HOT 精选

Anthropic 在 GitHub 开源了一套金融 AI 模板,直接给投研、投行、风控配好了 10 个智能体和 11 家数据商的连接器

这套模板把金融行业里常见的 AI 用法打包成了开箱即用的工作流,覆盖投研、投行、风控等核心环节。里面塞了 10 个端到端智能体、7 个垂直插件,还接好了 11 家主流金融数据商的 MCP 连接器,等于把模型跟 Bloomberg 这类数据源的通路提前打通了。部署方式从个人插件到企业 API 都支持,也能塞进 Microsoft 365 和私有云。正文没...

推荐理由:我会先打个折:这不是模型发布,所以重要性到不了 85 分,但开源一套能跑的金融 agent 模板,比发篇愿景文章实在得多。Anthropic 把 10 个端到端智能体、7 个插件和 11 家数据商的 MCP 连接器打包扔上 GitHub,等于给金融行业的 AI 落地画了一条参考线,别人想跟进得先过这一关。正文没披露这些 agent 在生产环境跑到什么程度、延迟和准确率怎么样,所以别急着当成熟方案用,但作为起点,信息量和可复现性都够格进 featured。

5月10日星期日

r/LocalLLaMA

ByteBell 开源了一套代码索引方案:用 LLM 给每个文件生成语义信息存进图数据库,比向量、语法树和暴力塞上下文都管用

他们试了三种路线:向量相似度搜代码、用抽象语法树(AST)结构化匹配、以及直接把代码块塞进大窗口模型。最后发现,让 LLM 先给每个文件提炼出用途、摘要、业务背景、实体、类、函数、关键词和依赖关系,存到 Neo4j 图数据库里,再用全文搜索去查,效果最好。正文没披露具体评测指标和对比数据,这点先别太激动。工程上有个省钱设计:用 SHA-256 比对文件...

推荐理由:我会先打个折:文章来自 Reddit 分享,没有给出系统性的对比数据和量化指标,所以不能当正式评测看。但它的价值在于把一条反直觉的工程结论讲清楚了——向量、AST、暴力塞上下文都试过,最后是语义图赢了。做法也够具体:逐文件跑 LLM 摘要写入 Neo4j,用 SHA-256 diff 做增量更新,只重建改过的文件。这对正在搭代码检索或 agent 的人是个直接可抄的思路,踩坑记录比方法论更有用。信息缺口是没披露用了哪个模型做摘要、图查询的延迟和成本也没给,这点先别太激动。

r/LocalLLaMA

网友用一张 RTX PRO 6000 工作站显卡跑起了 DeepSeek V4 Pro

Reddit 用户 fairydreaming 发帖说,他在自己机器上跑通了 DeepSeek V4 Pro。用的是一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡,搭配修改过的 llama.cpp CUDA 分支。模型文件是 Q4_K_M 量化版,体积 859GB。他分享的日志显示,在 1M 上下文窗口下,生成速度跑到每秒 ...

推荐理由:我会先打个折:这是 Reddit 单帖,没有第三方复现,稳定性、量化损失、长上下文下的实际效果都还没谱。但帖子里把文件大小、上下文长度、生成速度和运行分支全摊出来了,对想自己折腾本地推理的人来说,比很多官方博客都直接。单卡跑 859GB 模型这件事本身就是一个信号——大模型本地化的硬件门槛在往下走,这点先别太激动,但值得盯着。

r/LocalLLaMA

BeeLlama.cpp:用 DFlash 和 TurboQuant 让 Qwen 3.6 27B 在单张 3090 上跑 20 万上下文,速度翻倍

Anbeeld 发了一个 llama.cpp 的分支 BeeLlama.cpp,主要加了 DFlash(一种省显存的注意力机制)和 TurboQuant(更快的量化方案),还支持推理和视觉任务。标题里说在单张 RTX 3090 或 4090 上跑 Qwen 3.6 27B 的 Q5 量化版,能塞进 20 万 token 的上下文,速度比原版快 2 到 ...

推荐理由:我会先打个折:这些数字来自 Reddit 标题和摘要,没有独立复现,135 tps 的峰值在什么输入长度、什么 batch 下跑的也没说清楚。但就算打个七折,单张 3090 把 27B 模型塞进 200k 上下文还能跑到可用的速度,对个人开发者和小团队确实省钱。BeeLlama.cpp 看起来是在 llama.cpp 上做了 DFlash 和 TurboQuant 的工程优化,正文没披露具体技术细节和稳定性测试,这点先别太激动。整体算一次值得关注的本地推理更新,所以放在低位的 featured。

5月9日星期六

AI HOT 精选

YC 老板 Garry Tan 开源了自己的 AI 系统 GBrain,五个月读了 20 多本书,管着 10 万页知识

Garry Tan 把 GBrain 放上了 GitHub,这是他给自己搭的一套个人 AI 操作系统,想做成能持续增值的“第二大脑”。系统按任务拆成几个模块:Book Mirror 负责深度处理书籍,Meeting Prep 自动做会前预习,五个月啃完 20 多本书,结构化知识库超过 10 万页,还在涨。架构上分三层——轻量路由层决定用哪个模型、可组合...

推荐理由:Garry Tan 把自用的 GBrain 开源,这件事我会先打个折——正文没披露 repo 活跃度、具体架构和有没有测试,所以别当成熟产品看。但亮点在于他真用了 5 个月,啃了 20 多本书、攒了 10 万页以上的结构化知识,说明系统至少跑通了个人知识复利这条链路。对想用模型管自己资料的人来说,这是个有参考价值的开源起点,不是公关稿。

AI HOT 精选

Redis 作者用几千行 C 代码把 DeepSeek V4 Flash 塞进 MacBook,跑出 27 tok/s

Antirez 开源了一个叫 ds4 的推理引擎,专门给 DeepSeek V4 Flash 用。代码只有几千行 C,能在 128GB 内存的 MacBook Pro 上跑 100 万 token 上下文的模型。他用了三招:对 MoE 专家做不对称 2-bit 量化来压缩模型体积;把 KV Cache 搬到高速 SSD 上,绕开内存不够的问题;再给苹果...

推荐理由:Antirez 开源了一个叫 ds4 的原生推理引擎,几千行 C 代码,在 128GB 内存的 MacBook Pro 上跑 DeepSeek V4 Flash,1M 上下文实测跑到 27 tok/s。我会先打个折,这个速度是在特定硬件和模型上跑出来的,换台机器不一定能复现,但至少证明了不用显卡也能把大模型跑起来。正文没披露量化精度和功耗,这点先别太激动。整体看,这是一个很强的开源推理信号,对关注本地部署和隐私的团队有参考价值。

新智元 · 公众号

港中文开源 ArbiterOS:在模型动手前先拦一刀,高危操作拦截率拉到 92.95%

港中文 CURE 实验室把 ArbiterOS 开源了,这是一个给 AI 智能体(Agent)用的运行时治理内核。它的思路很直接:不让模型直接拿到执行权,而是在模型生成操作指令后、系统真正执行前,插一层拦截、解析、治理和观测。在 OpenClaw 的安全测试任务上,这套机制把高危步骤的拦截率从原来的 6.17% 提到了 92.95%。正文没披露具体延迟...

推荐理由:这篇不是大厂模型发布,是港中文 CURE Lab 的一个开源 agent 安全内核。我会先打个折,因为目前只在 OpenClaw 一个环境上测过,泛化性还没验证。但它的切入点很巧——不是事后审核,而是运行时拦截高危步骤,把拦截率从 6.17% 拉到 92.95%,这个提升幅度够大,说明原来的 agent 几乎不设防。对做 agent 安全或工具调用治理的人来说,这是个能直接拿来改的参考方案。信息量够,数字有解释,没有吹概念,所以放在 featured 档,重要性给 80 是合适的。

机器之心 · 公众号

港科大和社区开源了 StarVLA,一个框架把主流视觉-语言-动作模型串了起来

StarVLA 把 VLA(视觉-语言-动作模型)里常用的主干网络、动作输出头、训练策略和评测接口都做成了可插拔的模块,不用再为不同论文各搭一套代码。仓库在 GitHub 上已经拿到 2.2k 星,支持的基准包括 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。正文没披露具体训练成本和...

推荐理由:我会先打个折:StarVLA 目前是框架级发布,不是新模型,所以权重不会给到模型首发那么高。但它的价值很实在——把多种 VLA 架构塞进同一套接口,训练和评估不用再东拼西凑,2.2k star 说明社区已经用脚投票了。正文没披露框架内各方法的横向对比数据,这点先别太激动,但统一工具这件事本身对机器人方向的工程效率提升是实打实的。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

5月8日星期五

Hacker News 首页

re_gent:给 AI 编程助手配一个 Git,能回滚、能查它为什么改文件

regent-vcs 开源了一个叫 re_gent 的工具,想给 AI 编程助手(目前只支持 Claude Code)加上类似 Git 的版本控制。它能记录 AI 为什么改某个文件、支持把整个对话过程回滚到之前的状态,还能用二分法定位 AI 的哪一步操作引入了问题。项目刚发布,正文没披露许可证、数据存储格式和具体安装步骤,目前只有 42 个星标和 2 ...

推荐理由:HKR 三条都站得住:Git 的类比让人一眼就懂,功能描述具体到删除追踪和 bisect,Claude Code 用户回退的痛点是真实存在的。不过正文没披露许可证、存储格式和安装方式,信息缺口明显,所以分数先打个折,放在 featured 这一档。

AI HOT 精选

Anthropic 把开源对齐测试工具 Petri 捐给了独立机构 Meridian Labs

Anthropic 把自家用来测模型有没有撒谎、拍马屁、配合危险请求的开源工具箱 Petri,转交给了非营利评测机构 Meridian Labs。这么做是为了让工具脱离 AI 公司,评测结果更中立、更让人信服。Petri 从 Claude Sonnet 4.5 起就参与内部对齐检查,英国 AI 安全研究所也用它来评估模型会不会破坏 AI 研究。这次同步...

推荐理由:Anthropic 把对齐测试工具 Petri 捐给 Meridian Labs,条件是保持独立性和公信力,这件事本身就挺有意思——相当于把裁判权从自己手里交出去。Petri 3.0 的核心改动是把审计模型和目标模型拆开,Dish 能接真实部署环境,再加上 Bloom 做行为评估,让独立审计有了实操基础。正文说多轮 VQA 压缩 90% 视觉 Token 精度不掉,这个数字如果经得起第三方复现,确实挺省钱。不过目前还没看到独立验证结果,我会先把这个判断挂在信息缺口上。整体来看,这件事对做多模态推理优化和安全评测的人都有参考价值,放在 feature...

AI HOT 精选

antirez 开源了 DeepSeek 4 Flash 的本地推理引擎,专跑在苹果芯片的 Metal 上

Redis 作者 antirez 在 GitHub 上放出了一个叫 ds4 的项目,是一个让 DeepSeek 4 Flash 模型在 Mac 上本地跑的推理引擎。它直接调用苹果的 Metal Performance Shaders 来降低延迟和内存占用,相当于给模型配了个更底层的加速驱动,而不是简单套个壳。不过项目页面没给出具体的跑分数据,实际快多少...

推荐理由:我会先打个折:正文没给任何延迟或内存占用的实测数字,所以性能到底多好现在说不准。但值得盯的不是又一个模型壳,而是这套 Metal 本地推理栈——它把推理引擎直接做进苹果的图形加速框架里,思路比多数套壳方案更底层。对想在 Mac 上离线跑模型的人来说,这是个能省钱的路线,只是验证还得等社区跑出数据。

5月7日星期四

AI HOT 精选

商汤 SenseNova-U1 开源 8 步蒸馏 LoRA,扩散模型推理从 23 秒压到 2 秒

商汤把扩散模型常用的 100 步生成流程蒸馏到只剩 8 步,GPU 上跑一张图从 23 秒降到 2 秒,快了 11 倍。做法是训了一个 LoRA 权重,直接挂到模型上就能用,不用改原模型结构。配套给了 ComfyUI 工作流,覆盖文生图、改图和交错生成。正文没提具体画质对比和什么显卡跑的,这点先别太激动。核心信号不是参数堆得多大,而是用蒸馏换延迟,让扩...

推荐理由:我会先打个折:这只是图像生成领域的推理加速,不是通用模型突破,所以放在featured而不是P1。但它的钩子很实在——用8步蒸馏LoRA把扩散模型从100步砍到8步,GPU推理从23秒压到2秒,还直接支持ComfyUI。对干活的人来说,这意味着同样的卡能多跑十几倍的图,或者低配机器也能玩。正文没披露蒸馏用了多少样本、LoRA参数量多大,这点先别太激动,但开源这一步本身就让验证成本很低。

r/LocalLLaMA

在单张 RTX 3090 Ti 上跑 Qwen3.5/3.6 的 NextN MTP 投机解码指南

Reddit 用户分享了一个 llama.cpp 实操指南,用单张 RTX 3090 Ti 跑 Qwen3.5 和 3.6 的 NextN MTP(多 token 预测,一种让模型一次猜好几个词来加速生成的技术)。目前需要打两个还没合并的 PR:#22400 和 #22673。实测 Qwen3.6-35B-A3B-MTP 模型在 350W 功耗、170...

推荐理由:我会先打个折:这是 Reddit 个人指南,依赖两个没合进主线的 PR,稳定性没保证。但亮点很实在——单卡 3090 Ti 跑 35B 模型冲到 157 tok/s,还点出了 nextn=q8_0 量化覆盖这个坑,漏掉会输出乱码。对想在家用显卡上榨性能的 AI 从业者来说,这份功耗、频率、KV 缓存设置都给了,可操作性强。正文没披露模型精度损失和长文本下的速度衰减,这点先别太激动。

AI HOT 精选

Open Slide 用 React 写 PPT,让 AI 直接生成和修改幻灯片代码

Open Slide 是一个开源项目,把 PPT 当成 React 组件来写,工作流专门为 AI agent 设计。它用 React 组件库做扩展,方便接入各种图表。项目自带可视化编辑器,你可以手动改,AI 也能直接读你的批注来协同修改内容。它还集成了 SVGL 库,里面有 1500 多个品牌 Logo,做技术演示时直接拖就行。整体思路是让 AI 进到...

推荐理由:我会先打个折:正文没给出实际使用数据或上手测试,所以效果到底怎么样还不好说。但“PPT 变成可编程界面”这个思路本身值得关注,它把幻灯片从拖拽排版变成了代码生成,AI 能直接参与修改和迭代。1500+ Logo 库和评论驱动改稿这两个点让产品有了具体抓手,不只是又一个套壳工具。对经常做演示文档的人来说,省掉排版和反复调整的时间是实打实的价值。

r/LocalLLaMA

Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token

Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。

5月6日星期三

r/LocalLLaMA

CopilotKit:一套 MIT 开源的 React 组件,帮你给 AI 应用搭聊天界面和生成式 UI

CopilotKit 是一套 MIT 协议开源的 React 组件库,专门用来给 agent 类应用搭前端。它把聊天、流式输出、工具调用、人机协同(HITL)和生成式 UI 这些常见需求都做成了现成的积木块。项目在 GitHub 上有 3 万颗星。它支持 AG-UI 协议,可以对接 LangGraph、CrewAI、LlamaIndex 等后端框架,核...

推荐理由:HKR 三项都踩中了:MIT 开源、3 万星、AG-UI 把 UI 和后端解耦,对做 Agent 产品的人是个实在的钩子。分数压在 74 没往上拉,因为正文没给新版本号、没跑分、也没点名哪个生产环境在用,信息量就到这儿。

r/LocalLLaMA

Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍,48GB 显存可跑 26 万上下文

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者分享了一个 llama.cpp 的 PR,为 Qwen 3.6 27B 模型添加了 MTP(多令牌预测)支持,实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化,这让一...

推荐理由:HKR 三项都站得住:提速和长上下文对本地 agent 是实打实的吸引力,帖子里机制和数字都列清楚了,成本优势也直接。不过只有 Reddit 单源,配置也有点折腾,所以放在 featured 低位。

机器之心 · 公众号

阿里开源 PromptEcho:用冻结的视觉语言模型给文生图训练打分,省掉额外训练成本

PromptEcho 的做法很直接:拿一个现成的、参数冻结的 Qwen3-VL-32B 模型,让它“读”一遍原始提示词,算出模型自己生成这些词的概率(交叉熵),然后把这个概率的负值当作连续奖励信号,喂给文生图模型做训练。好处是不用再单独训一个评分模型,省事。在 5000 张海报测试里,文字准确率从 68% 提到了 75%。不过正文没披露这个奖励信号跟人...

推荐理由:我会先打个折:这不是一个新模型发布,而是训练侧的 reward 方法开源,所以重要性给 78 算合理。钩子在于冻结大模型直接当 reward 用,省成本;知识密度够,把 teacher-forcing CE 怎么变成连续 reward 讲明白了,还给了 10 万张图的规模和具体数字;相关性上,文生图圈对廉价 reward 和文字准确率这两个需求很实在,75% 虽然不算完美,但方向对。正文没披露这个 reward 方法在更大规模训练下的稳定性,这点先别太激动。

机器之心 · 公众号

DeepSeek版Claude Code登顶GitHub热榜,8700星,一个叫鲸鱼哥的开发者用Rust做了个终端工具

这个叫DeepSeek TUI的工具在GitHub上拿了8700多颗星,是开发者Hunter Bown(鲸鱼哥)用Rust写的,让你在本地终端里直接调用DeepSeek V4干活。它能聊天、改文件、跑shell命令、管任务。比较特别的是RLM模式:一次可以派发最多16个V4 Flash子任务,上下文窗口有100万token,操作前还有审批关卡,等于让模...

推荐理由:我会先打个折:这是个人项目,不是 DeepSeek 官方出品,稳定性和后续维护都还是未知数。但 8700 星的热度是实打实的,RLM 的并发和审批设计也给了具体的技术细节,不是空炒概念。对想省钱又想在终端里用 DeepSeek 干活的开发者来说,这东西值得盯一下,但暂时别把它当生产工具。