跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 221–240 条 · 共 329 条

5月16日星期六

AI HOT 精选

OpenClaw 团队跑着 100 个 AI 实例干活,完全不看 token 账单

OpenClaw 项目组把 AI 用量拉满,常驻约 100 个 Codex 实例,把代码审查、安全扫描、issue 去重归类、测试环境复现并录屏验证、从会议里自动建任务、垃圾评论过滤和性能回退监控全交给它们跑。他们用 clawpatch.ai 把项目拆成功能单元做审查,还接了 Vercel DeepSec 做安全分析。正文没披露具体花了多少钱,但明确说...

推荐理由:我会先打个折:这只是一条X上的分享,没有披露成本、效果指标或可复现的搭建方式,所以别当成熟方案看。但它的钩子很准——用约100个Codex实例同时干代码审查、安全分析、议题去重、测试复现、任务创建、垃圾过滤和性能回归监控这七件事,还明说“无视令牌成本”,对正在琢磨AI agent怎么落地的从业者来说,是个有参考价值的实操片段。H、K、R都成立,放在featured里偏低的位置刚好。

5月15日星期五

AI HOT 精选

X 把“为你推荐”的算法开源了,用的还是 Grok 同款 Transformer

X 在 GitHub 上公开了“For You”信息流的推荐管道,代码、预训练模型和内容理解服务都给了。核心是一套叫 Phoenix 的 Transformer 模型,基于 Grok 架构,负责给候选帖子打分。它会看用户最近跟谁互动,同时预测点赞、回复、转发这些行为的概率,揉成一个相关性分数。排序前会先捞候选内容,补上上下文,再让模型评分,最后做多样性...

推荐理由:HKR 三项都踩中了,但正文只说了开源和 Phoenix Transformer 打分机制,仓库细节、许可证、能不能复现都没提,所以先给 featured 里偏低的位子。

AI HOT 精选

飞书命令行工具 lark-cli 45 天 GitHub 破万星,AI 操作每一步都能预览和审查

飞书开源了一个叫 lark-cli 的命令行工具,45 天在 GitHub 上拿到超过一万颗星,是国内办公套件里第一个破万星的开源项目。这个工具让 AI 能直接在命令行里建群、建文档,而且每一步操作都会先展示出来让你确认,不是那种在云端黑盒执行的 MCP 模式。主干代码已经合并了 10 位外部开发者的贡献,对比钉钉和企业微信同类项目的外部贡献是零。这种...

推荐理由:我会先打个折:信息只来自一篇社交帖子,没披露实际使用量、贡献者数量或企业采纳数据,所以放在 featured 偏低的位置。但 45 天万星这个速度本身说明开发者对“AI 操作可见可控”这个方向有需求,工具形态是命令行,意味着可以嵌进自动化流程,这点比纯界面演示更实在。正文没提和钉钉同类能力的对比,也没说后续维护计划,先当一次开源动作看。

量子位 · 公众号

160行代码就能跑通LeCun的JEPA世界模型

一个叫keon/jepa的开源教学库把LeCun提出的JEPA世界模型拆成了5个独立变体,每个都用单个PyTorch文件实现,最短160行,最长278行,只依赖PyTorch和torchvision。其中iJEPA在CIFAR-10上跑了100轮,线性探测准确率52.7%,不算高,但胜在代码够短、能跑通。V-JEPA、C-JEPA和LeWorldMod...

推荐理由:我会先打个折:这不是新模型或新论文,是一个教学仓库,把 JEPA 的几个变体写成极简 PyTorch 单文件,方便看懂核心思路。亮点是代码量压到 160 行起步,依赖干净,适合想快速上手世界模型、又不想啃大项目的人。正文没披露训练数据或性能对比,所以别当生产级工具用,但作为学习材料够直接。

5月14日星期四

r/LocalLLaMA

单卡跑通一句话生成电影级短片:FLUX.2 出角色,Wan2.2 做动画,带自动质检和 9 语配音

这个叫 StudioMI300 的开源流水线,把一句英文提示词变成 720p 短片,全程跑在一张 AMD Instinct MI300X 上。流程分 8 步:先用 FLUX.2 [klein] 生成角色关键帧,再用 Wan2.2-I2V 把静态图转成动画,中间加了一道视觉评分和自动重试的质检,最后配上音乐和 9 种语言的旁白。开发者把单条片子的生成时间...

推荐理由:HKR 三项都成立:帖子把一句提示词到成片的完整链路讲清楚了,有硬件型号、阶段数和压缩后的耗时,对想自己搭视频管线的开发者来说,省钱和可控这两点很抓人。不过来源只有 Reddit 单帖,没有第三方复现或更多验证,所以分数没再往上走。

AI HOT 精选

腾讯开源 Agent Memory:用“任务地图”和上下文卸载,让 Token 消耗降低 61%

腾讯云开源了 TencentDB Agent Memory,专门解决 AI Agent 在长任务里上下文窗口被快速撑爆的问题。核心思路分两步:一是用 Mermaid 流程图把任务执行过程画成一张可折叠、可展开的“任务地图”,让 Agent 随时知道自己在哪、哪些步骤有依赖;二是做上下文卸载,把工具返回的完整结果存到外部文件,上下文里只留一行摘要和索引路...

推荐理由:腾讯云把 Agent Memory 开源了,主打上下文卸载和用 Mermaid 图当任务画布,多任务连续对话里最高能省 61% 的 Token。这个数字对跑生产级 Agent 的团队来说挺实在,不是实验室刷榜。不过正文没给出对比基准和测试场景细节,实际能省多少得自己测。整体不是大模型发布那种量级,但作为成本优化工具,放在 featured 里提醒一下同行是合适的。

量子位 · 公众号

摩尔线程把 SGLang 的 MUSA 后端合进了主线,还拉来核心开发者一起聊了聊

摩尔线程办了一场 SGLang × MUSA 线下交流会,宣布 MUSA 后端已经并入 SGLang 主分支。截至 5 月 12 日,他们一共提了 47 个 PR,其中 41 个被合并。不过正文因为环境验证问题没能加载出来,具体技术细节和现场讨论内容暂时看不到。

推荐理由:我会先打个折:这不是模型发布,也不是平台级大更新,更像推理后端生态的一次实质性进展。但 47 个 PR、41 个合入的数字说明摩尔线程不是挂个名,是真在往 SGLang 主线里交代码。对国内做推理部署的人来说,MUSA 后端进主线意味着以后用 SGLang 时多了一条国产卡的路,这点先别太激动,正文没披露实际性能对比和线上规模,但至少代码层面已经打通了。

AI HOT 精选

OpenSquilla 用本地路由和缓存把大模型传输量砍掉九成以上

OpenSquilla 这个开源项目把模型路由决策放在本地跑,不花 token 就能判断问题难易:简单问题丢给便宜模型,复杂问题才上强模型。它靠增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下。记忆模块会在上下文快满时自动挑重点压缩,还支持混合检索。正文没披露具体测试场景和模型阵容,所以这 90% 的降幅在什么任务上测出来的还不清楚...

推荐理由:我会先打个折:信息来自一篇 X 上的项目帖,仓库实际活跃度、测试环境和局限性正文都没披露,所以别急着全信。但它的思路很实在——用本地路由和缓存把要传给大模型的 Token 砍掉九成,等于把“外挂资料库”和推理优化打包成一个开源工具。对正在想办法压推理成本的小团队来说,哪怕只实现一半效果也值得关注。

r/LocalLLaMA

商汤发布 SenseNova-U1-A3B-MoT,一个模型搞定看图、推理和生成

商汤在 Hugging Face 上放出了 SenseNova-U1-A3B-MoT 模型,同时提供了 A3B MoT、8B MoT 和 0.4B LoRA 权重链接。按官方说法,这套模型用 NEO-unify 架构把多模态理解、推理和生成统一到一个模型家族里。不过 Reddit 原帖被网络屏蔽了,正文没披露具体性能数据、训练细节和实际跑分,想试的话得...

推荐理由:SenseNova 在 Hugging Face 扔了一套多模态模型权重,A3B MoT、8B MoT 加一个 0.4B LoRA,主打 NEO-unify 架构,说能把看图、推理和生成塞进一个模型。我会先打个折:正文没给任何 benchmark 分数,也没写清楚开源协议,所以性能好坏和商用限制现在全是问号。亮点是 LoRA 权重只有 0.4B,对想用消费级显卡跑多模态任务的人挺友好,这点先别太激动,等实测出来再看。整体属于有料但缺关键信息的发布,给个 featured 低段位合理。

5月13日星期三

AI HOT 精选

开源 psql_bm25s:让 PostgreSQL 做 BM25 检索,比 pg_search 快 23 倍

团队把 psql_bm25s 开源了,它是一个 PostgreSQL 原生访问方法,直接在数据库里跑精确的 BM25 检索。在标准基准测试上,它比 pg_search 快大约 23 倍。这个速度提升意味着,在多智能体系统里,检索不再拖后腿,也不用额外烧钱,智能体查数据能快很多。正文没披露具体测试用的数据集、硬件配置和查询类型,所以这个 23 倍先打个折看。

推荐理由:我会先打个折:这是单方开源发布,没有独立复现和线上生产环境的约束说明,所以别急着当最终结论。但“23 倍”这个数字确实抓人,它说明用原生访问方法在 Postgres 里跑 BM25 可以省掉不少外部依赖和延迟,对把 Postgres 既当主库又当检索库的团队是个省钱省运维的信号。正文没披露并发写入下的性能退化、索引构建耗时和资源占用,这点先别太激动。

r/LocalLLaMA

小米把 1 万亿参数的 MiMo-V2.5-Pro 开源了,但自己跑真的划算吗?

小米放出了 MiMo-V2.5-Pro,参数总量 1.02 万亿,但每次推理只激活 420 亿参数,上下文窗口能塞进 100 万个 token,用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务,走 API 总共花了 70.12 美元,处理了约 3.87 亿个 token,缓存命中率高达 96.3%。这个命中率说明大部分请求其实...

推荐理由:我会先打个折:正文没披露 MiMo-V2.5-Pro 的评测跑分,所以性能好坏只能靠参数规模猜。但这条信息本身够直接——小米把一个 1.02 万亿参数、42B 激活的模型开源,另一边作者用 Claude Code 跑了 125 次会话,3.87 亿 token 花了 70.12 美元,缓存命中率 96.3%。这两组数字摆在一起,自建成本和 API 开销的对比就出来了。对做工程的人,这种一手成本数据比技术报告更有参考价值。

新智元 · 公众号

清华系开源 MiniCPM-V 4.6:1.3B 多模态模型,一张 4090 就能全量微调

面壁智能、清华和 OpenBMB 放出了 MiniCPM-V 4.6,一个 13 亿参数的多模态模型。它最大的卖点是能在一张 RTX 4090 显卡上完成全量微调,不用再靠低秩适配这类折中方案。模型提供了两种视觉 token 压缩模式:4 倍压缩追求精度,16 倍压缩追求速度,让开发者自己按场景选。正文没披露具体的训练数据量和详细评测基准,这点先别太激...

推荐理由:HKR 三项都成立:一条具体的开源多模态模型发布,给了参数量、硬件条件和 token 压缩方案,把本地微调成本压到一张消费级显卡。不是前沿大厂的旗舰发布,但实用性强,82 分合理。

r/LocalLLaMA

有人把 Transformer 语言模型塞进了原装 Game Boy Color 里跑

maddiedreese 把 Andrej Karpathy 的 TinyStories-260K 模型成功跑在了一台没改过硬件的 Game Boy Color 上。他用 INT8 量化权重、定点数运算,把模型和 KV 缓存塞进 MBC5 卡带的 bank-switched ROM 和 SRAM 里,全程不靠手机、电脑、Wi-Fi 或云端推理。不过输出...

推荐理由:一个 Reddit 硬件 hack,把 TinyStories-260K 塞进原装 Game Boy Color,用 INT8 和定点数学跑推理,KV cache 放在卡带 SRAM 里。输出慢到没法用,而且基本是乱码,所以别当产品看。但能在这种老设备上把 transformer 跑起来,本身就挺酷,技术细节也给得实在,适合当一条有趣的行业花絮。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

5月12日星期二

AI HOT 精选

开放模型生态如何滚起雪球

作者 Nathan Lambert 从中国 AI 圈几乎全员开源的现状出发,聊了聊开放模型生态真正的省钱逻辑。核心判断是:造前沿模型的大头成本不在最终训练,而在研发试错,这部分算力开销可能占到 80%。中国各家实验室通过详细技术报告和刻意分享,相当于帮同行排了雷,避免重复烧钱做实验,形成了一种靠信息共享降低未来研发成本的复合增长。文章也指出,开源 AI...

推荐理由:这篇文章不是产品发布,而是一篇评论,核心观点是开源模型生态正在自我强化。我会先打个折:正文没披露下载量的绝对基数,200% 的环比增长到底是从 1 万涨到 3 万还是从 100 万涨到 300 万,差别很大,这点先别太激动。但它把开源模型的扩散、微调、再发布串成一个复合增长飞轮,这个框架比单纯报数字更有价值。对做模型选型和成本估算的从业者来说,这个趋势意味着国产开源模型的可用性在快速爬坡,值得关注。

AI HOT 精选

想让 AI 当个人管家?先得把你在淘宝、京东、美团上的消费记录弄出来

作者实测了五个主流消费平台的数据导出方法。淘宝自带导出功能;京东没有官方支持,但作者用 Codex 写了个 Chrome 插件,能一键导出订单,代码已开源在 GitHub;饿了么可以申请导出 Excel;美团外卖目前完全没办法导出;大众点评的收藏列表也能通过定制插件导出来。作者把京东和大众点评的工具都开源了,目的是让用户拿这些消费数据喂给 AI Age...

推荐理由:这篇文章不是平台官方发布,是一个开发者的实操记录,所以重要性停在 featured 档。但 H、K、R 三项都踩中了:用订单数据喂 AI 助手这个切入点够抓人,5 个平台的具体导出方式是新事实,开源工具直接降低了数据可移植性的实现成本。我会先打个折——正文没披露导出数据的字段完整度和后续清洗工作量,这点先别太激动,但作为动手参考已经够用。

机器之心 · 公众号

字节开源 DreamLite:0.39B 参数模型在 iPhone 上 3 秒出图,不用联网

DreamLite 是字节跳动开源的一个统一扩散模型,参数量只有 3.9 亿,能在 iPhone 17 Pro 上直接跑,生成或编辑一张 1024×1024 的图大约 3 秒。它靠 DMD2 蒸馏技术把推理压缩到 4 步,全程在手机本地完成,不依赖云端。正文没披露具体的显存占用和功耗数据,也没给出不同机型上的实测对比,所以“秒变画板”这个说法先打个折—...

推荐理由:字节把扩散模型压到 0.39B 参数,在 iPhone 17 Pro 上离线跑 1024×1024 生图和编辑,约 3 秒出结果,靠的是 4 步 DMD2 蒸馏把推理步数砍下来。我会先打个折:正文没披露功耗、内存占用和量化方案,也没给不同机型的对比,所以“手机秒变画板”这个说法先别太激动。但参数和实测平台都给了,比光喊口号实在。作为开源端侧方案,对在意离线、低延迟和隐私的开发者有参考价值,只是目前只有一篇 Reddit 帖子,没有论文或代码仓库链接,可信度要打个问号。

r/LocalLLaMA

Reddit 网友实测 288 次模型调用,把本地模型输出 JSON 时的各种翻车方式全整理了一遍,还写了个修复库

Reddit 用户 kexxty 用 OpenRouter 跑了 288 次结构化输出测试,覆盖 Llama 3、Mistral、Command R、DeepSeek、Qwen 等模型,发现本地模型和纯 API 模型在 JSON 上出的错其实差不多。他把这些失败归类后,写了一个叫 outputguard 的 Python 修复库,用 MIT 协议开源。...

推荐理由:HKR 三项都成立:288 次调用不是随便跑跑,outputguard 库和 15 步修复链给了可复用的实操细节。信息源是单篇 Reddit 帖子,没有第三方验证或论文背书,所以放在 72-77 的 featured 档位,不往上走。

5月11日星期一

AI HOT 精选

Anthropic 在 GitHub 开源了一套金融 AI 模板,直接给投研、投行、风控配好了 10 个智能体和 11 家数据商的连接器

这套模板把金融行业里常见的 AI 用法打包成了开箱即用的工作流,覆盖投研、投行、风控等核心环节。里面塞了 10 个端到端智能体、7 个垂直插件,还接好了 11 家主流金融数据商的 MCP 连接器,等于把模型跟 Bloomberg 这类数据源的通路提前打通了。部署方式从个人插件到企业 API 都支持,也能塞进 Microsoft 365 和私有云。正文没...

推荐理由:我会先打个折:这不是模型发布,所以重要性到不了 85 分,但开源一套能跑的金融 agent 模板,比发篇愿景文章实在得多。Anthropic 把 10 个端到端智能体、7 个插件和 11 家数据商的 MCP 连接器打包扔上 GitHub,等于给金融行业的 AI 落地画了一条参考线,别人想跟进得先过这一关。正文没披露这些 agent 在生产环境跑到什么程度、延迟和准确率怎么样,所以别急着当成熟方案用,但作为起点,信息量和可复现性都够格进 featured。