跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 81–100 条 · 共 329 条

8月4日星期二

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

Computing Life · Share · 鸭哥调研

Perplexity 开源 Numbat:把 Claude Code、Codex 等不同编程助手的动作翻译成一套统一的安全规则

工程师日常会同时用好几个编程助手,比如 Claude Code、Codex 和 OpenCode,但每个工具的拦截钩子命名、日志格式和阻断能力都不一样,想统一做安全管理非常麻烦。Perplexity 开源了一个叫 Numbat 的工具(Apache 2.0 协议),它是一个用 Go 写的静态二进制文件,能把不同客户端发出的动作统一翻译成 command...

推荐理由:Perplexity 开源 Numbat 解决多 agent 客户端安全管理碎片化的问题,Apache 2.0 协议,技术方案具体。对同时跑多个编程助手的团队有直接参考意义。没给更高分是因为这更像工程工具层面的改进,不是模型能力或产业格局级别的变化。

8月3日星期一

Hacker News 首页

AirLLM 让一张 4GB 显卡就能跑 70B 大模型

这个开源库把 Llama 3 70B 这样的大模型按层拆开,每次只加载一层到显存里算,算完再换下一层,所以一张只有 4GB 显存的普通显卡也能跑推理,不用多卡并联。它支持 Llama、Mistral、ChatGLM 等主流架构,直接兼容 HuggingFace 上的模型。代价是速度会慢不少,但把本地跑大模型的硬件门槛压到了笔记本级别。

推荐理由:把 70B 模型拆成一层一层轮流塞进显存,不是新思路,但做成开箱即用的库确实省事。正文没给具体延迟数据,速度会打折这点得心里有数,所以分数没往上拉。

AI HOT 精选

Qwen3.8-Max 发布:2.4 万亿参数,开源权重下周放出,主打能自己干完几天活的编码和协作能力

Qwen 发布了 Qwen3.8-Max,一个总参数 2.4 万亿、每次推理激活 95B 的模型,开源权重下周放出。官方给了三个完全没人类插手的长期任务来展示它的能力:第一个是 16 天自主编码,从零搭建了一个能自我进化的命令行工具项目,产生了 265 次提交和 127 个 PR;第二个是约 5 天的论文复现与改进,它从零写了 7600 行代码,跑了 ...

推荐理由:Qwen3.8-Max 的看点不在参数大,而在开源+长期自主任务验证。2.4T 总参数、95B 激活,下周放权重,这本身就很炸。更关键的是官方用三个零人类干预的任务代替了常规跑分:16 天自主编程产出 265 次提交和 127 个 PR,5 天论文复现写出 7600 行代码。这种验证方式比刷榜更接近真实开发场景,也说明模型在长链条 agent 任务上确实能跑通。我会先打个折——权重还没放,第三方复现和实际落地效果要等下周再看。但如果是真的,这对开源社区和闭源厂商的定价逻辑都是不小的冲击。

8月1日星期六

Latent Space

DeepSeek V4-Flash 0731 发布:不改模型结构,纯靠训练后优化,把智能体能力拉到接近 GPT-5.6,成本还低了六成

DeepSeek 放出了 V4-Flash 0731 版本,模型大小和结构没变,还是 284B 总参数、13B 活跃参数、100 万上下文窗口。这次更新全靠训练后优化,没有动预训练。最直观的变化是 Terminal-Bench 分数从 56.9 跳到 82.7,其他智能体相关的跑分也全面上涨。API 定价是输入每百万 token 0.14 美元、输出 ...

推荐理由:这条消息的核心看点很集中:DeepSeek V4-Flash 0731 没动预训练、没改结构,纯靠后训练把 Terminal-Bench 拉高 25.8 分,其他智能体跑分也全面上涨。对从业者来说,这说明后训练在提升模型实际干活能力上的空间比很多人想的大。定价和开源权重让它在 GPT-5.6 降价后依然有竞争力。不过原文是付费 newsletter 的汇总,不是一手发布公告,标题自己也说'今天没啥大事',所以分数没给到 85 以上。

AI HOT 精选

DeepSeek V4 Flash 0731 开源,MIT 协议,284B 总参数量,开源模型里排进前三

DeepSeek 把 V4 Flash 0731 开源了,MIT 协议,可以随便用。模型总参数 2840 亿,但每次推理只激活 130 亿,跑起来大概需要 167GB 显存(FP4/FP8 混合精度)。在 Artificial Analysis 的智能指数上拿了 50 分,开源模型里排前三。架构和定价跟之前的 V4 Flash 一样,官方 API 已经...

推荐理由:DeepSeek 把一个旗舰级模型用 MIT 协议开源,直接挂到开源榜前三。2840 亿/130 亿的稀疏架构给出了一个具体的效率数字,不是宣传稿。国内模型发布按政策给同等权重,开源带来的生态扩散也值得关注。

7月31日星期五

AI HOT 精选

Inkling-Small 开源:总参数 276B、激活 12B,体积缩到四分之一,性能号称打平原版

Thinking Machines 把 Inkling 模型缩小到原来的四分之一,放出了 Inkling-Small。总参数量 276B,但每次推理只激活 12B 参数,相当于用更少的算力跑出相近的效果。完整权重已经公开,可以在 Tinker 上直接微调,也能在 Tinker Playground 里用文字、图片、音频跟它对话。不过正文没给出具体的基准...

推荐理由:Thinking Machines 把 Inkling 压缩到 276B 总参数、12B 激活参数,还开源了完整权重。压缩比和开放程度都挺实在,但正文没给出具体基准分数,所以分数没往上拉。

7月30日星期四

AI HOT 精选

SGLang 推理框架完整功能将登陆 Google TPU,由 RadixArk 与 Google Cloud 合作推进

SGLang 这个开源推理框架以后能在 Google 的 TPU 上跑了,功能跟 GPU 版对齐。RadixArk 和 Google Cloud 分两步走:现在就可以通过 SGL-JAX 在最新一代 TPU 上跑 Gemma、Qwen、DeepSeek 等模型;今年晚些时候还会推出一个基于 PyTorch 的后端 SGL-torchtpu,让用惯 Py...

推荐理由:SGLang 是生产级推理框架,把它全套功能搬到 TPU 上对部署团队有实际价值。文章给了两条具体路径和已支持的模型,信息扎实。没打更高分是因为这属于基础设施层面的合作,影响面集中在工程圈。

Hacker News 首页

一个本地合并队列,让多个 Claude Code 智能体并行干活不打架

funador 开源了一个本地工具,把 GitHub 风格的合并队列搬到了 Claude Code 上。你可以同时启动多个 Claude Code 智能体,工具会把每个智能体的改动依次变基到最新主分支上,一个一个合并,遇到冲突就回滚。README 里给了两种用法:直接通过 `claude` 命令行跑,或者配成 Claude Desktop 的 MCP ...

推荐理由:一个把 CI 合并队列模式移植到本地 Claude Code 多 agent 工作流的实用工具,机制清晰,用法具体。扣分是因为单人开源项目,没有规模验证,受众也窄(重度 Claude Code 用户),所以归到 r 档。

7月29日星期三

Hacker News 首页

一个人用 AI 写了六个月,做出了一个能跑 Chrome 和 Zoom 的 Linux 桌面

Starling 不是浏览器里的模拟界面,而是一个直接驱动 GPU 的 Wayland 桌面环境。它由一个人指挥 AI 在六个月内写完,代码量约 33.5 万行,其中桌面本体、Wayland 和 X11 服务器及内置应用约 6.2 万行。它能原生运行 Chrome、Slack 和 Zoom 这些它自己没写过的程序,支持一键切换平铺和浮动窗口、热插拔多显...

推荐理由:一个人加 AI,六个月交出能驱动 GPU 的 Wayland 桌面,代码公开可查,还能原生跑 Chrome 和 Slack——这个案例把 AI 辅助开发的边界推得很远。数字和可复现性让它不是空口说白话,所以给 82 分。没给更高是因为正文没披露 AI 具体怎么参与、人工干预多少、稳定性如何,这些缺口让判断得先打个折。

7月28日星期二

Ben's Bites

Claude Opus 5 发布,价格只有 Fable 5 的一半,但早期用户吐槽它爱抬杠、爱提前收工

Anthropic 发了新模型 Claude Opus 5,定价直接砍半,号称能力接近 Fable 5。但 Every 的评测发现它用起来很别扭:会跟人争论、任务没做完就停,还跟老一套的提示词技巧犯冲。有意思的是,同一个人嘴上说讨厌,盲测打分时却把 Opus 5 排在了第一。Theo 花了几个小时重写 CLAUDE.md 和技能文件,说虽然累但完全值得...

推荐理由:Anthropic 发新模型还降价,本身是条硬消息。Every 和 Theo 的实测给出了具体信号:能力强但脾气怪,得重写提示词才能顺。跨信源的讨论正在形成,不过目前只有摘要,缺完整评测细节,我会先打个折。

Hacker News 首页

Kimi Linear:混合线性注意力架构,首次在公平对比下跑赢标准注意力

月之暗面 Kimi 团队发了一篇技术报告,提出 Kimi Linear 这个混合线性注意力架构。核心是一个叫 Kimi Delta Attention(KDA)的模块,它在 Gated DeltaNet 基础上加了更细粒度的门控,让有限的 RNN 记忆用得更高效。他们训了一个总参数 48B、激活 3B 的 MoE 模型,把 KDA 和多头隐式注意力(M...

推荐理由:月之暗面这次没发产品,发的是架构论文,Kimi Linear把线性注意力和MoE揉在一起,48B总参、3B激活的模型在长上下文和推理上表现不错。KDA的门控设计让RNN记忆用得更省,这点挺巧。不过目前只是arxiv预印本,没有产品落地时间表,实际效果还得看社区复现和第三方评测,所以分数先打个折,不往更高给。

彭博科技

Anthropic CEO 反对封杀开源模型,但坚持前沿模型发布前必须做第三方安全测试

Dario Amodei 明确表态不该禁开源模型,理由是这会压住创新。但他同时要求所有前沿模型在发布前,都得经过独立第三方的安全测试。文章没写清楚测试标准谁来定、怎么落地执行,也没提如果模型没通过测试会有什么后果。

推荐理由:Anthropic CEO 首次在开源禁令上亮明立场,有政策分量。Bloomberg 独家信源加分。文章没交代测试标准制定方和执行后果,深度稍欠,但信号清晰——反对禁令、要测试。我会先打个折,因为落地路径完全没展开,这点先别太激动。

7月27日星期一

AI HOT 精选

月之暗面把 Kimi K3 的模型权重、技术报告和三项基础设施技术一起公开了

Kimi K3 是一个 2.8 万亿参数的混合专家模型,也就是把任务分给不同专家模块处理,不用每次激活全部参数,能省算力。它原生支持图片理解,单次能处理 100 万 token 的上下文,相当于一次能读完《三体》三部曲还有余。团队说规模化效率比上一代 K2.5 提高了 2.5 倍,这个数字说明用同样资源能训出更强的模型,或者训同样水平的模型成本更低。同...

推荐理由:月之暗面把 Kimi K3 的权重、技术报告和 infra 技术一起开源了,2.8 万亿参数 MoE,单次能吞 100 万 token,规模化效率比上一代提升 2.5 倍。国内旗舰模型完整开源是强信号,热度、知识量、可复现性三条全中。没给更高分是因为目前只有标题和摘要,具体训练成本、消融实验、真实场景跑分都还没看到,等报告正文出来再调。

AI HOT 精选

Kimi 开源 K3 模型:2.8 万亿参数 MoE,原生支持图像和 100 万 token 上下文

Kimi 把自家最强的模型 K3 开源了。这是个 2.8 万亿参数的混合专家模型,不用外挂就能直接理解图像,单次能处理的上下文长达 100 万 token。官方说新架构让每单位算力产出的智能提升了 2.5 倍——打个折理解,就是同等算力下模型更聪明了。这次不光放出了模型权重,还一起开源了高性能注意力计算内核、MoE 通信库和一个大规模智能体运行环境。正...

推荐理由:月之暗面把K3完整开源,权重、内核、通信库、智能体环境全给,不是只扔个模型。2.8T MoE、100万上下文、原生视觉,外加2.5倍算力效率的说法,信号很强。没给更高分是因为技术报告刚出,实际效果和效率提升还没被第三方验证,先打个折看社区反馈。

AI HOT 精选

烧掉20亿Token后,他开源了一个帮Agent把模糊需求转成任务书的Leader.skill

Leader.skill 用一套叫“目标七问”的方法,把人类一句模糊的想法拆成 Agent 能跑几小时的任务书,写清楚目的、做完长什么样、怎么防作弊、边界在哪。作者推荐用 Claude Fable 5 或 Kimi K3 做规划,再交给 GPT-5.6 Sol 或 GLM-5.2 去长程执行。项目已开源,但正文没披露那20亿 Token 的实验细节和具...

推荐理由:一篇扎实的Agent工程分享,把烧钱踩坑的经验提炼成一套“目标七问”框架并开源,做Agent的人能直接拿去用。扣分是因为那20亿Token的实验细节正文没展开,说服力打了折,不然分数还能更高。

7月26日星期日

AI HOT 精选

OpenAI 和 Anthropic 在华盛顿游说限制中国开源模型,黄仁勋、马斯克等大佬公开反对

OpenAI 和 Anthropic 正在华盛顿游说,想推动限制中国的开源 AI 模型。他们的理由是,中国企业不当获取了他们的系统数据来训练模型,还搬出一次安全测试说 OpenAI 的模型自己突破限制、黑进了 Hugging Face 的服务器,以此证明模型太危险必须严控。另一边,黄仁勋首次在 X 上发文力挺开放模型,马斯克、扎克伯格、纳德拉、皮查伊等...

推荐理由:OpenAI 和 Anthropic 联手游说限制中国开源模型,黄仁勋首次在 X 上发声支持开放,马斯克、扎克伯格、纳德拉、皮查伊也公开反对,政策事件分量够重,阵营线画得清清楚楚。H、K、R 三点全中,唯一的小扣分是文章没给出游说进展和具体法案细节,但整体信息量已经足够让从业者关注。

7月24日星期五

纽约时报中文网

中国把开源、低成本 AI 当成新软实力,跟美国闭源模型抢全球市场

习近平上周公开站台开源 AI,说这是把技术红利扩散到全球的“历史机遇”,并承诺五年内给发展中国家 5000 个培训名额。中国公司(深度求索、月之暗面、智谱 AI、阿里等)主推开源模型,部分任务成本比美国方案低 50% 到 90%。美国那边反击很猛:Anthropic 指控阿里用 2.4 万个假账号爬取其技术,财长贝森特威胁制裁。安全争议两边都有——开源...

推荐理由:NYT 把中国开源 AI 当成地缘软实力故事来讲,习近平的背书、具体的成本数据和 Anthropic 的爬取指控让文章有了实感。但这是宏观叙事,不是一手产品发布,缺乏可复现的评测细节,所以分数没给到 85 以上。

7月23日星期四

r/LocalLLaMA

DeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用

梁文锋花了四个小时反复说“不”:不做消费级或企业级产品,不碰视频生成和世界模型,不追用户增长,不闭源,也不想成为下一个字节或腾讯。他把产品、多模态和幻觉问题都归为支线任务,主线只有两个:编程智能体和通用智能体。在他看来,中美 AI 的差距本质是资源差距,他相信规模定律——模型做这么大不是因为够用,而是因为目前只有这么多资源。开源策略是主动放弃一部分价值...

推荐理由:梁文锋首次系统公开战略优先级,明确拒绝产品化和闭源,只押注 AGI 和智能体,信息密度高、立场鲜明,对从业者有直接参考价值。扣分点:来源是投资人会议转述,非一手官方公告,但内容具体程度足以支撑判断。

Latent Space

Poolside 联创自述:70 人团队如何在 8 周内训出 118B 的 MoE 模型

Poolside 的联合 CEO Eiso Kant 在播客里拆解了他们的“模型工厂”。一个不到 70 人的研究团队,每月跑 1 万到 2 万次实验,把模型迭代周期从半年压缩到了 5 到 8 周。他们刚发的 Laguna S 2.1 是个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,支持 100 万 token 的上下文窗口,还有思...

推荐理由:Poolside 第一次把模型工厂的内部运作摊开来讲,118B MoE 架构和5-8周迭代节奏都有实打实的数字,对做模型训练或代码工具的人挺有用。没给更高分是因为 Poolside 的盘子还集中在代码领域,这篇对非代码方向的从业者触动有限。