跳到正文

#开源/仓库

今日 3 条

8月14日星期五

AI HOT 精选

通义千问开源 Qwen3.8 系列:27B 稠密模型参数更少但跑分反超,2.4T 混合专家模型权重也放出来了

Qwen3.8-27B 是一个原生就能看图、读文档的多模态稠密模型,参数量只有 27B,但基准测试全面超过了上一代 Qwen3.7-Plus。它原生支持 262K 上下文窗口,用 YaRN 技术可以拉到 1M tokens,等于一次能塞进三体三部曲的量。许可证是 Apache 2.0,商用友好。同时放出的还有 Max 版本 Qwen3.8-2.4T-A...

推荐理由:阿里通义千问放出 Qwen3.8 系列:一个 27B 的稠密多模态模型,基准测试压过了上一代 Qwen3.7-Plus,原生 262K 上下文,Apache 2.0 许可证,还附带一个 2.4T 参数的 MoE Max 版本。这是国内开源大模型当天的重要发布,必须收录。分数没给到 90 以上,是因为正文没披露具体评测细节和实际推理成本,我会先打个折,等看到实测数据再调整。

AI HOT 精选

智谱发布 GLM-5.3,编程能力开源第一,后训练还练出了挖漏洞的本事

GLM-5.3 的基座和 5.2 一样,但靠后训练把编程能力推到了开源模型第一。在模拟真实终端任务的 Terminal-Bench 3.0 上,得分从 4.6 跳到 28.3;长程软件工程测试 DeepSWE v1.1 从 46.2 涨到 66.9。模型还涌现了网络安全能力,白盒代码审查得分 84.5%,略高于 Mythos 5 的 83.8%,但在漏...

推荐理由:我会先打个折:正文没披露白盒审查的漏报率,只说略高于 Mythos 5,这点先别太激动。但同一基座靠后训练把编程分从 4.6 拉到 28.3,还涌现了安全能力,这个提升幅度本身就够硬。加上两周后开源权重,对国内开发者是个直接可用的信号,所以给了 featured。

Hacker News 首页

GLM-5.3:只靠后期训练,把开源模型的编程和漏洞利用能力拉到一线

GLM-5.3 和上一代用的是同一个基座模型,所有提升全来自后期训练。编程能力在内部 Z.ai Code Bench 上比 5.2 高了 50%,Terminal Bench 3.0 从 4.6 分跳到 28.3 分。更意外的是漏洞利用能力涨得比预期快:ExploitGym 2 小时得分从 29 涨到 105,6 小时从 39 涨到 130。团队把原因...

推荐理由:GLM-5.3 和上一代用同一个基座,所有提升全靠后期训练。编程分涨了50%,终端操作从基本不会(4.6分)变成能干活(28.3分)。更扎眼的是漏洞利用:2小时得分从29跳到105,6小时从39跳到130。团队自己说这块能力涨得比预期快,我会先打个折——内部评测的绝对值不能直接跟外部基准比,但涨幅摆在那里。正文没披露后期训练具体用了什么方法和数据,这点信息缺口挺大。

8月13日星期四

Latent Space

xAI 发布 Grok 4.6 和 Grok Bot,AI 同事赛道来了个狠角色

xAI 一口气发了两个东西:新模型 Grok 4.6,和一个能直接登你的工具、像人一样操作、最后交活儿的早期测试版 Grok Bot。Grok 4.6 是个 1.5 万亿参数的模型,在 AA-Briefcase 这个知识工作基准测试里,分数跟 GPT-5.6 Sol Max 差不多,但便宜一大截:输入每百万 token 2 美元,输出 6 美元。训练上...

推荐理由:Grok 4.6 在知识工作基准上追平 GPT-5.6 Sol Max,价格却砍到零头,这个性价比信号很强。同时发布的 Grok Bot 直接杀进 AI 队友战场,背后是前 Cursor 团队,早期口碑还行。没给更高分是因为 Bot 还在早期测试,正文没披露具体完成率和稳定性数据,实际干活能力得再观察。

Computing Life · Share · 鸭哥调研

DeepSeek 开源 DSH:把 agent 的控制循环做成了可热插拔的插件,为 AI 自进化铺路

DeepSeek 在 8 月 13 日开源了它的第一个 agent harness,叫 DSH。它跟 Codex、Claude Code 这些现有工具最大的不同,是把 agent 的核心控制循环(agent loop)本身做成了一个可以在运行中随时替换的插件。这意味着,AI 在干活时不仅能调用新工具,理论上还能给自己换一套全新的思考或协作流程。为了支撑...

推荐理由:DSH 把 agent 的控制循环做成了运行时可替换的插件,这确实是个架构层面的新想法,不是营销话术。但这篇文章是第三方分析,不是官方发布,DSH 目前也没有任何生产环境的验证记录,所以按规则先打个折,归到较低一档。

AI HOT 精选

阿里首次把 Qwen-Max 级别的模型权重放出来了,总参数 2.4 万亿,每次只激活 950 亿

阿里 Qwen 团队开源了 Qwen3.8-2.4T-A95B,这是他们第一次把云端最强模型级别的权重直接公开。模型用了混合专家架构,总共 2.4 万亿参数,但每次计算只激活其中的 950 亿,所以跑起来比同体量的稠密模型省算力。它原生支持 26 万多 token 的上下文,能一口气处理整本小说,还能扩展到 101 万 token。训练时加入了多 to...

推荐理由:阿里第一次把云端旗舰模型完整开源,2.4T MoE、激活95B、原生256K上下文,这几个指标放在一起分量很重。三个维度都踩中了:头部大厂罕见动作、技术上有具体新东西、对国内开发者生态有直接拉动。没给更高分是因为目前只有公告,还没看到第三方实测跑分和实际部署反馈,我会先打个折,等社区验证了再往上调。

8月12日星期三

Hugging Face 博客

Liquid AI 开源 LFM2.5-VL-3B,一个能在本地跑的视觉语言模型,主打屏幕理解和工具调用

Liquid AI 放出了 LFM2.5-VL-3B,一个 30 亿参数的视觉语言模型,可以直接在你自己的电脑或手机上跑。它不搞长链条推理,直接给答案,适合需要实时响应的场景。这次主要升级了四个能力:能看懂各种设备的屏幕界面、用自然语言圈出图片里的物体、同时理解多张图片,以及大幅强化了工具调用(不管带不带图片都能用)。官方给了跑分对比和 CPU/GPU...

推荐理由:Liquid AI 发了一个30亿参数的视觉模型,主打本地推理和实时响应,给了四个明确的能力升级和跑分对比。H 和 K 都踩中了,但品牌号召力在视觉领域偏弱,R 没起来,分数刚好卡在 featured 门槛上。

Hacker News 首页

Nvidia 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard:一个 300 亿参数的小模型,专跑多智能体系统里的专...

Nvidia 给 Nemotron 3 系列加了个新模型 Nemotron 3.5 Lightning,300 亿参数,用的是混合专家架构(MoE,把模型拆成多个小专家,每次只激活一部分,省算力)。它不负责统筹全局,而是在多智能体系统里干代码审查、安全告警监控这类专项高并发的活。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%。模型...

推荐理由:Nvidia 这次没走通用大模型的路子,而是发了个 30B 的 MoE 模型 Nemotron 3.5 Lightning,定位是多智能体系统里的专项工人,比如做代码审查、监控安全告警。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%,还开源了调度工具 NeMo Switchyard。我会先打个折——这些数字都来自 Nvidia 自己的博客,没有第三方实测,而且 Nvidia 的模型生态在开发者里的实际采用率远不如几家头部 lab。但“给智能体系统做专项加速”这个思路本身值得关注,对正在搭多智能体工作流的人是个可参考的选项。

8月10日星期一

Hacker News 首页

扎克伯格点名 OpenAI 和 Google,说封闭模型玩不过开源,Meta 下一代 Llama 继续全开源

扎克伯格在内部会议上直接点名 OpenAI 和 Google,认为长期来看开源模型会赢。他确认 Meta 的下一代 Llama 会保持完全开源,同时把 AI 团队打散并入产品部门,想加快发布节奏。具体发布时间和模型参数都没说。

推荐理由:扎克伯格内部讲话直接点名 OpenAI 和 Google,确认 Llama 会继续完全开源,还透露 AI 团队正被并入产品组。冲突感、组织变动和明确立场,三条都占全了。不过具体发布时间和模型参数都没说,所以我会先打个折,给到 78 分。

AI HOT 精选

SGLang 第一时间适配 Meta 的本地智能体模型 Muse Glimmer,单卡 RTX 5090 跑到每秒 1452 个 token

Meta 发布了 Muse Glimmer,一个 300 亿参数的多模态模型,专门为在本地硬件上跑智能体工作流设计。SGLang 推理框架在发布当天就提供了支持,并做了针对性优化。在单张 RTX 5090 显卡上,用 NVFP4 量化格式搭配 DFlash 投机解码技术,每个用户的解码速度能达到每秒 236 个 token,总吞吐量冲到每秒 1452 ...

推荐理由:Meta 发新模型本身是行业事件,但这篇文章的重点是 SGLang 的推理优化,不是模型本身。好在性能数字够硬,236 tok/s 和 1452 tok/s 这两个数让它的信息密度够上 featured。不过受众窄,只对搞本地推理的人有吸引力,所以 r 给了 false。

Hacker News 首页

Meta 开源 Muse Glimmer:一个能在本地单 GPU 上跑的 30B agent 模型

Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了。这是一个 30B 参数的模型,专门为常驻本地的 agent 工作流设计,小到能在 Mac 或 PC 的单张消费级显卡上跑。用 4-bit 量化能把模型压到 20 GB 以下,在 24 GB 或 32 GB 显存里还能留出空间给 KV cache 和视觉编码器。训练上,...

推荐理由:Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了,一个 30B 参数、专为本地 agent 工作流设计的模型。4-bit 量化后不到 20 GB,能在单张消费级显卡上跑,还留出显存给 KV cache 和视觉编码器。定位很明确——不是通用聊天模型,而是常驻本地的 agent 引擎。我会先打个折:目前只有发布博客的信息,没有第三方跑分和实际部署反馈,所以分数没往上拉。但开源协议、显存占用和本地 agent 这个组合,对自部署和隐私敏感场景确实有吸引力。

AI HOT 精选

NVIDIA 开源 NemotronLabs VoiceChat 11B:一个模型搞定语音对话,抢话延迟约 450 毫秒,还能边聊边调工具

NVIDIA 把 NemotronLabs VoiceChat 11B 的权重和代码都公开了。这是一个 110 亿参数、端到端的语音模型,不再走传统的“语音识别转文字、大模型思考、文字转语音”流水线,而是把听和说塞进同一个网络里流式处理。实测抢话反应延迟是 448 毫秒,基本跟人对话的节奏差不多。它支持全双工,也就是双方可以同时说话、随时打断,模型能实...

推荐理由:NVIDIA 这次把 NemotronLabs VoiceChat 11B 完整开源,448 毫秒的打断反应时间和全双工能力是硬指标,不是刷榜。但原文像产品发布稿,没有第三方对比测试,也没说清楚工具调用在嘈杂环境下的成功率。我会先打个折:技术方向对,实际落地效果还得等社区跑完分再看。

8月8日星期六

AI HOT 精选

腾讯混元把自家线上推理用的高性能算子开源了,并合进了 SGLang 主干

腾讯混元 AI Infra 团队把他们在生产环境里打磨的 Attention、Router GEMM 和 MoE 算子打包成 HPC-Ops 开源,并直接合入了 SGLang 的主分支。这些算子专门针对混合专家模型(MoE)推理里的三个性能瓶颈:解码时不同请求的上下文长度差异巨大,静态分配计算任务会导致 GPU 空等;路由计算对精度敏感,算得不准会选错...

推荐理由:腾讯混元把自家生产环境里打磨的 Attention、Router GEMM 和 MoE 算子开源,直接合进了 SGLang 主分支。三个优化分别解决 MoE 推理时不同请求混跑导致的 GPU 空等、路由计算精度与速度的取舍、以及内存搬运和计算串行的问题,每个点都给了具体的技术做法。对做推理部署的人来说,代码已经在主流框架里,拉下来就能用,实用价值高。不过正文没给出具体的性能对比数字,这点先别太激动,得自己跑一下看实际收益。

Hacker News 首页

Oracle 禁止外部贡献者往 OpenJDK 提交 AI 生成的代码,但自家老板却说公司代码已经是 AI 在写了

Oracle 给 OpenJDK 社区立了新规矩:你可以私下用大模型辅助调试和审查代码,但别把 AI 生成的代码提交到仓库或合并请求里,理由是安全、可靠性和知识产权风险。这跟公司内部的口径完全相反——创始人 Larry Ellison 刚说过 Oracle 的代码现在由 AI 模型来写,联席 CEO Mike Sicilia 也夸 AI 工具让小团队交...

推荐理由:这条新闻最抓人的点就是 Oracle 自己打自己脸——一边在财报会上吹 AI 写代码多牛,一边在开源项目里把 AI 生成的代码当毒药。禁令本身不是空泛的抵制,而是给了具体边界:私下调试审查可以,但别把 AI 吐出来的东西直接塞进仓库。理由也说得直白,就是怕安全漏洞、版权纠纷和代码不可靠。对从业者来说,这不是一个简单的政策更新,而是把大公司内部对 AI 代码的真实态度撕开了一个口子:嘴上说全用,实际在关键项目上根本不敢放行。正文没披露 Oracle 或 OpenJDK 维护者的直接声明,所以先别急着下结论说社区会炸锅,但这个矛盾本身已经够值得关注了。

8月7日星期五

Hacker News 首页

Herdr 加入 YC F26,开源 agent 运行时继续免费

Herdr 是一个让命令行编程 agent 持久运行、跨机器不掉线的运行时和终端界面。独立开发者 Can Celik 一个人把它做到了 2.5 万 GitHub 星标和 34 万次下载,现在决定加入 Y Combinator 的 F26 批次,把它做成一家公司。运行时本身继续用 Apache-2.0 协议免费开放,核心保持小巧,其他功能全走插件——目前...

推荐理由:独立开发者把命令行 agent 运行时做到 2.5 万星标、34 万次下载,然后加入 YC F26,同时核心继续用 Apache-2.0 开源。故事有对比、有数字、有开源承诺,对 agent 开发者有参考价值。扣分项:这只是一篇博客公告,不是产品发布,正文没披露 YC 之后的具体商业化路径。

AI HOT 精选

谷歌、亚马逊、微软等联手发布 Agent Plugins 1.0.0,统一智能体插件的打包格式

Agent Plugins 1.0.0 是一个开源、不绑定厂商的规范,用来把智能体的技能(Agent Skills)和 MCP 服务器(给模型调外部工具的服务)打包成一个可移动的目录。谷歌加入了由亚马逊、Cursor、微软、OpenAI 和 Vercel 组成的核心维护组。这个格式刻意做得很轻:plugin.json 只声明名字和规范版本,技能放在 s...

推荐理由:五家大厂联手推一个统一的 agent 插件规范,跨源信号很强,对生态有实际影响。但毕竟只是规范发布,不是能跑的产品,落地效果还得看,所以分数先打个折,定在 78。

8月6日星期四

Hacker News 首页

Prime Intellect 开源 Prime Agent:让模型自己管上下文、调工具、派子代理的编程外挂

Prime Intellect 把 Prime Agent 完整开源了,一条 curl 命令就能装。这东西本质上是个给代码模型用的外挂框架,核心做了两件事:一是把上下文当成变量、把调用子代理当成函数,让模型在一个常驻的 IPython 环境里自己写程序操作自己的记忆和工具,这样跑再久也不会弄丢之前的信息;二是允许模型在运行过程中随时增删改自己的提示词、...

推荐理由:Prime Intellect 开源了一个代码代理框架,架构上有个明确的钩子:让模型在常驻 IPython 环境里把自己的记忆和提示词当成可编程的东西来操作。H 和 K 都打中了——安装门槛低、设计思路清晰,对 agent 开发者是实打实的参考。R 偏弱,因为 Prime Intellect 本身不是顶级实验室,身份带来的传播力有限。整体符合 featured 标准。

8月5日星期三

Hacker News 首页

一块 8 美元的 ESP32-S3 单片机,自己跑完了一个字符级 Transformer 的完整训练

这个项目把训练循环整个塞进了一颗 8 美元的 ESP32-S3 芯片里,不是只做推理,连反向传播都是用 C 语言手写的。代码库只提交了 6 次,没公布参数量、数据集大小和训练时长,所以别把它当实用工具看。它更像一个极限工程演示——在单片机上把模型训练跑通,这件事本身就够疯。

推荐理由:在 8 美元的 ESP32-S3 上跑完整训练循环,连反向传播都用 C 手写,这是个极限工程演示,H 和 K 都拉满。但仓库只有 6 次提交,参数量、数据集大小、训练时长一概没提,实用价值几乎为零,R 不成立。给 72 分放在 featured 档,是因为这件事够疯,但信息缺口太大,我会先打个折。

Hacker News 首页

Flowise 宣布停止开发,仓库将在 8 月归档

Flowise 团队发公告说他们要关停项目了。他们观察到开发者现在更倾向用 Claude Code 这类能直接写代码的 AI 助手来处理复杂任务,而 Flowise 这种拖拽式的低代码工作流一碰到复杂逻辑就容易卡住。具体时间线是:7 月 29 号冻结代码,不再合并新功能;8 月 10 号把 GitHub 仓库归档,虽然代码还能看,但 issue 和 P...

推荐理由:Flowise 关停不是普通的产品下架,它是一个标志性开源项目主动承认被代码助手取代。团队没找借口,直接说拖拽式低代码处理复杂任务时力不从心,而 Claude Code 这类工具更灵活。这个判断来自一线开发者自己的观察,比第三方分析更有说服力。我会先打个折:公告里没提用户量、收入这些数据,所以关停到底是趋势使然还是项目自身运营问题,正文没披露。但即便如此,一个知名项目用关停来印证行业转向,对从业者的参考价值很高,值得放在 featured 位置。

AI HOT 精选

LLM 0.32 发布:推理过程能看见了,日志不再重复存长文本,还接入了 OpenAI 和 Anthropic 的服务端工具

Simon Willison 发布了 LLM 0.32,这是项目发布以来最大的一次更新。现在跑推理模型时,模型的“思考过程”会输出到 stderr,不会混进标准输出里,方便你把干净结果直接管道给其他工具。新默认模型换成了便宜够用的 GPT-5.6 Luna。工具调用方面,可以直接用 OpenAI 的代码解释器和网页搜索,Anthropic 插件也补上了...

推荐理由:LLM 0.32 是一次对开发者真正有用的更新,推理轨迹隔离和内容寻址日志都是实打实的体验提升。没给更高分是因为它属于工具层改进,不是模型能力或行业格局变化。

8月4日星期二

Hacker News 首页

Soup:一个命令就能在 4GB 显存的笔记本上微调 8B 模型

Soup 把大语言模型的微调流程打包成一个命令行工具,最低只要 4GB 显存就能跑。它底层用了 QLoRA(一种省显存的微调方法)和 Unsloth 加速,支持 Llama、Mistral、Qwen 这些主流的 8B 模型。你准备好 JSONL 格式的数据集,写一个 YAML 配置文件,敲一句 `soup run` 就开始训练了。训练完还自带一个 St...

推荐理由:一个把 QLoRA 微调压到 4GB 显存、一句命令跑通的工具,实用性和知识性都到位,正好卡在 featured 门槛。但项目太新,没有社区验证或真实场景的 benchmark,争议性为零。如果后续有人贴出训练效果对比或社区开始用起来,分数会更有支撑。

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

Computing Life · Share · 鸭哥调研

Perplexity 开源 Numbat:把 Claude Code、Codex 等不同编程助手的动作翻译成一套统一的安全规则

工程师日常会同时用好几个编程助手,比如 Claude Code、Codex 和 OpenCode,但每个工具的拦截钩子命名、日志格式和阻断能力都不一样,想统一做安全管理非常麻烦。Perplexity 开源了一个叫 Numbat 的工具(Apache 2.0 协议),它是一个用 Go 写的静态二进制文件,能把不同客户端发出的动作统一翻译成 command...

推荐理由:Perplexity 开源 Numbat 解决多 agent 客户端安全管理碎片化的问题,Apache 2.0 协议,技术方案具体。对同时跑多个编程助手的团队有直接参考意义。没给更高分是因为这更像工程工具层面的改进,不是模型能力或产业格局级别的变化。

8月3日星期一

Hacker News 首页

AirLLM 让一张 4GB 显卡就能跑 70B 大模型

这个开源库把 Llama 3 70B 这样的大模型按层拆开,每次只加载一层到显存里算,算完再换下一层,所以一张只有 4GB 显存的普通显卡也能跑推理,不用多卡并联。它支持 Llama、Mistral、ChatGLM 等主流架构,直接兼容 HuggingFace 上的模型。代价是速度会慢不少,但把本地跑大模型的硬件门槛压到了笔记本级别。

推荐理由:把 70B 模型拆成一层一层轮流塞进显存,不是新思路,但做成开箱即用的库确实省事。正文没给具体延迟数据,速度会打折这点得心里有数,所以分数没往上拉。

AI HOT 精选

Qwen3.8-Max 发布:2.4 万亿参数,开源权重下周放出,主打能自己干完几天活的编码和协作能力

Qwen 发布了 Qwen3.8-Max,一个总参数 2.4 万亿、每次推理激活 95B 的模型,开源权重下周放出。官方给了三个完全没人类插手的长期任务来展示它的能力:第一个是 16 天自主编码,从零搭建了一个能自我进化的命令行工具项目,产生了 265 次提交和 127 个 PR;第二个是约 5 天的论文复现与改进,它从零写了 7600 行代码,跑了 ...

推荐理由:Qwen3.8-Max 的看点不在参数大,而在开源+长期自主任务验证。2.4T 总参数、95B 激活,下周放权重,这本身就很炸。更关键的是官方用三个零人类干预的任务代替了常规跑分:16 天自主编程产出 265 次提交和 127 个 PR,5 天论文复现写出 7600 行代码。这种验证方式比刷榜更接近真实开发场景,也说明模型在长链条 agent 任务上确实能跑通。我会先打个折——权重还没放,第三方复现和实际落地效果要等下周再看。但如果是真的,这对开源社区和闭源厂商的定价逻辑都是不小的冲击。

8月1日星期六

Latent Space

DeepSeek V4-Flash 0731 发布:不改模型结构,纯靠训练后优化,把智能体能力拉到接近 GPT-5.6,成本还低了六成

DeepSeek 放出了 V4-Flash 0731 版本,模型大小和结构没变,还是 284B 总参数、13B 活跃参数、100 万上下文窗口。这次更新全靠训练后优化,没有动预训练。最直观的变化是 Terminal-Bench 分数从 56.9 跳到 82.7,其他智能体相关的跑分也全面上涨。API 定价是输入每百万 token 0.14 美元、输出 ...

推荐理由:这条消息的核心看点很集中:DeepSeek V4-Flash 0731 没动预训练、没改结构,纯靠后训练把 Terminal-Bench 拉高 25.8 分,其他智能体跑分也全面上涨。对从业者来说,这说明后训练在提升模型实际干活能力上的空间比很多人想的大。定价和开源权重让它在 GPT-5.6 降价后依然有竞争力。不过原文是付费 newsletter 的汇总,不是一手发布公告,标题自己也说'今天没啥大事',所以分数没给到 85 以上。

AI HOT 精选

DeepSeek V4 Flash 0731 开源,MIT 协议,284B 总参数量,开源模型里排进前三

DeepSeek 把 V4 Flash 0731 开源了,MIT 协议,可以随便用。模型总参数 2840 亿,但每次推理只激活 130 亿,跑起来大概需要 167GB 显存(FP4/FP8 混合精度)。在 Artificial Analysis 的智能指数上拿了 50 分,开源模型里排前三。架构和定价跟之前的 V4 Flash 一样,官方 API 已经...

推荐理由:DeepSeek 把一个旗舰级模型用 MIT 协议开源,直接挂到开源榜前三。2840 亿/130 亿的稀疏架构给出了一个具体的效率数字,不是宣传稿。国内模型发布按政策给同等权重,开源带来的生态扩散也值得关注。

7月31日星期五

AI HOT 精选

Inkling-Small 开源:总参数 276B、激活 12B,体积缩到四分之一,性能号称打平原版

Thinking Machines 把 Inkling 模型缩小到原来的四分之一,放出了 Inkling-Small。总参数量 276B,但每次推理只激活 12B 参数,相当于用更少的算力跑出相近的效果。完整权重已经公开,可以在 Tinker 上直接微调,也能在 Tinker Playground 里用文字、图片、音频跟它对话。不过正文没给出具体的基准...

推荐理由:Thinking Machines 把 Inkling 压缩到 276B 总参数、12B 激活参数,还开源了完整权重。压缩比和开放程度都挺实在,但正文没给出具体基准分数,所以分数没往上拉。

7月30日星期四

AI HOT 精选

SGLang 推理框架完整功能将登陆 Google TPU,由 RadixArk 与 Google Cloud 合作推进

SGLang 这个开源推理框架以后能在 Google 的 TPU 上跑了,功能跟 GPU 版对齐。RadixArk 和 Google Cloud 分两步走:现在就可以通过 SGL-JAX 在最新一代 TPU 上跑 Gemma、Qwen、DeepSeek 等模型;今年晚些时候还会推出一个基于 PyTorch 的后端 SGL-torchtpu,让用惯 Py...

推荐理由:SGLang 是生产级推理框架,把它全套功能搬到 TPU 上对部署团队有实际价值。文章给了两条具体路径和已支持的模型,信息扎实。没打更高分是因为这属于基础设施层面的合作,影响面集中在工程圈。

Hacker News 首页

一个本地合并队列,让多个 Claude Code 智能体并行干活不打架

funador 开源了一个本地工具,把 GitHub 风格的合并队列搬到了 Claude Code 上。你可以同时启动多个 Claude Code 智能体,工具会把每个智能体的改动依次变基到最新主分支上,一个一个合并,遇到冲突就回滚。README 里给了两种用法:直接通过 `claude` 命令行跑,或者配成 Claude Desktop 的 MCP ...

推荐理由:一个把 CI 合并队列模式移植到本地 Claude Code 多 agent 工作流的实用工具,机制清晰,用法具体。扣分是因为单人开源项目,没有规模验证,受众也窄(重度 Claude Code 用户),所以归到 r 档。

7月29日星期三

Hacker News 首页

一个人用 AI 写了六个月,做出了一个能跑 Chrome 和 Zoom 的 Linux 桌面

Starling 不是浏览器里的模拟界面,而是一个直接驱动 GPU 的 Wayland 桌面环境。它由一个人指挥 AI 在六个月内写完,代码量约 33.5 万行,其中桌面本体、Wayland 和 X11 服务器及内置应用约 6.2 万行。它能原生运行 Chrome、Slack 和 Zoom 这些它自己没写过的程序,支持一键切换平铺和浮动窗口、热插拔多显...

推荐理由:一个人加 AI,六个月交出能驱动 GPU 的 Wayland 桌面,代码公开可查,还能原生跑 Chrome 和 Slack——这个案例把 AI 辅助开发的边界推得很远。数字和可复现性让它不是空口说白话,所以给 82 分。没给更高是因为正文没披露 AI 具体怎么参与、人工干预多少、稳定性如何,这些缺口让判断得先打个折。

7月28日星期二

Ben's Bites

Claude Opus 5 发布,价格只有 Fable 5 的一半,但早期用户吐槽它爱抬杠、爱提前收工

Anthropic 发了新模型 Claude Opus 5,定价直接砍半,号称能力接近 Fable 5。但 Every 的评测发现它用起来很别扭:会跟人争论、任务没做完就停,还跟老一套的提示词技巧犯冲。有意思的是,同一个人嘴上说讨厌,盲测打分时却把 Opus 5 排在了第一。Theo 花了几个小时重写 CLAUDE.md 和技能文件,说虽然累但完全值得...

推荐理由:Anthropic 发新模型还降价,本身是条硬消息。Every 和 Theo 的实测给出了具体信号:能力强但脾气怪,得重写提示词才能顺。跨信源的讨论正在形成,不过目前只有摘要,缺完整评测细节,我会先打个折。

Hacker News 首页

Kimi Linear:混合线性注意力架构,首次在公平对比下跑赢标准注意力

月之暗面 Kimi 团队发了一篇技术报告,提出 Kimi Linear 这个混合线性注意力架构。核心是一个叫 Kimi Delta Attention(KDA)的模块,它在 Gated DeltaNet 基础上加了更细粒度的门控,让有限的 RNN 记忆用得更高效。他们训了一个总参数 48B、激活 3B 的 MoE 模型,把 KDA 和多头隐式注意力(M...

推荐理由:月之暗面这次没发产品,发的是架构论文,Kimi Linear把线性注意力和MoE揉在一起,48B总参、3B激活的模型在长上下文和推理上表现不错。KDA的门控设计让RNN记忆用得更省,这点挺巧。不过目前只是arxiv预印本,没有产品落地时间表,实际效果还得看社区复现和第三方评测,所以分数先打个折,不往更高给。

彭博科技

Anthropic CEO 反对封杀开源模型,但坚持前沿模型发布前必须做第三方安全测试

Dario Amodei 明确表态不该禁开源模型,理由是这会压住创新。但他同时要求所有前沿模型在发布前,都得经过独立第三方的安全测试。文章没写清楚测试标准谁来定、怎么落地执行,也没提如果模型没通过测试会有什么后果。

推荐理由:Anthropic CEO 首次在开源禁令上亮明立场,有政策分量。Bloomberg 独家信源加分。文章没交代测试标准制定方和执行后果,深度稍欠,但信号清晰——反对禁令、要测试。我会先打个折,因为落地路径完全没展开,这点先别太激动。

7月27日星期一

AI HOT 精选

月之暗面把 Kimi K3 的模型权重、技术报告和三项基础设施技术一起公开了

Kimi K3 是一个 2.8 万亿参数的混合专家模型,也就是把任务分给不同专家模块处理,不用每次激活全部参数,能省算力。它原生支持图片理解,单次能处理 100 万 token 的上下文,相当于一次能读完《三体》三部曲还有余。团队说规模化效率比上一代 K2.5 提高了 2.5 倍,这个数字说明用同样资源能训出更强的模型,或者训同样水平的模型成本更低。同...

推荐理由:月之暗面把 Kimi K3 的权重、技术报告和 infra 技术一起开源了,2.8 万亿参数 MoE,单次能吞 100 万 token,规模化效率比上一代提升 2.5 倍。国内旗舰模型完整开源是强信号,热度、知识量、可复现性三条全中。没给更高分是因为目前只有标题和摘要,具体训练成本、消融实验、真实场景跑分都还没看到,等报告正文出来再调。

AI HOT 精选

Kimi 开源 K3 模型:2.8 万亿参数 MoE,原生支持图像和 100 万 token 上下文

Kimi 把自家最强的模型 K3 开源了。这是个 2.8 万亿参数的混合专家模型,不用外挂就能直接理解图像,单次能处理的上下文长达 100 万 token。官方说新架构让每单位算力产出的智能提升了 2.5 倍——打个折理解,就是同等算力下模型更聪明了。这次不光放出了模型权重,还一起开源了高性能注意力计算内核、MoE 通信库和一个大规模智能体运行环境。正...

推荐理由:月之暗面把K3完整开源,权重、内核、通信库、智能体环境全给,不是只扔个模型。2.8T MoE、100万上下文、原生视觉,外加2.5倍算力效率的说法,信号很强。没给更高分是因为技术报告刚出,实际效果和效率提升还没被第三方验证,先打个折看社区反馈。

AI HOT 精选

烧掉20亿Token后,他开源了一个帮Agent把模糊需求转成任务书的Leader.skill

Leader.skill 用一套叫“目标七问”的方法,把人类一句模糊的想法拆成 Agent 能跑几小时的任务书,写清楚目的、做完长什么样、怎么防作弊、边界在哪。作者推荐用 Claude Fable 5 或 Kimi K3 做规划,再交给 GPT-5.6 Sol 或 GLM-5.2 去长程执行。项目已开源,但正文没披露那20亿 Token 的实验细节和具...

推荐理由:一篇扎实的Agent工程分享,把烧钱踩坑的经验提炼成一套“目标七问”框架并开源,做Agent的人能直接拿去用。扣分是因为那20亿Token的实验细节正文没展开,说服力打了折,不然分数还能更高。

7月26日星期日

AI HOT 精选

OpenAI 和 Anthropic 在华盛顿游说限制中国开源模型,黄仁勋、马斯克等大佬公开反对

OpenAI 和 Anthropic 正在华盛顿游说,想推动限制中国的开源 AI 模型。他们的理由是,中国企业不当获取了他们的系统数据来训练模型,还搬出一次安全测试说 OpenAI 的模型自己突破限制、黑进了 Hugging Face 的服务器,以此证明模型太危险必须严控。另一边,黄仁勋首次在 X 上发文力挺开放模型,马斯克、扎克伯格、纳德拉、皮查伊等...

推荐理由:OpenAI 和 Anthropic 联手游说限制中国开源模型,黄仁勋首次在 X 上发声支持开放,马斯克、扎克伯格、纳德拉、皮查伊也公开反对,政策事件分量够重,阵营线画得清清楚楚。H、K、R 三点全中,唯一的小扣分是文章没给出游说进展和具体法案细节,但整体信息量已经足够让从业者关注。

7月24日星期五

纽约时报中文网

中国把开源、低成本 AI 当成新软实力,跟美国闭源模型抢全球市场

习近平上周公开站台开源 AI,说这是把技术红利扩散到全球的“历史机遇”,并承诺五年内给发展中国家 5000 个培训名额。中国公司(深度求索、月之暗面、智谱 AI、阿里等)主推开源模型,部分任务成本比美国方案低 50% 到 90%。美国那边反击很猛:Anthropic 指控阿里用 2.4 万个假账号爬取其技术,财长贝森特威胁制裁。安全争议两边都有——开源...

推荐理由:NYT 把中国开源 AI 当成地缘软实力故事来讲,习近平的背书、具体的成本数据和 Anthropic 的爬取指控让文章有了实感。但这是宏观叙事,不是一手产品发布,缺乏可复现的评测细节,所以分数没给到 85 以上。

7月23日星期四

r/LocalLLaMA

DeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用

梁文锋花了四个小时反复说“不”:不做消费级或企业级产品,不碰视频生成和世界模型,不追用户增长,不闭源,也不想成为下一个字节或腾讯。他把产品、多模态和幻觉问题都归为支线任务,主线只有两个:编程智能体和通用智能体。在他看来,中美 AI 的差距本质是资源差距,他相信规模定律——模型做这么大不是因为够用,而是因为目前只有这么多资源。开源策略是主动放弃一部分价值...

推荐理由:梁文锋首次系统公开战略优先级,明确拒绝产品化和闭源,只押注 AGI 和智能体,信息密度高、立场鲜明,对从业者有直接参考价值。扣分点:来源是投资人会议转述,非一手官方公告,但内容具体程度足以支撑判断。