跳到正文

#编码

今日 10 条

6月4日星期四

量子位 · 公众号

Together AI 把 2-bit KV Cache 压缩真的跑在了线上服务里

Together AI 和悉尼大学、UIUC 搞了个叫 OSCAR 的 2-bit KV Cache 压缩方案,每个 KV 元素实际只占约 2.28 bit,在 Qwen3-4B-Thinking 上跑分 71.86,比 TurboQuant 高出 40.1 分。简单说就是把模型推理时占显存的大头——键值缓存——压到极低精度,还尽量不丢性能。正文没披露...

推荐理由:HKR 三项都站得住:OSCAR 把 2-bit KV Cache 从纸面推到线上,还给了实打实的分数和对比。不过话题本身还是底层推理优化,放 featured 比放头条更合适,做推理基建的人会点进去看。

AI HOT 精选

Hugging Face 改造命令行工具,让 Claude Code 这类编码智能体调用时省下 6 倍 token

Hugging Face 把自家的 hf 命令行工具重新设计了一遍,让它能同时服务人类和编码智能体。工具会通过环境变量自动识别是不是 Claude Code、Codex 等智能体在调用,如果是,就输出紧凑、不截断的 TSV 格式,而不是给人看的表格。在复杂多步任务测试里,没用这个 CLI 的智能体(比如自己拼 curl 或调 Python SDK)消耗...

推荐理由:我会先打个折:token 降到六分之一是官方说法,正文没给出测试场景和对比基准,实际省多少要看具体任务。但思路很清晰——传统 CLI 输出对人类友好,对智能体却是噪音,切成结构化 TSV 能减少大量解析和截断开销。自动检测智能体身份这一点也实用,不用手动切模式。整体是工具链层面的务实改进,不是模型或平台级发布,所以放在 featured 档合理。

Latent Space

Axiom 用形式化验证做数学推理,Putnam 竞赛 12 题全解,Verina 基准 187/189

Axiom 这家成立七个月的初创公司,在 2025 年 Putnam 数学竞赛里解出了全部 12 道题,限时内得分 8/12,不限时则拿到满分 120 分,超过了已知的 DeepSeek 成绩(103/120)。CEO Carina Hong 说,他们的模型在 Verina ProofGen 基准上跑出了 187/189(约 99%),而 OpenAI...

推荐理由:HKR 三项都站得住:Putnam 限时成绩和 o3 的 4.9% 一对比,故事性就出来了;187/189 和 12 道题的具体数字让信息有抓手;话题本身踩在推理能力、评测公信力和 OpenAI 竞争这几个热点上。分数定在 80 是合适的,因为这是一篇 Latent Space 的访谈和研究分享,不是一次大规模模型发布,影响力范围有限。

r/LocalLLaMA

有人写了个编译器,把 Python 代码转成更省 token 的格式喂给模型

作者开源了一个叫 Vulpine 的编译器,能把 Python 源码转成一种专门给代码模型看的紧凑表示。在约 1.3 万个留出测试文件上,token 用量平均减少了 14%,而且 99.8% 的情况下能无损还原回原本的抽象语法树结构。代码已经挂在 GitHub 上。不过正文没披露具体测试了哪些模型、省下的 token 对生成质量有没有影响,这点先别太激动。

推荐理由:这个 Vulpine 编译器把 Python 转成模型更容易消化的表示,实测能省 14% 的 token,往返还原成功率也高。我会先打个折:帖子没披露在真实下游任务里效果如何、编译速度多快、那 0.2% 的失败案例长什么样,所以目前只能当个有潜力的早期实验看。但思路本身对压降代码 agent 的推理成本有参考价值,数字也给了,值得从业者扫一眼。

6月3日星期三

r/LocalLLaMA

谷歌放出 Gemma 4 系列,12B 模型能看图文、听音频,上下文窗口拉到 256K

谷歌 DeepMind 把 Gemma 4 系列的开源权重挂上了 Hugging Face,一共五个尺寸。其中 12B 这个版本支持文本、图片和音频三种输入,同时放出了指令微调版和预训练版。它原生支持系统提示词和函数调用,上下文窗口最长能到 256K token,意味着一次可以塞进很长的文档或对话记录。不过 Reddit 原帖被网络策略拦截,正文没披露...

推荐理由:Gemma 4 这次把开放权重、多模态和 256K 长上下文一起端上来,比常规版本更新更有看头。我会先打个折:正文没给具体 benchmark 和 license 细节,官方博客也没同步,所以判断先停在 83 分。如果是真的,12B 这个尺寸能跑图、能听音频,对本地玩家挺省钱。

阿里技术 · 公众号

当 AI Agent 变成主力开发者,研发工具链得从头想想了

这篇文章我没能看到正文,微信页面显示环境异常需要验证。从已有的英文摘要看,作者许晓斌提出了一个判断:用 AI Agent 做开发,能把从“有想法”到“出代码”的周期从几周甚至几个月压缩到几分钟。他举了几个例子,包括用 Agent 搭周报系统、多角色 Agent 协同开发、自动配镜像仓库。文章还点出了现有研发设施跟 Agent 开发模式不匹配的地方,比如...

推荐理由:这篇文章不是产品发布或模型评测,而是一篇基础设施层面的评论。我会先打个折,因为案例都来自作者自己的实践,没有第三方验证,但“周/月级压到分钟级”这个说法配上具体场景,对从业者来说有参考价值。正文没披露多角色 agent 协作的成功率和翻车率,这点先别太激动。整体放在 featured 里合理,属于那种看完会让你重新打量自己团队流水线的东西。

Latent Space

微软一口气发了7个新模型,MAI-Thinking-1是主打,还附了109页技术报告

微软在Build大会上发布了7个MAI系列模型,覆盖文本推理、代码、图像、语音转文字和语音合成。主角是MAI-Thinking-1,一个35B活跃参数的混合专家模型,支持256K上下文窗口。它被定位为微软首个推理模型,训练数据链条干净,没有用任何第三方模型做蒸馏。随模型一起公开的109页技术报告在圈内评价很高,因为透明度给得足。报告里写明,模型的推理能...

推荐理由:我会先打个折:微软这次没公开模型权重、定价,也没给第三方评测结果,所以没法验证它实际有多强。但光凭 7 个模型、35B 激活参数的 MoE、256K 上下文和 109 页技术报告这几个硬数字,信息密度已经够高。加上这事发生在 Build 大会,直接摆在微软自家模型和 OpenAI 依赖的交叉点上,话题性拉满。正文没披露具体 benchmark 分数,这点先别太激动,但作为当天新闻,重要性给到 87 是合理的。

量子位 · 公众号

扣子3.0实测:手机能远程遥控你电脑上的智能体干活

扣子3.0把智能体协作搬到了项目里,支持iOS、安卓、Mac、Windows和网页端。你可以把本地跑的Claude Code、Codex CLI这类命令行智能体导进去,在手机上授权后直接让它读你电脑里的PDF。正文没披露具体延迟和资源占用数据,实际体验得自己跑一遍才知道稳不稳。

推荐理由:HKR 三项都踩中了:扣子 3.0 让手机能远程指挥电脑里的 Agent,还支持导入 Claude Code 这类命令行工具,等于把 Agent 协作和跨设备控制绑在一起。不过它本质上还是一个产品更新,正文没提定价、推送范围和本地文件读取的安全边界,所以先放在 featured 这一档。

新智元 · 公众号

WSJ 挖出 OpenAI 与 Anthropic 创始人的九年恩怨:Dario Amodei 曾把 Greg Brockman 踢出 ChatGPT 前身项目

这篇来自 WSJ 的报道梳理了 OpenAI 总裁 Greg Brockman 和 Anthropic 联合创始人 Dario Amodei 之间长达九年的矛盾。核心冲突是,在 OpenAI 内部研发一个后来演变成 ChatGPT 的项目时,Dario Amodei 直接禁止 Greg Brockman 参与。文章还提到,Brockman 现在负责 O...

推荐理由:我会先打个折:这不是模型发布或现任高管离职,所以放在 featured 里算合理。但 WSJ 挖出的料够硬——Dario 当年直接不让 Brockman 碰 ChatGPT 的前身,这比普通的口水仗有信息量。后面 Brockman 管了近 1500 人的产品战略,也说明他现在在 OpenAI 的盘子有多大。两条事实一前一后,把两家公司的旧怨和现状串起来了,对关注 AI 公司权力格局的人有参考价值。

AI HOT 精选

智能体工程实战窍门全录

@mvanhorn 分享了一套让 AI 智能体干活的工程方法,核心是把开发流程从“人写代码”扭成“人定方向、智能体执行”,工作台从 IDE 搬到了终端和一份 plan.md 计划文件。整体走 Research → Plan → Work 循环,用 plan.md 来约束智能体行为。帖子总结了 22 条实战技巧,覆盖规划、并行执行、输入方式、远程控制这些...

推荐理由:这是一篇从业者的方法总结,不是模型发布或产品上线。正文没披露完整工具栈清单,所以我会先打个折。但 Research→Plan→Work 循环和 plan.md 约束的思路很具体,22条技巧也给了可操作的抓手,对正在折腾智能体工程的人有直接参考价值,放在 featured 档刚好。

Computing Life · Share · 鸭哥调研

vibe coding 之后:AI 编程的工业化

MAI 从 487 万个开源 PR 里筛出 26.5 万道可训练题目,又为它们建了一套三层判分体系。AI 编程这两年真正的变化不是模型变聪明了,而是训练基础设施被工业化了:出题从手工活变成了流水线,批改也从“单测全绿就行”升级到能检查工具使用效率和前端视觉质量。

推荐理由:这篇文章没发模型、没给跑分,但把“vibe coding”之后该看什么讲清楚了:训练数据怎么筛、判分怎么搭、工程成本怎么控。487 万 PR 筛到 26.5 万题,这个压缩比本身就说明他们在做苦活,不是随便抓一把数据就训。三层判分体系正文没展开细节,但至少表明他们知道代码题不能只靠单次通过率来评。我会先打个折:没看到开源计划、也没看到实际训练出来的模型效果,所以目前更像一套训练基础设施的思路,离可复现的结论还差一步。对正在考虑自训代码 agent 的团队来说,这篇值得看,但别急着当标杆。

AI HOT 精选

智能性价比

微软在模型发布卡里加了个新指标:平均 token 用量。他们的新模型在 SWE-Bench Verified 上拿了 71.6 分,但消耗的 token 只有 Claude Haiku 4.5 的三分之一。这意味着现在衡量模型得看两个维度:活儿干得怎么样,以及干这活儿花了多少钱。靠烧 token 刷榜、靠补贴打价格战的时代在翻篇。Uber 四个月烧光预...

推荐理由:H、K、R 三条都站得住。用“跑分除以 token 消耗”当钩子,比单纯报分数更让人想点进去看。71.6 分和三分之一的 token 量是实打实的新信息。不过文章没给出完整的测试配置和具体定价对比,所以重要性停在 78 分,我会先打个折,不往更高拉了。

AI HOT 精选

OpenAI 给 Codex 加了个 Sites 功能,能把你的想法直接变成能交互的网页

OpenAI 在 6 月 3 日上线了 Codex Sites 的预览版,目前只给 Business 和 Enterprise 用户用。你可以把想法、表格或计划扔进去,它会生成一个带托管链接的交互式网站,比如仪表盘、项目看板或规划器。生成的网站可以通过 URL 分享给团队里的指定成员,一起看、一起改。文章举了个例子:财务主管能把静态表格变成一个实时调整...

推荐理由:这是个产品更新,不是模型或底层能力发布。Codex 能直接吐网站确实实用,但先别太激动——目前只对企业版用户预览开放,正文也没说清楚生成的网站能复杂到什么程度、能不能接真实数据。我会先打个折,把它放在中等权重的产品更新档位。

AI HOT 精选

Claude Code 现在能自己派活给多个子模型,并行干活

Claude Code 新增了动态工作流,核心是让它在运行时执行 JavaScript 文件,按需创建并协调多个子代理(subagent)。每个子代理有自己的上下文窗口,互不干扰,可以同时跑研究、安全分析和代码审查这些任务。官方举的例子是让一个子代理查漏洞、另一个审代码逻辑,主代理最后汇总结果。正文没披露子代理数量上限和额外费用怎么算,这点先别太激动。

推荐理由:HKR 三项全中:Claude Code 用运行时 JS 编排带独立上下文的子代理,这是个实打实的新功能。Anthropic 的品牌有加分,但这次是功能更新而非模型或平台级发布,所以分数落在 78–84 区间。正文没提具体性能数据和价格变化,这点先别太激动。

AI HOT 精选

微软放出 MAI-Thinking-1,35B 活跃参数的 MoE 模型,没靠蒸馏自己从头训

微软发了 MAI-Thinking-1,一个混合专家(MoE)模型,总参数 1 万亿但每次只激活 350 亿,跑起来相对省算力。它用 30T token 从零预训练,没拿第三方模型做蒸馏,这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”,听着像在反复试错往上拱。成绩单上,AIME 2025 拿了 97.0%,LiveCodeBench v6 拿了 ...

推荐理由:微软发了 MAI-Thinking-1,一个 MoE 架构的推理模型,活跃参数 35B,总参数 1T,用 30T tokens 从零开始预训练。我会先打个折:正文没给任何跑分、开放方式或定价,所以没法判断实际水平。光看参数规模,35B 活跃部分在推理时成本不会太高,但 1T 总参数意味着训练和存储都不便宜。这点先别太激动,等有 benchmark 和访问方式再说。

AI HOT 精选

Claude Code 能按任务自动生成专属工作流了,用 JS 脚本调度子智能体干活

Claude Code 加了一个动态工作流功能,你给它一个任务,它会现场写一段 JavaScript 来指挥多个子智能体分工协作。你可以指定用哪个模型、工作区隔离到什么程度,适合做研究、安全分析、代码审查这类复杂活,写好的工作流还能共享和复用。不过正文没提具体会多烧多少 token,也没说这个功能现在是不是所有人都能用,这点先别太激动。

推荐理由:HKR 三项都过,但文章只给了机制层面的细节,token 增量、推送范围和定价都没提。因为跟 Claude Code 直接相关,所以放在中量级产品更新里偏高的位置。

Hacker News 首页

微软 MAI-Code-1-Flash 用 50 亿活跃参数在 SWE-Bench Pro 上拿到 51% 的分数

微软新放出的 MAI-Code-1-Flash 是个代码模型,只激活 50 亿参数就在 SWE-Bench Pro(一个让模型修真实 GitHub 问题的测试集)上跑出 51% 的分数。这个成绩放在小模型里算亮眼,但正文没披露它是在什么评测设定下跑的、用了哪些训练数据、什么时候发布,也没说部署条件。所以这个 51% 我先打个折看——不知道是不是挑过题、...

推荐理由:HKR 三条都过,靠的是微软这个 5B 活跃参数拿 51% SWE-Bench Pro 的说法。但正文没披露评测设置、训练数据和发布时间,信息缺口明显,分数只能压在 72–77 这个区间。

AI HOT 精选

Claude Platform 推出命令行工具,终端里直接跑 API 和托管智能体

这个 CLI 工具把 Claude Platform 的所有 API 端点都搬到了终端里。你可以直接在命令行调用 Messages API、启动 Claude 托管的智能体,然后把返回结果用管道传给 shell 做后续处理。官方提到,用 Claude Code 这类编码智能体来理解这个 CLI 也没问题。正文没披露性能开销或额外费用,实际用起来会不会增...

推荐理由:Claude Platform CLI 在 HKR 三项上都站得住,是个实用的开发者工具更新。不过公告只给了能力范围,安装流程、权限控制、安全限制和定价都没提,我会先打个折——实际落地好不好用,还得看这些缺口怎么补。

AI HOT 精选

微软发布自研推理模型 MAI-Thinking-1,中等规模,没从第三方模型蒸馏

微软在 Build 2026 上掏出了自己的第一款高级推理模型 MAI-Thinking-1。官方说这是个中等尺寸的模型,在一些软件工程基准上能跟一线模型打平。训练数据完全自建,没走知识蒸馏的捷径——也就是没拿别家大模型当老师来教它。这是微软在模型自研上的一次表态,之前它主要靠 OpenAI,最近两家刚重新谈了合作,关系没那么紧了。

推荐理由:微软在 Build 2026 发了 MAI-Thinking-1,说是中等规模推理模型,在软件工程基准上能打平领先模型。我会先打个折——正文没披露具体分数、访问方式和定价,所以没法判断它到底多强、多便宜。这点先别太激动。但这是微软第一个自研高级推理模型,信号很明显:它在试着减少对 OpenAI 的依赖,同时往开发者工具链里塞自己的货。

彭博科技

Uber 给员工用的 AI 编程工具设了消费上限,因为今年 AI 预算已经花超了

Uber 开始限制员工在 Claude Code 这类 AI 编程工具上的开销。公司今年早些时候 AI 预算就超支了,所以现在直接设了使用上限。具体上限是多少、哪些团队受影响、总预算是多少,正文都没披露。

推荐理由:这条消息好读,因为讲的是大公司用 AI 工具用到超预算,不得不踩刹车。Uber 设上限这个动作本身就是一个信号:编程助手类产品在企业里推,成本不是小数目。正文没给预算数字、上限规则和受影响人数,所以我会先打个折,不往大了吹。但对企业采购和工具定价的人来说,这个案例比很多技术评测更直接——它告诉你,就算工具好用,财务那边也会喊停。

Latent Space

GitHub COO 聊怎么让平台接住 AI 代理的代码洪流

GitHub COO Kyle Daigle 说,2026 年 AI 驱动的代码提交量涨了 14 倍,这给原本按人类节奏设计的 GitHub 基础设施带来了很大压力,公开的宕机问题也跟这有关。他聊了 Copilot 的演变:从代码补全到命令行工具、桌面应用、云端代理和 SDK,以及 WorkIQ、MCP 这些让模型接入 Slack、邮件等公司上下文的方...

推荐理由:HKR 三项都成立:GitHub 高管给出 14 倍 AI 代码提交这个具体数字,把 Copilot、Actions、MCP、WorkIQ 和云端 agent 串成一条线来讲,信息量够。不是重大产品发布,所以重要性停在 80 分。

AI HOT 精选

Claude Code 团队自述:把编程工作默认交给智能体后,我们的流程和分工全变了

Claude Code 的工程主管在 Code w/ Claude SF 2026 活动上分享了团队内部的变化。他们把智能体编程(让模型直接写代码、改代码)设为默认工作方式后,砍掉了传统的详细需求文档,改成“即时规划”——在动手前先让 Claude 收集上下文、理清任务。代码审查环节,Claude 会先过一遍代码风格和测试覆盖,人则把精力集中在法律合规...

推荐理由:这是 Anthropic 自家团队在 Code w/ Claude SF 2026 上的分享,不是模型发布或重大产品更新,所以分数压在 80 分左右。亮点在于他们公开了内部怎么用 Claude Code 干活:规划从提前设计改成即时按需,写代码前先让 Claude 把上下文理一遍,审查环节把风格和测试甩给 Claude,人只做法律和安全判断。这些机制写得实在,没有画饼,对工程团队有直接参考价值。但正文没披露具体效率数据或量化对比,所以别当性能报告看。

AI HOT 精选

OpenAI Codex 出了 Python SDK,一行命令就能把编程 Agent 塞进自己应用里

OpenAI Codex 发布了 Python SDK,安装命令是 pip install openai-codex。这意味着开发者可以直接在自己的代码里调用 Codex 的编程和生图能力,不用再单独打开 Codex 界面。更省事的是,SDK 能复用你已经在 Codex 上的登录状态,省去再搞一套鉴权的麻烦。不过正文没提 API 怎么收费、用的是哪个模...

推荐理由:我会先打个折:正文只说了怎么装和怎么登录,没给 API 价格、模型版本或限流条件,所以别急着算账。但这件事本身挺实在——Codex 不再只是个聊天窗口,而是能当零件用,pip 一装就能集成。对开发者来说,复用登录态省了一步鉴权麻烦,但没写清楚调用上限,真上生产还得自己测。整体是实用的产品更新,信息有缺口但不妨碍它值得关注。

AI HOT 精选

OpenAI 给 Codex 加了 Sites 功能,能把想法直接变成团队可用的网页或小应用

Codex 现在可以把你的工作内容、想法和计划直接转成一个交互式网站或应用,团队通过一个链接就能打开、使用和分享。这个功能会先推给 Business 和 Enterprise 用户,正文没提价格,也没说什么时候开放给其他套餐。

推荐理由:我会先打个折:正文没披露定价、权限边界,也没给实际效果案例,所以别急着把它当成成熟的生产力工具。但 Codex 从写代码延伸到直接出可交互站点,这个方向本身挺省钱——省掉了从代码到可演示原型中间的那一步。对企业和团队用户来说,一个 URL 就能让非技术人员上手试用,协作摩擦会小很多。这点先别太激动,等看到具体质量表现和计费方式再说。

TechCrunch · AI

OpenAI 在 Codex 里塞了六个白领岗位插件,覆盖数据分析、创意、销售、产品设计、股票研究和投行

OpenAI 给 Codex 应用上线了六个新插件,分别瞄准数据分析、创意产出、销售、产品设计、股票投资和投行业务。每个插件都打包了工具集成、操作指令和上下文,让 Codex 能模拟特定岗位的工作流。正文没提定价和开放范围,我会先打个折——没看到实际跑通的效果和成本之前,别急着把它当正式员工用。

推荐理由:OpenAI 把 Codex 从程序员工具扩成白领插件包,六个方向覆盖了数据、创意、销售、产品、股票和投行,动作不小。但正文没提定价、实际效果和推送范围,所以我会先打个折,把它放在中等权重的产品更新档。

6月2日星期二

Ben's Bites

Claude Opus 4.8 发布,Claude Code 学会写脚本派子任务并行干活

Anthropic 发了新模型 Claude Opus 4.8,主要卖点是 Claude Code 现在能先写一个调度脚本,再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒,这并不证明松散的 multi-agent 架构靠谱,反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”,更诚实、更少...

推荐理由:HKR 三项都成立,因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据,所以分数压在 85–94 这个区间。

AI HOT 精选

Anthropic 扩大 Project Glasswing 计划,新增约 150 家关键基础设施机构

Anthropic 把 Project Glasswing 的合作范围从约 50 家扩到约 150 家新机构,覆盖超过 15 个国家,新增了电力、水务、医疗、通信和硬件等关键基础设施行业。这些机构都有一个共同点:一旦代码库被攻破,影响可能超过 1 亿人。前期合作方用 Claude Mythos Preview 已经扫出超过 1 万个高危或严重漏洞,现在...

推荐理由:Anthropic把Project Glasswing铺到约150个新组织,横跨15个以上国家,HKR三项都有实打实的数字和行业支撑。不过正文没披露具体的安全机制或模型能力变化,所以分数就停在featured低段,先别太激动。

r/LocalLLaMA

我把多智能体调度器里的 Claude 换成本地 Qwen3.6-27B,跑了两个星期

作者用一张 RTX 3090 跑 Qwen3.6-27B,在 47 个多步骤编程工作流里顶替 Claude 试了两周。计划生成的结构合规率大约 95%,但工具调用格式错误率有 12% 左右,而且上下文一超过约 12k token,实际表现就开始明显下滑。正文没披露具体任务难度和对比基准,所以 95% 这个数只能当个参考,别直接当成“接近 Claude”...

推荐理由:这篇值得看,因为它是真人两周实测,不是跑分。作者用一张消费级显卡把 Qwen3.6-27B 塞进多智能体编排里,替换 Claude,给出了能用的上限和会翻车的点。95% schema 合规听着不错,但 12% 工具调用格式错误意味着每八九次就有一次格式炸了,生产环境还得加校验层。长上下文到 12k tokens 就吃力,复杂任务得拆。正文没披露延迟数据和总 token 消耗,这点先别急着算成本账。整体是份诚实的工程笔记,不是公关稿。

AI HOT 精选

为了省120刀,我把电脑清理做成了开源AI工具

作者用Codex扫了自己的MacBook,发现B站缓存等一堆可删文件,激进方案能清出超140G。他干脆把清理逻辑做成一个开源skill,Mac和Windows都能用。工具会扫描文件生成可交互的HTML报告,用绿黄红三色标出哪些能放心删、哪些要人工判断、哪些千万别动,还带安全执行按钮。实测清出近120G,而CleanMyMac只扫出15.8G,信息透明度...

推荐理由:这篇东西不是平台级大新闻,但 H、K、R 三点都踩中了:120 美元的替代钩子够抓人,扫描报告和 120G 实测结果给了具体信息,开源 skill 的思路对想用 AI 省钱的开发者有直接复用价值。放在 featured 门槛附近没问题,属于那种实用开源工具类的推荐。

AI HOT 精选

Anthropic 开发者公开了一套 Claude Code 工作流,核心是让 AI 当老师逼你真正搞懂代码,而不是只点“同意”

这套流程把 Claude Code 定位成“高效又聪明的老师”,目标不是替你写完代码,而是确保你能把问题、方案和影响讲清楚、辩得动。它沿着问题域、方案域和语境域三条线,拆成 8 个可执行步骤,用增量教学、用户复述、清单加测验的方式,在进入下一步前先确认你真的懂了。这么设计是为了对抗长会话里人慢慢变成“审批按钮”的问题,强制把决策上下文沉淀下来,让理解过...

推荐理由:我会先打个折:这不是产品发布,是一篇实操分享,所以放在 featured 低位。HKR 三项都踩实了——钩子把“人变按钮”这个痛点讲得很透,知识部分有 8 步工作流和验证循环,相关性直击开发者对 agent 失控的担忧。正文没披露这套流程在复杂项目里的失败率,这点先别太激动,但作为可落地的教程,信息密度够。

Hacker News 首页

OpenAI 把自家最强模型和 Codex 搬上了 AWS

OpenAI 宣布,它的前沿模型和 Codex 编程助手已经在 AWS 上正式开放使用。这意味着企业可以直接在自己熟悉的 AWS 环境里调用 GPT-5.5 等模型,走现有的安全、合规和采购流程,省去另起炉灶的麻烦。Codex 也一并上线,这个每周有超过 500 万人用的编程智能体,现在能在 AWS 里帮团队写代码、做审查和修 bug。正文没披露具体定...

推荐理由:这条消息本身挺有意思,OpenAI 上 AWS 意味着企业多了一个不用 Azure 也能用前沿模型的选择,对多云策略和采购谈判都有影响。但正文实在太薄,只给了个链接和 56 分、17 条评论,没写可用区域、价格、模型清单,也没说清楚是 Bedrock 里的托管版还是别的接入方式。所以我会先打个折:信息缺口太大,没法判断实际落地程度和性价比,这点先别太激动。

AI HOT 精选

Perplexity 把搜索流程写成代码,让 AI 代理直接调接口,不再绕函数循环

Perplexity 公开了一套叫 Search as Code 的搜索架构。它的做法是让 AI 代理直接写 Python 代码去调用自家的搜索栈,而不是像以前那样一步步循环调用函数。这套东西已经上线 Perplexity Agent API,并且成了 Computer 功能的默认选项。正文没披露具体性能对比数据,但思路很直接:省掉中间环节,让搜索更快...

推荐理由:我会先打个折:这篇只有 Perplexity 自己的公告,没给性能对比、定价细节和实际铺开范围,所以只能算一个低配版的产品更新。但亮点很实在——Perplexity 把搜索从“调 API 拿结果”变成了“让模型写代码操作搜索栈”,并且已经接进 Agent API,这对正在搭 agent 的团队来说是个省事的信号。正文没披露延迟和成本数据,这点先别太激动。

6月1日星期一

AI HOT 精选

MiniMax 开源 M3 模型,把写代码、读长文和看图听声塞进一个系统,跑分压过 GPT-5.5 但成本只要十二分之一

MiniMax 放出了一个叫 M3 的开源模型,把代码能力、一次能读 100 万 token 的长上下文和原生多模态(能直接处理图像、音频)做在了一起。在 SWE-Bench Pro 这个代码基准上拿了 59.0%,比 GPT-5.5 的 58.6% 和 Gemini 3.1 Pro 的 54.2% 都高一点;在 BrowseComp 自主浏览任务上 ...

推荐理由:我会先打个折:目前只有一条 X 帖子,没看到官方技术报告或第三方独立评测,所以分数压在 78–84 区间。但 M3 确实把编码、超长上下文和多模态打包开源,SWE-Bench Pro 59.0% 不算顶尖但够用,成本只有 GPT-5.5 的约 1/12,对想省钱又有长上下文需求的团队是个实在选项。这点先别太激动,等正式文档和更多实测出来再调判断。

AI HOT 精选

开源与闭源模型,正走在两条不同的增长曲线上

作者 Nathan Lambert 的核心判断是:在编程智能体这类对智商极度敏感的场景里,用户会一直为最聪明的闭源模型付高价,他自己就愿意每月掏 2000 美元。闭源实验室会逐渐把最好的模型藏起来,不在 API 里轻易放出,以保护利润和防止被蒸馏。他预测 5 到 10 年内,OpenAI 和 Anthropic 的估值会到 2 万亿到 10 万亿美元,...

推荐理由:我会先打个折,这是一篇个人评论,不是系统研究,所以重要性停在 featured 门槛附近是合理的。但它的 HKR 三项都站得住:观点有明确的冲突框架(h),给出了可引用的价格和估值数字(k),讨论的议题正好是当下圈子里吵得最凶的那几个(r)。正文没披露这些估值模型的具体假设,所以数字本身先别太激动,但它们作为讨论的引子够用了。

AI HOT 精选

OpenBMB 放出两个开源数据集,预训练语料和 SFT 样本都给了,HuggingFace 趋势榜第一

OpenBMB 跟清华 NLP、Modelbest 一起发了两个数据集,都挂在 HuggingFace 上。一个是 Ultra-FineWeb-L3,给预训练用的合成数据,总量超过 600B token,其中英文 400B+、中文 200B+,是目前最大的开源中文预训练合成数据集。另一个是 UltraData-SFT-2605,给模型做指令微调用的,有...

推荐理由:我会先打个折:正文没披露数据质量评测、去重细节和许可证,所以没法判断实际可用度。但两个数据集的体量摆在那,600B+ tokens 的网页语料和 15M+ 条 SFT 样本,对做预训练和指令微调的人是实打实的弹药。冲上 HuggingFace 趋势榜说明社区有需求,不过这点先别太激动,热度不等于质量。整体看,这是一次对开源训练数据供给的补充,尤其对中文场景,值得关注但需要等后续评测。

AI HOT 精选

MiniMax 开源 M3 模型:一个模型搞定编程、100 万 token 上下文和原生多模态

MiniMax 把 M3 模型开源了,权重公开可下载。它把三个能力塞进了一个模型里:编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边(SWE-Bench Pro 得分 59.0%),能处理 100 万 token 的超长上下文,还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

推荐理由:MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案,上下文窗口拉到100万token。最实在的点是MSA注意力机制,每token计算成本降到前代的1/20,长文本推理能省不少钱。编码和Agent跑分看着不错,但正文没给出具体对比对象和测试细节,这点先别太激动。整体是一次有诚意的开源发布,信息量够,但验证还缺一环,所以放在featured而不是P1。

OpenAI News

OpenAI 封掉一批用 ChatGPT 装美国人、发帖反对美国数据中心的中国账号

OpenAI 在 6 月威胁报告里披露,他们封掉了一批很可能来自中国的 ChatGPT 账号。这批人用简体中文写提示词,让 ChatGPT 生成英文帖子和图片,在 X 上假装成各种背景的普通美国人,反复说数据中心和 AI 把电费拉高了,成本最后都摊到老百姓头上。他们还用 ChatGPT 修图、写自动化脚本,并骚扰海外异见人士。更值得留意的是,他们上传的...

推荐理由:OpenAI 的官方威胁报告,不是第三方猜测,可信度先打个底。披露的这套玩法——简体中文提示词转英文内容、批量伪装账号、专挑电费这种民生痛点反复说——把 AI 怎么被武器化做舆论影响讲得很实,对从业者来说既是安全警示,也踩中了行业正在面对的公众质疑。信息量够,冲击力强,直接给 featured。

5月31日星期日

r/LocalLLaMA

不用改代码,让 OpenAI Codex 桌面客户端接任意模型和供应商

Reddit 用户 thibautrey 分享了一个三步走的方法:编辑 Codex Desktop 的 config.toml 配置文件,存好 API 密钥,再用一个叫 multicodex 的代理别名把 gpt-5.3-codex 这个模型名映射到 MiniMax-Latest。代理跑在本地 127.0.0.1:1455,会把返回的模型名伪装成 gp...

推荐理由:这是一条可复现的开发者操作流,不是官方发布。我会先打个折:正文没披露 MiniMax-Latest 的具体成本和延迟,也没说 proxy 稳定性如何,所以别急着在生产环境照搬。但 hook 很直接——不改代码就能在 Codex 桌面端用别的模型,配置细节也够落地,对想省钱或换模型的人有实际参考价值。

AI HOT 精选

Simon Willison 把 Python 网页应用直接跑在了浏览器里,不再需要后端服务器

Simon Willison 用 Pyodide(把 Python 编译成浏览器能跑的 WebAssembly)加上 Service Worker,让 Python 的 ASGI 网页应用完全在浏览器里运行。他让 Claude Opus 4.8 帮忙写了代码,做了两个能用的演示:一个基础 FastAPI 例子,另一个是他自己的 Datasette 1....

推荐理由:Simon Willison 用 Claude Opus 4.8 辅助开发,把 Python ASGI 应用搬进了浏览器,已经跑通了 Datasette 的演示。这件事的钩子在于:浏览器不再只是前端沙箱,可以直接当应用服务器用。技术栈交代得清楚,Pyodide、Service Worker、ASGI FastCGI 每一步都有据可查,不是概念图而是能跑的代码。我会先打个折,这目前还是个开发者实验,离生产环境还有距离,但思路对无服务器和边缘部署的人有启发。

AI HOT 精选

GitHub Copilot 改按 token 收费,开发者直接骂“开玩笑吧”

GitHub Copilot 把计费方式从订阅制改成了按 token 算钱,开发者社区炸了。token 就是模型处理文本的最小单位,用多少收多少,但正文没披露具体单价、生效时间,也没说免费额度还在不在。我会先打个折——如果单价定得高,写代码时每补一行都可能肉疼,这对重度用户影响不小。

推荐理由:HKR 三项都踩中了:计费模式切换本身是实打实的机制变化,开发者骂“开玩笑吧”自带冲突感,而按 token 收费直接关系到每个用 Copilot 写代码的人的钱包。我会先打个折——正文没给价格、token 单价和生效时间,这些关键信息全是缺口,所以重要性只能停在 75 这一档。对从业者来说,这条消息值得看一眼,但别急着算账,等官方把数字放出来再说。