跳到正文

#编码

今日 10 条

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

机器之心 · 公众号

百亿公司 CTO 们集体跳去 Anthropic 当一线工程师

机器之心这篇文章本来想盘点 2025 年 1 月到 2026 年 4 月间,至少六位从 Workday、You.com、Box、Super.com、Adept AI 等公司离职加入 Anthropic 做个人贡献者(IC)的前 CTO,但微信页面被环境异常拦截,正文内容完全看不到。从已有的英文摘要看,核心讨论点不是“为了 AGI 理想”,而是职业杠杆—...

推荐理由:这篇不是产品发布或模型更新,是篇评论,但切入点很巧。它没停留在“为了 AGI 理想”这种公关叙事,而是把重点放在职业杠杆上:当 CTO 不如在 Anthropic 当工程师划算,说明顶级 AI 公司里技术执行者的议价权在涨。我会先打个折,因为正文没给出这些 CTO 具体负责什么、薪资怎么变,但 6 个案例摆在那,趋势信号是清晰的。

新智元 · 公众号

Claude Code 让 Anthropic 两个月收入翻倍,成史上增长最快的 AI 公司

Semi Analysis 的报告说,Anthropic 的年化收入(ARR)已经冲到 440 亿美元,过去 12 个月净增了 350 亿。其中 Claude Code 这个编程助手到 2026 年 2 月,自己就贡献了 25 亿美元的年化收入。推理毛利率也从 38% 涨到了 70% 以上。不过正文因为微信环境异常没抓到具体内容,这些数字背后的客户留存...

推荐理由:我会先打个折——Semi Analysis 的数据不是官方财报,但 440 亿 ARR 和 70% 推理毛利率这两个数如果属实,说明 Anthropic 靠 Claude Code 在企业端收钱的速度比外界想的快得多。文章真正值得盯的不是总盘子有多大,而是三个东西能不能同时成立:企业用量在涨、代码智能体收入在涨、推理毛利也在涨。正文没披露 Claude Code 的客户留存和续费率,这点先别太激动。

r/LocalLLaMA

Reddit 网友用纯 C++17 手搓了一个 83 万参数的 Transformer,不用 PyTorch 也不用 BLAS,单核 CPU 训练 76 分钟

一个叫 Suspicious_Gap1121 的 Reddit 用户放出了 Quadtrix.cpp,一个用 C++17 从零写的 GPT 风格模型,总共 83 万参数。模型结构是 4 层、4 个注意力头、宽度 200 维,一次能看 128 个字符的上下文。他在单核 CPU 上拿 3140 万个字符训练了 76.2 分钟,验证损失降到 1.6371 n...

推荐理由:我会先打个折:这就是个个人练手项目,0.83M 参数离实用还远,别拿它跟正经模型比性能。但它的看点不在规模,而在把整个训练管线——LayerNorm、attention、Q/K/V、dropout、AdamW——全部手写反传,不用自动微分,不用 BLAS 加速,单核 CPU 跑通。正文没披露生成效果,也没给权重文件,所以只能当教学级实现来看。对 AI 从业者来说,这东西像一份可运行的底层教案,把平时被框架藏起来的细节全摊开了。

5月2日星期六

量子位 · 公众号

苹果官方 App 把 Claude.md 打包进去了,大公司也搞 Vibe Coding?

苹果支持 App 的 5.13 版本在 5 月 1 日上线时,不小心把一个叫 Claude.md 的文件打进了安装包,不到 24 小时就被下架了。这个文件描述了 Juno AI 和人工客服之间怎么通过一个协议层来切换,客户端、AI 助手、人工客服的消息都在同一个流程里处理。正文没披露这个文件到底是怎么跑进正式版本的,但问题核心出在发布审核环节。

推荐理由:HKR 三项都踩中了,但这说到底还是个 App 打包事故,不是模型或平台发布。苹果的体量加上 Claude.md 的细节够得上 featured;正文没披露审查链哪里断了,这点先别太激动。

TechCrunch · AI

Replit 创始人聊 Cursor 收购传闻、跟苹果较劲,以及他为什么不想卖公司

Replit 的 CEO Amjad Masad 在 StrictlyVC 活动上回应了几个尖锐问题。首先是竞争对手 Cursor 被传要以 600 亿美元卖给 SpaceX,他怎么看。Masad 没直接评价这个价格,但明确表示自己不想卖 Replit,更想独立发展。文章还提到 Replit 的收入从 2024 年全年的 280 万美元,猛增到现在年化...

推荐理由:TechCrunch 这篇截出来的部分,核心钩子是 Cursor 的 600 亿美元收购传闻和 Masad 的不卖表态,反差够强。信息增量上,Replit 从 280 万到十亿年化目标的跨度、Cursor 的天价传闻,都是圈内会盯着看的数字。不过正文没展开 Masad 对 Apple 争议和出售意向的完整说法,所以重要性我打个折,放在 72–77 这个区间。

5月1日星期五

r/LocalLLaMA

PFlash:在 RTX 3090 上跑 128K 上下文,预填充比 llama.cpp 快 10 倍

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时,首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”,挑出最重要的 5% 文本片段喂给大模型,省掉了大量无关计算。整个方案用 ...

推荐理由:HKR 三项都踩中了,但这是单条 Reddit 帖子,质量验证只给了单针 NIAH 32K–128K 全通过,RULER 和多针结果没放出来,所以先放在 featured 门槛上。

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

新智元 · 公众号

OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手

OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...

推荐理由:HKR 三条全中。OpenAI Codex 这次不是补代码,是直接上手操作 Mac,集成 Slack、Google Workspace 和 Microsoft 365,等于把 agent 塞进日常办公软件里。Mike Russell 的实测给了具体数字:8 分钟跑完音频修复、Photoshop 封面和 Firefly 视频生成,效果 85—90 分,虽然只有单信源,但 OS-agent 这个方向本身就够重,P1 没毛病。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

4月30日星期四

r/LocalLLaMA

有人把计算器塞进了 Transformer 权重里

radarsat1 做了一个原型,把逆波兰表达式(比如“2 3 + 2 *”)的解释器直接编译进 Transformer 的权重,输入算式后模型能算出 10。做法是把残差流当寄存器用,注意力权重由编译器算好,非线性的 MLP 逻辑还是靠训练。原型体积 1.1 GB,重点不是实用计算器,而是证明了注意力权重可以完全通过计算得出,不用训练。帖子正文没披露具...

推荐理由:我会先打个折:这不是一个实用计算器,1.1 GB 的体积已经说明它不图省资源。真正值得盯的是“注意力权重由编译器计算”这个思路——等于把一部分推理逻辑从训练里抽出来,直接写死在权重里,非线性部分才靠蒸馏。这点先别太激动,正文没披露蒸馏用了多少样本、MLP 层到底学到了什么,验证还很弱。但标题够反直觉,做法也干净,给可解释性方向递了一个新玩具,所以放在 featured 档刚好。

The Verge · AI

OpenAI 解释为什么它的代码模型突然满嘴地精和哥布林

Wired 发现 OpenAI 的代码模型 Codex 会主动建议用户“避开哥布林”之类的奇幻生物,OpenAI 现在出来回应了。他们说,GPT-5.1 新增的“书呆子”人格喜欢用奇幻生物打比方,结果这个习惯传染给了其他模型。至于具体怎么修、修到什么程度,这篇声明里没细说。

推荐理由:这条新闻的钩子很足——一条禁止模型提“地精”的内部指令被扒出来,本身就够离谱。知识增量在于 OpenAI 没糊弄过去,而是点名了 GPT-5.1 的 Nerdy 人格是起点,后续模型把生物隐喻越玩越花,这比单纯说“有个 bug”要具体。对从业者来说,隐藏的系统提示直接影响编程模型的输出可控性,而正文没披露完整修法,这点先别太激动,所以放在低分 featured 档刚好。

Ben's Bites

搭东西变简单了:Cloudflare 让 AI 能自己买域名部署,Stripe 给 AI 发了钱包

Ben 这期聊的是工具链在变,他最近迷上了 Codex 应用,用自然语言指挥 AI 写了个恐龙跳跳游戏、搭了套 Gmail 自动分类系统。重点在后面的产品更新:Cloudflare 现在允许 AI 代理自己创建账户、买域名、拿 API 令牌并部署,人只需要最后点个头,中间那些繁琐的后台配置被包装成了 AI 能读懂的接口。Stripe 在 Session...

推荐理由:这是一篇产品线索汇总,不是单一重磅发布,但 Cloudflare 和 Stripe 把代理权限落到了开户、支付、部署这些硬环节上,我会先打个折放在 featured 低段。正文没披露具体延迟或成本数字,如果是真的,代理跑通账号和支付流程确实省钱省事,但权限敞口也大,这点先别太激动。

r/LocalLLaMA

实测:本地跑 Qwen-3.6-27B 跟闭源模型比,到底差多少

作者拿一个自动研究循环任务测了 5 个模型,只有 Qwen-3.6-27B 接近完成。本地用 q4_k_m 量化版跑了约 8 小时,消耗 3.9 万 token(上限 4.5 万);作为对比,全精度 Qwen 通过 OpenRouter 调用用了 440 万 token,花费 0.939 美元。关键看失败质量:两个 Qwen 版本都只差小修小补,而 G...

推荐理由:这篇帖子用一个自动研究任务把 Qwen-3.6-27B 和几个闭源模型放在一起比,结果只有 Qwen 基本完成,其他模型要么缺测试要么缺实现,对比很直观。数据也给了:本地量化版跑了约 8 小时,读 39k 写 45k tokens;全精度版消耗 4.4M tokens,花了 0.939 美元。失败质量比成功更值得看,两种 Qwen 都只需少量修复就能用。来源是单篇 Reddit 实测,权威性有限,所以放在 featured 低位,但 hook、数据和话题性都够。

r/LocalLLaMA

实测:用小模型跑编程 agent,哪些环节会崩

作者花了几周时间,用 7B 以下的本地小模型和免费云端模型跑多文件编程任务,发现结构化输出很不靠谱。崩得最多的地方有三个:模型在回复里乱加 markdown 代码块标记,把编辑内容写到错误的文件里,以及分不清该读文件还是写文件。作者给的解法是做后处理清洗和加校验步骤,但正文没披露具体用哪些模型、测试了多少任务,也没给出量化的成功率,所以这些结论只能当经...

推荐理由:这篇 Reddit 帖子不是论文,是作者拿 Qwen、Gemma 等小模型实打实跑了几周多文件编程 agent 后的踩坑记录。我会先打个折:它只是单人经验,没有系统对比实验,所以给 75 分。但内容很实在——7B 以下模型连输出格式都稳不住,Markdown 围栏乱加、改错文件、读写成写这类问题反复出现。作者没灌水,直接给了后处理、JSON schema 校验、路径白名单和只读路由这些能落地的补救办法。正文没披露具体模型版本和测试任务量,这点让结论的普适性弱一些,但对想用本地模型搭 coding agent 的人,这些失败模式比 benchmark...

新智元 · 公众号

陶哲轩说数学界从缺证明变成证明太多,AI 生成的“生肉证明”堆满 GitHub

陶哲轩最近公开说,数学研究的瓶颈已经从“找不到证明”变成了“证明太多看不过来”。在一个关于 Erdős 问题的 GitHub 页面上,已经有 20 多个 AI 生成的解法等着人去评估。文章提到 GPT-5.4 Pro 用 80 分钟就给出了 Erdős #1196 的一个思路,陶哲轩自己在 24 小时内验证了核心部分。现在真正头疼的不是 AI 能不能解...

推荐理由:这篇东西不是模型发布,但把陶哲轩的发言和 GitHub 上的 AI 证明积压摆在一起,信息量够硬。我会先打个折,因为正文没给出那 20 多份解法的具体通过率或质量分布,只能看到数量堆上去了。真正值得盯的是陶哲轩说的验证与消化工作流——证明便宜了,判断力反而更贵,这个转向对从业者比裸看模型跑分更有参考价值。

机器之心 · 公众号

Alec Radford 用只学到 1930 年的模型,接下了哈萨比斯的 AGI 考题

Alec Radford 团队训了一个 13B 的模型,训练数据全是 1931 年之前的英文文本,总共 2600 亿 token。他们拿这个“活在 1930 年”的模型去测对近 5000 个历史事件的意外程度,还用了 HumanEval 来评估代码能力,因为 HumanEval 的题是 2021 年发布的,模型没见过,能减少数据污染。核心发现是时间泄漏...

推荐理由:我会先打个折:正文没披露模型架构细节和训练成本,这点先别太激动。但选题本身很聪明——用1930年知识截止做对照实验,比单纯刷榜有意思。13B模型对战后事件有模糊感知,说明数据清洗再严格也挡不住泄漏,这对做安全对齐和评测的人是个实在提醒。2600亿token、近5000条事件测试这些数字让结论有分量,不是空对空。整体是扎实的研究发布,不是模型或平台上线,82分合理。

Latent Space

推理算力到了爆发点:CPU 不够用,GPU 也在被拆着用

Latent Space 这期把近期几条线索串了起来:AI 的推理(inference)需求正在急剧膨胀。黄仁勋在 GTC 上说,过去两年单次任务的算力消耗涨了约 1 万倍,总用量涨了约 100 倍,他管这叫“推理拐点”。英特尔 CEO 在财报会上给了更具体的数字,CPU 需求在涨,不是因为训练,而是因为代码智能体、强化学习环境模拟这些推理侧的工作全压...

推荐理由:这是一篇 Latent Space 的新闻汇总和趋势判断,不是模型发布或重大产品更新。它把黄仁勋的预测和 CPU 沙箱、智能体调度这些实际工作负载拆解放在一起,对从业者有参考价值,但信息密度和独家性不如一手发布。我会先打个折,放在 featured 里偏评论解读的位置。

r/LocalLLaMA

inclusionAI 在 Hugging Face 开源了 Ling-2.6-1T,一个 1 万亿参数的模型

这个模型用了 MLA 和线性注意力,还加了一个叫“上下文过程冗余抑制”的技术,目的是降低思维链推理时的计算开销。帖子提到了 AIME26 和 SWE-bench Verified 两个基准,但正文没披露具体分数,所以实际表现还不清楚。另外,Reddit 原帖被网络屏蔽了,目前只能看到标题和简介,更多细节得去 Hugging Face 模型页翻。

推荐理由:我会先打个折:正文只提了覆盖 AIME26、SWE-bench Verified 等基准,但没给具体分数,所以模型到底多强现在说不准。能上 featured 是因为万亿参数开源本身就有信号意义,加上 MLA+Linear Attention 和 CPRS 这两个技术点,对做推理优化的人有参考价值。没给分这件事让它到不了 P1,但架构信息和开源动作足够让圈内人留意。

4月29日星期三

X · @dotey(宝玉)

OpenAI 把 GPT-5.5、Codex 和托管智能体搬上 AWS Bedrock,限量预览已开

OpenAI 和 AWS 扩大了合作,现在企业可以在 Amazon Bedrock 上直接调用 GPT-5.5、Codex 编程工具和托管智能体。以前用 OpenAI 基本只能走 Azure,重仓 AWS 的公司要么迁移要么放弃,现在这个障碍没了。企业能在自己熟悉的 AWS 环境里复用安全策略、合规和账单体系,Codex 的费用还能算进 AWS 的云消...

推荐理由:这条不是普通的云合作公告。OpenAI 把 GPT-5.5 和 Codex 放到 AWS Bedrock 上,等于在 Azure 之外开了第二条企业通道,而且直接绑定了 AWS 的合规和计费体系。Codex 周活 400 万说明开发者端已经有量,现在企业采购可以走 AWS 的消费承诺,省事也省钱。限量预览阶段,实际可用性和延迟还没公开,这点先别太激动,但方向本身值得当天就关注。

X · @dotey(宝玉)

AI 终端 Warp 把客户端代码开源了,OpenAI 是创始赞助商

Warp 是一个用 Rust 写的现代终端,有超过 70 万开发者用,核心卖点是把 AI 塞进命令行,你用自然语言说想干嘛,它帮你生成命令。这次开源的是客户端代码,走 AGPL 协议,服务端还是闭源的。比较特别的是他们的社区贡献流程:Warp 自家的云端 AI 平台 Oz 负责写代码、做规划、跑测试,人主要负责提想法和验证,等于在跑一个“人管方向、AI...

推荐理由:Warp 这次开源的是客户端代码,走 AGPL 协议,服务端没动,所以别理解成整个产品都开源了。OpenAI 当创始赞助商是个信号,但正文没展开双方具体怎么合作。真正有意思的是他们提的“人管方向、AI 干活”的贡献流程,不过目前还只是说法,没看到跑起来的例子。70 万开发者的数字说明用户盘子不小,Rust 重构也加分。整体是条扎实的开发者工具动态,不是模型或能力层的重大发布。

4月28日星期二

Ben's Bites

GPT-5.5 来了,价格翻倍但号称省 token,Cursor 跟 SpaceX 搞了个大单

OpenAI 发了 GPT-5.5,比上一代贵了一倍,单 token 价格甚至略高于 Claude Opus 4.7。但他们说新模型 token 效率提升了 40%,所以实际跑一个任务的成本没怎么变,Ramp 的测试也印证了这点。Ben 自己用下来觉得模型在“思考:低”模式下又快又聪明,已经把它设成默认了。另外 Claude 的托管代理记忆功能开始公测...

推荐理由:这是一篇通讯汇总,不是一手发布,所以分数不会顶到 95 以上。但三条消息都够硬:GPT-5.5 的定价和效率数字能让人直接算账,Claude 记忆功能公测意味着外挂记忆开始进生产流程,Cursor 的收购选择权更是把编程工具的价值拉到一个新量级。我会先打个折,因为正文没展开技术细节,比如 40% 效率提升是在什么场景下测的、记忆功能有没有延迟数据,这些缺口让信息停留在“值得关注”而不是“可以立刻决策”的层面。整体对 AI 从业者来说,信息密度高、不水,给 89 分合理。

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

Hacker News 首页

小米开源 MiMo-V2.5-Pro,写代码的跑分紧挨着 Claude Opus 4.6

小米把 MiMo-V2.5-Pro 的模型权重放出来了。标题说它的编程能力在跑分上和 Claude Opus 4.6 差不多,文章举了个例子:北大计算机系的编译器大作业,学生通常要花几周,这个模型 4.3 小时跑完,233 个隐藏测试全过。V2.5-Pro 相比之前的 Flash 版,主要提升了长任务连贯性、能处理超过一千步的复杂任务,以及让模型进业务...

推荐理由:HKR 三项都通过,因为小米发编程/Agent 权重本身是实打实的动作,从业者会想看一眼。但信息缺口很大:没参数、没许可、没具体分数,只有标题说表现突出,所以我会先打个折,重要性停在 74 分 featured 门槛附近。

The Verge · AI

AI 开始批量找漏洞,脚本小子要失业了?

The Verge 这篇讲的是 Claude 的一个安全测试版 Mythos 在 DARPA 的 AI 网络挑战赛里扫了 5400 万行代码。参赛队伍用它不仅找出了大部分预先埋好的漏洞,还额外揪出十几个没埋过的真实 bug。文章没提 Mythos 的跑分、收费方式和怎么申请试用,所以实际效果和成本还得观望。

推荐理由:这篇值得推,因为 DARPA 比赛的数据很实在——5400 万行代码扫下来,工具不仅认出了人工漏洞,还额外揪出十几个没埋的,说明 AI 挖洞确实能跑出意料之外的结果。标题的“脚本小子”说法虽然夸张,但把门槛降低这个风险讲透了。正文没给 Claude Mythos 的基准、价格或开放条件,所以没法判断它到底多强、多贵,这点先别太激动。整体信息量够上推荐位。

Hacker News 首页

GitHub Copilot 的代码审查功能将从 2026 年 6 月 1 日起消耗 Actions 分钟数

GitHub 发了条计费变更通知:从 2026 年 6 月 1 日起,Copilot 的代码审查功能会开始消耗你账户里的 GitHub Actions 分钟数。以前这个功能只算在 Copilot 自己的额度里,现在等于要双重计费——Copilot 那边按新出的 AI 点数算,跑审查任务本身还要再吃一份 Actions 的时长。私有仓库会先从你套餐里包含...

推荐理由:这是 GitHub 官方对 Copilot 代码审查的计费规则调整,把审查消耗从隐形变成显性,直接打到 CI 配额和团队发票上。HKR 三项都满足,但它本质是定价规则而非新能力发布,所以重要性放在 72–77 这个区间。

新智元 · 公众号

Claude 封了 110 人的公司账号,Cursor 里 9 秒删光生产数据库

一家 110 人的美国农业科技公司被 Anthropic 一口气封了所有 Claude 账号,但 API 扣费还在继续,申诉 36 小时没人理。另一边,PocketOS 的人说,在 Cursor 里用 Claude Opus 4.6 时,AI 在 9 秒内删掉了生产数据库和全量备份。问题出在权限控制上:没有基于角色的访问控制,没有环境隔离,也没有删除确...

推荐理由:HKR三项全中:事件钩子够尖锐,有具体数字和权限缺失细节,对AI从业者来说就是现成的风险清单。分数保持82,因为目前只有单方爆料,Anthropic还没出事后分析,事实全貌还不清楚。

X · @op7418(歸藏)

小米把 MiMo-V2.5 系列模型全开源了,MIT 协议,随便商用和魔改

小米这次放出的 MiMo-V2.5 系列模型用了 MIT 开源协议,你可以直接拿来商用、做二次训练和微调,不用再额外申请授权。正文没披露模型参数量和跑分成绩,这点先别太激动。同时他们还搞了个 Orbit 100T Token 计划,分两块:一块是给 AI builder 的激励,申请通过最高能拿到 16 亿 Credits,价值 659 元;另一块是给...

推荐理由:这条消息对 AI builder 有实际价值:MIT 协议意味着可以放心商用和微调,Orbit 计划给的 Credits 额度不小,659 元的标价也算低。但我会先打个折——正文完全没提模型参数量、性能跑分,连基础尺寸都不知道,没法判断模型本身强不强。这点先别太激动,等评测出来再看。整体属于有料但缺关键验证,放在 featured 合适。

r/LocalLLaMA

本地跑代码模型终于能干活了:27B 模型在 Terminal-Bench 2.0 上拿了 38.2%,落后云端前沿模型约 6-8 个月

Antigma 用一套 agent 流程测了多个 27B–32B 的开源模型,跑的是 Terminal-Bench 2.0 的 89 个任务,用的是官方默认超时设置,没放宽条件。成绩最好的是 Qwen 3.6-27B,89 题做对 34 题,得分 38.2%。这个分数本身不算高,现在云端最强的模型能到 80% 左右。但有意思的是时间差:把 38.2% ...

推荐理由:我会先打个折:这是单篇 Reddit 帖子,不是论文,测试细节和复现条件正文没展开。但它的判断很实在——本地小模型跑代码已经跨过“能用”的门槛,不是遥遥领先,而是落后托管前沿 6–8 个月,这个定位比单纯报分有用。38.2% 的分数本身不高,但放在 89 个终端任务里,说明日常写脚本、调配置这类活它能接住一部分。对想离线部署、省 API 钱的团队,这个信号值得跟。

Hacker News 首页

Claude Pro 用户想在 Claude Code 里用 Opus 模型,得先开通并购买额外用量

Anthropic 的官方帮助文档列出了 Claude Code 支持的 6 个模型,从 Opus 4.7 到 Haiku 4.5。关键限制是:Pro 订阅用户不能直接调用 Opus 系列,必须先去设置里开启“额外用量”并完成购买才能用。文档给了三种切换模型的方法:在对话里直接敲 /model 选、启动时加 --model 参数、或者把 ANTHROP...

推荐理由:这条来自帮助文档,讲的是 Claude Code 的模型访问和配置方式,不是新模型或重大能力发布。Anthropic 的相关性把它拉到了 featured 低位。

X · @dotey(宝玉)

西方忘了怎么造东西,现在也快忘了怎么写代码

作者拿国防工业的教训来比软件行业:美国重启毒刺导弹生产线要4年,因为会造的人早退休了,图纸还是卡特时代的;欧洲承诺100万发炮弹,晚了9个月才凑齐,因为发射药停产17年、TNT只剩一家厂。核心不是没钱,是知识断了。软件业现在也在走这条路——METR的对照实验发现,资深开发者用AI写代码反而慢了19%,但很多人已经离不开AI。Salesforce今年不招...

推荐理由:标题类比够尖锐,正文用军工交付延迟和 METR 的 19% 降速给了硬数字,最后把焦点从 AI 速度拉回到人才断层,对 AI 从业者来说比单纯吹或黑 AI 编程更有讨论价值。因为是转译加评论,权威性打折扣,但信息量和话题度都够,放在 featured 里合适。

X · @dotey(宝玉)

GitHub Copilot 6 月 1 日起改按用量计费,重度用户账单会变不确定

GitHub Copilot 从 6 月 1 日起取消“高级请求次数”,换成 AI 积分(AI Credits),按输入、输出和缓存的 Token 消耗来扣费。各档订阅价格没变,Pro 每月给 10 美元积分,Pro+ 给 39 美元,但积分花完就没了,不再像以前那样能降级到便宜模型继续用。代码补全和“下一步编辑建议”这类基础功能不消耗积分。企业用户 ...

推荐理由:这条消息对用 Copilot 写代码的人影响很直接:订阅价没涨,但计费逻辑从包月变成了按 Token 消耗扣积分。Pro 每月给 10 美元额度,Pro+ 给 39 美元,超出部分怎么收费正文没写,这是个信息缺口。最该盯的是 Copilot Agent 跑长任务的消耗——这类任务 Token 用量大,账单可能跳涨,但具体费率还没公布,先别急着算账。整体判断挂在成本变化和缺失的费率信息上,分数维持 80 合理。

X · @dotey(宝玉)

Cursor 3 用户反馈:别光顾着炫,先把 Agent 和 IDE 无缝焊在一起

Eric Zakariasson 的 Cursor 3 反馈帖收到 431 条回复,核心诉求不是更花哨的界面,而是一个稳定可靠的 AI 开发工作台。用户最强烈的意见是:Agent Window 不能牺牲 IDE 基本能力,进去之后 LSP、调试、终端、diff 操作经常要切回旧界面,理想状态是 Agent 推进工作,人随时能无缝接管。多 Agent 和...

推荐理由:三条都过:431 条回复量够大,需求提得具体,而且正好打在开发者对 AI 工作台的焦虑点上。放在 featured 低段是因为这是用户反馈汇总,不是 Cursor 官方发布或路线图,信息增量有但权威性打折。

Hacker News 首页

GitHub Copilot 要从固定月费改成按用量计费了

GitHub 在 2026 年 4 月 27 日发了篇博文,标题就是 Copilot 要转向按用量计费。但正文只抓到了标题、发布时间和一堆导航栏,具体怎么个“按用量”法——比如按什么指标算钱、单价多少、有没有免费额度、超额怎么收费——全都没披露。所以现在只能知道计费模式要变,细节一概不清楚,先别急着算账。

推荐理由:Copilot 改按量计费,对用它的团队来说,账单结构变了,得重新算账。我会先打个折——正文只给了标题和时间,没写什么时候生效、按什么单位算钱、单价多少、超额怎么收,这些才是采购真正要盯的。所以这条消息的钩子在于提醒大家盯用量口径,而不是现在就能做决策。

4月27日星期一

Dwarkesh Patel 播客

周末杂想:算力垄断、智能与权力的混淆,以及科学验证的困境

Dwarkesh 抛出了一堆他没想明白的 AI 问题。首先是算力分配:全球超过 70% 的 AI 算力握在五家云厂商手里,其中大部分还优先供给了 OpenAI、Anthropic 和 Google DeepMind 三家。他担心普通人会被高价挤出 AI 红利,并追问全民基本算力该怎么搞。其次是模型进步的本质,他搞不清长周期编程智能体到底靠什么突破,也质...

推荐理由:Dwarkesh这期没给实验结论,就是扔了一串开放问题。我会先打个折,因为正文没披露五家厂商占七成算力的数据来源,这点先别太激动。但他把长程编码Agent、KV缓存内存取舍、训练和推理合并这些技术点揉在一起问,确实让人想接着翻答案。真正值得盯的是算力怎么分、模型能不能在线学、以及‘智能’和‘权力’的定义怎么重新划——这些比论文摘要更贴近一线焦虑。没有产品发布或政策变动,所以分数停在评论类的中上区间。

Hacker News 首页

在万米高空断网跑大模型:M5 Max 撑了 10 小时,但一根充电线让我亏了 34W 供电

作者在伦敦飞拉斯维加斯的 10 小时航班上,用一台顶配 MacBook Pro M5 Max(128GB 统一内存、40 核 GPU)离线跑了 Gemma 4 31B 和 Qwen 4.6 36B 两个本地模型。他主要用 DuckDB 搭了个云账单分析工具,还处理了约 400 万 token 的零散编码任务。体验下来,写限定范围的代码、做小工具时,本地...

推荐理由:这是一篇第一人称的本地推理实测,硬件、模型、功耗数字都摆出来了,不是空谈。我会先打个折:它更像个人体验报告,不是行业级发现,所以分数落在 72–77 这个区间。真正有意思的是功耗可观测性——同一负载下 iPhone 线只供 60W,MacBook 线供 94W,差了 34W,这点先别太激动,但说明供电配件对本地跑大模型的实际性能影响不小。正文没披露模型量化方式,也没说具体跑了什么任务,所以不能把结论拔太高。

Hacker News 首页

Dirac 这个开源编程助手在 TerminalBench 上拿了第一,靠的是省 token 和并行操作

Dirac 是一个专门抠上下文效率的编程助手,刚在 TerminalBench 上跑分拿了第一,用的模型是 Gemini-3-flash-preview。它说自己能把 API 调用成本压到其他同类工具的 20% 到 50%,主要靠三招:用哈希锚点来精准定位代码修改位置、把能并行的操作全并行跑、直接操作抽象语法树而不是整段重写。不过正文没披露 Termi...

推荐理由:HKR 三项都站得住:一个开源编程智能体声称在 TerminalBench 上拿了第一,还给出了具体模型和成本降幅,技术细节也没藏着。不过分数我压到 78,因为目前只有仓库自述,完整榜单分数和复现日志都没放出来,先别太激动。

Hacker News 首页

现在用 AI 可能比雇人还贵

Axios 报道,一些公司的 AI 算力开销已经超过了员工工资。英伟达高管 Bryan Catanzaro 说,他团队的算力成本远高于人力成本;Uber 的 CTO 则因为 token 消耗太快,已经花光了 2026 全年的 AI 预算。Gartner 预测今年全球 IT 支出会涨到 6.31 万亿美元,主要就是被 AI 基建、软件和云服务推高的。文章...

推荐理由:这篇文章把 AI 成本焦虑变成了预算事实。Nvidia 内部团队算力开销远超人力、Uber CTO 的 token 预算提前见底,加上 Gartner 的支出预测,都在说同一件事:AI 的账单开始比工资单更吓人。它不是产品发布或硬新闻,而是趋势报道,所以放在 72–77 这个区间。我会先打个折,因为正文没给出 Nvidia 和 Uber 的具体金额对比,但方向性判断足够清晰,值得从业者看一眼自己的预算表。