跳到正文

#编码

今日 10 条

5月13日星期三

量子位 · 公众号

百度发布秒哒3.0,8岁小孩也能把想法变成手机App

百度在2026 Create大会上推出了秒哒3.0,一个无代码开发平台。这次更新直接支持生成iOS和安卓App,还能打包成安卓安装包、在线热更新。企业版加了三级权限、环境隔离和服务等级协议。现场演示里,一个8岁小学生用语音说了几个想法,平台就自动生成了一个完整应用。不过正文没披露这个演示App的实际复杂度和后续维护成本,也没说生成代码的质量和可维护性怎么样。

推荐理由:秒哒3.0这次主要把应用生成从网页端扩展到了iOS和Android,还加了安卓打包和热更新,等于让不会写代码的人也能直接出手机应用。企业版给了三级权限和SLA,明显在往团队和公司场景推。我会先打个折:标题里“8岁小学生”的案例正文没给出具体细节,不知道是完整可用应用还是简单页面,这点先别太激动。整体是产品功能更新,不是底层模型换代,但移动端生成和打包能力对低代码赛道有实际推进。

r/LocalLLaMA

小米把 1 万亿参数的 MiMo-V2.5-Pro 开源了,但自己跑真的划算吗?

小米放出了 MiMo-V2.5-Pro,参数总量 1.02 万亿,但每次推理只激活 420 亿参数,上下文窗口能塞进 100 万个 token,用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务,走 API 总共花了 70.12 美元,处理了约 3.87 亿个 token,缓存命中率高达 96.3%。这个命中率说明大部分请求其实...

推荐理由:我会先打个折:正文没披露 MiMo-V2.5-Pro 的评测跑分,所以性能好坏只能靠参数规模猜。但这条信息本身够直接——小米把一个 1.02 万亿参数、42B 激活的模型开源,另一边作者用 Claude Code 跑了 125 次会话,3.87 亿 token 花了 70.12 美元,缓存命中率 96.3%。这两组数字摆在一起,自建成本和 API 开销的对比就出来了。对做工程的人,这种一手成本数据比技术报告更有参考价值。

纽约时报中文网

中国智库向Anthropic要Mythos模型被拒,美方视作AI竞赛升级信号

上个月在新加坡一场非官方对话中,一家中国智库要求Anthropic向北京开放其最新的Mythos模型,被直接拒绝。Mythos是个擅长找软件漏洞的模型,Anthropic目前只给美国政府和40多家机构用,理由是怕引发网络安全危机。美方官员认为这次接触虽非正式外交,但背后大概率有中国政府授意,并把它看作中美AI竞赛升温的又一个迹象。文章提到,美国最新模型...

推荐理由:这条消息我会先打个折:正文没披露中国智库具体是哪家、怎么谈的、Anthropic 拒绝的细节也没展开。但核心信息够硬——Mythos 是个找漏洞的模型,Anthropic 只给美国政府和 40 多个组织用,中国想要但拿不到。这比一般的模型封锁更敏感,因为直接关系到软件供应链安全。对从业者来说,说明顶尖漏洞挖掘能力正在变成国家级的受控资源,以后这类模型可能越来越难公开拿到。

AI HOT 精选

Claude Code 加了个 /goal 指令,让模型自己跑到任务做完

Claude Code 新上线了 /goal 功能,你下完指令后 Claude 会持续干活直到任务完成,不用人在旁边盯着。帖子没写这个功能怎么触发、哪些版本能用、要不要额外付费,也没提任务卡住或跑偏时怎么处理。

推荐理由:HKR 三项都过,因为 /goal 解决的是 Claude Code 用户常遇到的 agent 中途停摆问题。这只是 Anthropic 单功能更新,细节披露不多,所以放在 featured 低位,不算当天重磅消息。

r/LocalLLaMA

有人把 Transformer 语言模型塞进了原装 Game Boy Color 里跑

maddiedreese 把 Andrej Karpathy 的 TinyStories-260K 模型成功跑在了一台没改过硬件的 Game Boy Color 上。他用 INT8 量化权重、定点数运算,把模型和 KV 缓存塞进 MBC5 卡带的 bank-switched ROM 和 SRAM 里,全程不靠手机、电脑、Wi-Fi 或云端推理。不过输出...

推荐理由:一个 Reddit 硬件 hack,把 TinyStories-260K 塞进原装 Game Boy Color,用 INT8 和定点数学跑推理,KV cache 放在卡带 SRAM 里。输出慢到没法用,而且基本是乱码,所以别当产品看。但能在这种老设备上把 transformer 跑起来,本身就挺酷,技术细节也给得实在,适合当一条有趣的行业花絮。

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。

AI HOT 精选

OpenAI 演示 Codex 在 Mac 上跨应用后台干活,不用占着你的电脑

OpenAI 开发者账号发了一段演示,Codex 能跨 Mac 应用点击、输入、在后台持续执行任务,不会锁住你的鼠标键盘。视频里 @AriX 和 @romainhuet 聊了这种代理能干的事,但正文没披露发布时间、权限怎么设计、以及这次开放给哪些用户。

推荐理由:我会先打个折:正文只有一段演示描述,没给发布时间、权限模型、可用范围,所以重要性停在 76 分。钩子很直接——Codex 能在 Mac 后台帮你跨应用点按钮、填文字,听着像本地 RPA 但由模型驱动。这点先别太激动,因为没交代它怎么拿系统权限、会不会误操作、有没有沙箱。对开发者来说,这要么是桌面 agent 的一大步,要么是个安全坑,得等更多细节。

AI HOT 精选

Anthropic 安全团队用自家 Claude Code 搭了个威胁检测平台,一天出原型、一周上线

Anthropic 的检测平台工程团队用 Claude Code 开发了 CLUE 威胁检测与响应平台。他们一天就做出了概念验证,一周完成交付。这个平台把安全分析员查日志的时间从几小时压缩到了几分钟。文章是团队技术负责人 Jackie Bow 写的,主要讲他们怎么用 Claude Code 自动处理告警、加速调查,但没披露具体用了哪些模型、实际误报率多...

推荐理由:这是 Anthropic 安全团队自己吃狗粮的案例,不是 Claude Code 功能发布。CLUE 平台和一天 PoC、一周交付的时间线让它刚好够上 featured 门槛,但我会先打个折——内部案例的通用性还没验证,正文也没披露误报率、处理量这些硬指标。

AI HOT 精选

Claude Opus 4.7 快速模式开放研究预览,API 和 Claude Code 都能用

Anthropic 把 Claude Opus 4.7 的快速模式放出来了,现在可以在 API 和 Claude Code 里用,但还挂着研究预览的标签。正文没提模型参数量、具体定价、调用频率限制,也没说什么时候转正式版。如果是真的快又便宜,对日常开发场景会挺实用,不过这些关键信息都缺着,先别急着切生产环境。

推荐理由:我会先打个折:正文只说了开放研究预览,没披露模型大小、定价、速率限制和正式上线时间,所以别当成品看。但这条消息对用 Claude Code 干活的人很实在——快速模式意味着写代码、调工具的等待时间可能明显缩短,工作流会顺很多。信息缺口主要在成本和规模上,没这些数字就没法算账,这点先别太激动。整体判断挂在延迟改善和开发者体验上,信息不够的部分也标清楚了。

AI HOT 精选

GitHub Copilot 个人版新增弹性配额,并推出更高配的 Max 计划

GitHub 在 2026 年 6 月 1 日调整了 Copilot 个人版套餐,Pro 和 Pro+ 用户会获得一个弹性配额,用来调用更高级的模型或功能,超出部分怎么算正文没细说。同时新加了一个 Max 计划,定位比 Pro+ 更高,但具体价格、配额上限和分配规则都没公布。简单讲就是给个人用户更多选择,但关键数字全藏着,现在没法判断性价比。

推荐理由:我会先打个折:这条更新对用 Copilot 写代码的人挺实在,弹性配额意味着可能不用被固定额度卡脖子,Max 计划听起来像给重度用户准备的。但正文没披露价格、额度上限和具体怎么分配,这点先别太激动。HKR 三项都踩中了,但信息缺口明显,所以放在 featured 低位,等价格和规则出来再重新评估。

Hacker News 首页

Hopper:给大型机配了一个能看懂 z/OS 的 AI 操作界面

Hypercubic 发布了 Hopper,一个把 AI 助手直接塞进大型机开发流程的桌面工具。它自带真实的 TN3270 终端,AI 能识别 ISPF 面板、写严格对齐列位的 JCL 作业、把 SDSF 里的失败信息翻译成具体的异常码和出错行,还能像查 SQL 一样查询 VSAM 数据集。编译、测试、上线可以一条指令完成,但每次改动前会暂停等你批准,...

推荐理由:Hypercubic 这个 Hopper 把 TN3270 终端、z/OS 面板和 AI agent 揉在一起,让 agent 能直接操作大型机上的 COBOL 系统,敏感步骤还得人工点个头才放行。想法挺有意思,但正文没给出任何客户、定价或实际跑起来的效果数据,目前只是 Show HN 阶段的小团队产品展示。我会先打个折,等有真实案例再往上调。

TechCrunch · AI

Google 在 Android Show 上发了什么:AI 笔记本、能帮你干活的 Gemini、随口说说的桌面小部件

Google 在 I/O 大会前办了一场 Android Show,把 Gemini 助手塞进了更多地方。新发布的 Googlebooks 笔记本主打 AI 优先,但正文没披露具体配置、价格和上市时间。Gemini 变得更“代理化”,意思是它能跨 App 帮你完成一连串操作,不过实际效果还得看落地。Android 桌面小部件现在支持“vibe codi...

推荐理由:Google 在 I/O 前一口气甩出好几个 Gemini 相关的 Android 更新,我会先打个折:正文没给参数、没标价格、也没说什么时候能用上,所以只能当产品信号看。比较有意思的是 vibe-coded widgets,等于让用户用自然语言描述就能生成桌面小组件,门槛降得很低;Googlebooks 则像是把笔记和 Gemini 的搜索/总结能力缝在一起,能不能打还得看实际体验。整体属于有话题但缺验证的 mid-weight 产品更新。

AI HOT 精选

Anthropic 在 Code w/ Claude SF 2026 上给开发者工具加码:Claude Code 调用频率翻倍,托管智能体新增记忆审查、多...

Anthropic 在旧金山的年度开发者大会上宣布了几项更新。Claude Code 的速率限制直接翻了一倍,Opus 模型的 API 调用上限也提高了,对重度用户来说不用那么频繁撞墙了。Claude 平台上的托管智能体(hosted agents)这次加了四个新功能:记忆审查,让智能体能回顾之前的对话;多智能体委派,可以把任务分给其他智能体去干;输出...

推荐理由:Anthropic 这次更新有具体数字和功能列表,不是画饼。速率翻倍对重度用户是实打实的改善,托管智能体加 4 项功能也说明他们在推 agent 落地。没有新模型发布,所以重要性在 78–84 这个区间合理。

5月12日星期二

AI HOT 精选

GitHub 员工用 Copilot CLI 把代码库变成了地牢探险游戏

一个 GitHub 工程师拿 Copilot CLI 做了个扩展,能把任意代码仓库解析成 Roguelike 风格的地牢地图。核心机制是程序化生成关卡——说白了就是让代码结构自动变成房间和走廊。这更像一个创意编程和游戏原型 demo,展示 Copilot CLI 除了敲命令,还能用来快速搭出带交互的终端小玩意。正文没披露生成一张地图要多久、支持多大的代...

推荐理由:HKR-H 和 HKR-K 都成立:GitHub 官方教程里藏了个新奇的 Demo,机制也讲清楚了。但它不是 Copilot 核心能力的大更新,正文没给性能指标、定价或基准数据,就是个教程级别的 featured,我会先打个折,别当重磅发布看。

r/LocalLLaMA

一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

Reddit 用户 grumd 在一张 RTX 5080(16GB 显存)和 64GB 内存的单机上同时跑了两套模型:Qwen2.5-Coder-7B Q6 做代码补全,Qwen3.6-35B-A3B Q8 做智能体编程(让模型自己规划步骤、调用工具写代码)。35B 那个模型用了内存卸载,上下文能撑到约 145k,速度是每秒 35.29 个 token...

推荐理由:这是一篇 Reddit 个人实验帖,不是系统评测,没有对比其他方案或验证稳定性,所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了,对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率,这点先别太激动。

Hacker News 首页

Statewright:用可视化状态机给 AI 智能体上把锁,让它干活更靠谱

这是一个刚在 Hacker News 上展示的开源项目,核心思路是用 Rust 写一个状态机引擎,把 Claude Code 能调哪些工具、能跑多少轮、怎么跳转、什么条件下才能执行下一步,全部用状态图管起来。作者说 130 亿到 200 亿参数的模型在真实的 SWE-bench 任务上表现都有稳定提升,但正文没披露具体的基准分数、样本量和评测流程,这点...

推荐理由:我会先打个折:SWE-bench 具体分数没披露,没法判断改进幅度有多大。但用状态机硬约束工具调用这个思路本身靠谱,尤其对 Claude Code 这类编程 agent 的稳定性有帮助。小模型能跑是个加分项,说明不是堆算力的玩法。整体值得推荐,但别把“一致改进”当成碾压性提升。

量子位 · 公众号

Anthropic 工程师提议用 HTML 替代 Markdown,Karpathy 也表态支持

Anthropic 工程师 Thariq 发了条推,列出 5 个理由主张模型输出 HTML 而不是 Markdown,Karpathy 随后转发表示认同。他的核心论点是 Markdown 的语法歧义太多,解析器各家实现不一致,模型生成时容易出错;HTML 虽然啰嗦但结构明确,对自动化处理和前端渲染更友好。正文没披露具体是哪 5 个理由,只提到生成 HT...

推荐理由:Anthropic 工程师 Thariq 主张用 HTML 替代 Markdown,Karpathy 也表态支持,这事在开发者圈子里容易吵起来。我会先打个折:这不是模型发布或产品更新,只是一场格式辩论。但文章给了具体数字——HTML 生成时间是 Markdown 的 2 到 4 倍,说明成本差距不小,从业者会关心 token 消耗和维护复杂度。正文没披露实验环境或代码,所以别太激动,目前只是一篇 Reddit 帖子,没有独立复现或论文支撑。

AI HOT 精选

npm 大规模供应链投毒,TanStack、Mistral AI 等 160 多个包被植入窃密代码

安全机构 Socket 发现一起名为“Mini Shai-Hulud”的供应链攻击,攻击者利用 GitHub Actions 的三个漏洞,在 npm 上发布了近 373 个恶意版本,覆盖 160 多个包名。受影响的不只是 TanStack 旗下的 84 个包(其中 @tanstack/react-router 周下载量超 1200 万次),还包括 Mi...

推荐理由:这条是实打实的安全事件,不是模型或产品发布,所以分数没往上拉。Socket 的发现够硬,但正文里没提有独立复现或公开的论文/代码仓库,我会先打个折,78 分合理。

Computing Life · 鸭哥

AI 怎么让我失眠,又怎么帮我找回了睡眠

作者三月底开始严重失眠,每晚只能睡两三个小时,辞职后也没好转。他没靠瞎猜,而是让 AI 花五分钟写了个 app,把苹果手表和手机里 HealthKit 的健康数据(咖啡因、酒精、入睡时间、深睡时段等)全导出来,再让 AI 跑多变量回归分析,看哪些因素和睡眠时长负相关最明显。结果发现,晚饭后最后一次用 AI 的时间是头号变量——用得越晚,睡得越差;而喝咖...

推荐理由:这篇是个人量化实验,不是行业大新闻,但数据很具体。作者先写了个 app 拉出 HealthKit 数据,做回归发现晚饭后最后一次用 AI 的时间越晚,当晚睡眠越短;停用后平均多睡 1 小时 40 分钟。我会先打个折:这只是单人数据,没有复现,也没公开代码或论文,所以重要性停在 78。但 HKR 三项都成立,角度新鲜,数字也够硬,对开源微调那批人来说,既戳中 AI 过劳的焦虑,又给了个可复现的追踪思路。

AI HOT 精选

OpenAI 办了一场“参数高尔夫”比赛,1000 多人用 AI 助手卷模型压缩,我们看到了什么

OpenAI 搞了个叫 Parameter Golf 的机器学习挑战赛,规则很硬:模型加代码总大小不能超过 16MB,训练时间只有 10 分钟(用 8 张 H100),看谁能在固定数据集上把测试损失压到最低。超过 1000 人提交了 2000 多次结果。我会先打个折,正文没披露最终冠军的具体分数,但重点讲了技术路数。最卷的方向是训练优化,有人把前人的好...

推荐理由:OpenAI 的 Parameter Golf 复盘靠一场实打实的比赛、1000多名参与者和2000多份提交撑住了 HKR 三项。它属于研究/基准信号,不是模型或产品发布,所以 78 分放在 featured 里偏低的那一档是合理的。我会先打个折:目前只有一篇 Reddit 帖子,没有独立复现,也没看到论文或代码放出来。

The Verge · AI

OpenAI 发布 Daybreak,正面回应 Anthropic 的安全模型 Claude Mythos

OpenAI 推出 Daybreak 安全项目,把 3 月发布的 Codex Security AI 智能体用起来,先给组织代码建威胁模型、梳理可能的攻击路径,再自动验证和检测高风险漏洞。这距离 Anthropic 公布 Claude Mythos 安全模型仅一个多月——Anthropic 当时说这模型太危险不能公开,只放在自家 Project Gla...

推荐理由:H/K/R 全中:Daybreak 有明确的竞品对标、具体的 agent 工作流,也戳中代码安全审计的共鸣点。不过这只是 Reddit 单帖,没有独立复现或论文/代码放出来,所以分数压在 82 没往上走。

Computing Life · 鸭哥

我用 AI 治好了 AI 造成的失眠

作者在 2026 年 3 月左右开始严重失眠,每晚只能睡两三个小时。他让 AI 写了个工具,把 Apple Watch 和 iPhone 里的健康数据全导出来,再让 AI 跑多元回归分析,结果发现最影响睡眠的变量是晚饭后使用 AI 的时间——用得越晚,睡得越差。咖啡因、酒精这些反而没表现出明显关联。原因可能是用 AI 时人一直在高强度阅读、思考和并行处...

推荐理由:HKR 三项都成立:个人反转有传播力,HealthKit 加回归分析给了可验证的细节,睡眠损失直接打在 AI 从业者的痛点上。不过这只是单篇 Reddit 帖子,没有独立复现或论文/代码公开,所以保持在 featured 档的 72 分。

彭博科技

GitLab 宣布裁员,省下的钱要投给 AI agent 业务

GitLab 说会裁掉一部分岗位,把省出来的人力和预算转到 AI agent 方向。具体裁多少人、砍哪些部门、省出多少钱、什么时候开始执行,正文都没披露——因为 Bloomberg 原文被付费墙挡了,只拿到 RSS 摘要。我会先打个折:这更像一个资源重分配的信号,不是财务危机驱动的裁员。

推荐理由:H 和 R 都站得住:Bloomberg 报道 GitLab 把裁员和 agent 投入直接挂钩,对开发者工具圈是个强劳动力信号。K 偏弱,因为人数、预算和执行时间都没披露。维持 78 分,原因是这只是一条 Reddit 帖子,没有独立复现,也没给出论文或代码。

r/LocalLLaMA

Reddit 网友实测 288 次模型调用,把本地模型输出 JSON 时的各种翻车方式全整理了一遍,还写了个修复库

Reddit 用户 kexxty 用 OpenRouter 跑了 288 次结构化输出测试,覆盖 Llama 3、Mistral、Command R、DeepSeek、Qwen 等模型,发现本地模型和纯 API 模型在 JSON 上出的错其实差不多。他把这些失败归类后,写了一个叫 outputguard 的 Python 修复库,用 MIT 协议开源。...

推荐理由:HKR 三项都成立:288 次调用不是随便跑跑,outputguard 库和 15 步修复链给了可复用的实操细节。信息源是单篇 Reddit 帖子,没有第三方验证或论文背书,所以放在 72-77 的 featured 档位,不往上走。

AI HOT 精选

OpenAI 发布 Daybreak,把自家模型和 Codex 打包成网络安全防御工具

OpenAI 宣布推出 Daybreak,一个面向安全团队的 AI 防御系统,整合了他们最强的模型、Codex 以及安全合作伙伴的能力,目标是加快漏洞发现和软件防护的速度。正文没披露具体定价、上线时间,也没给出任何防御效果的实测数据,所以实际能防住什么级别的攻击、误报率多少都还不清楚。

推荐理由:OpenAI 发了个 Daybreak 的安全产品公告,把模型、Codex 和合作伙伴绑在一起做网络防御,听着像个正经产品。但我会先打个折:全文没给一个防御指标,也没说什么时候能用、花多少钱,目前更像一个概念拼盘。它踩中了 AI 攻防和合规的焦虑点,所以值得提一嘴,但缺干货让它只能停在产品更新这个档位。

AI HOT 精选

把大模型命令塞进脚本第一行:用 shebang 直接跑 LLM

Simon Willison 试了一种很野的玩法:把 LLM 命令行工具直接写在脚本的 shebang 行里,让一个纯文本文件变成可执行脚本。最简单的例子是 `#!/usr/bin/env -S llm -f` 下面直接跟一句“画个骑自行车的鹈鹕 SVG”,就能生成图片。复杂一点的可以用 `-T` 参数调用外部工具(比如报时),或者直接在 YAML 模...

推荐理由:Simon Willison 这次没发新模型,也没推平台,就是演示了一个把 LLM 当 shebang 解释器的命令行玩法。我会先打个折:这更像一个巧妙的黑客技巧,不是生产级方案,正文也没披露错误率或延迟数据。但它的价值在于把“用自然语言写脚本”这件事拉到了终端里,fragments 和 -T 这些参数让例子能直接跑通,对经常写胶水脚本的开发者来说,看一眼就会想试试。整体属于低配 featured,因为影响范围还在 CLI 自动化这个圈子里,没往外扩。

AI HOT 精选

Replit 上线并行代理,一次能跑 10 个代理同时干活

Replit 新出的并行代理功能,允许最多 10 个代理同时跑。每个代理拿到的都是你应用的独立副本,在各自的机器上互不干扰,最后通过一个代理工作流把结果合并回来。正文没披露合并冲突怎么处理、任务怎么拆分,也没给出具体提速数据,这点先别太激动。

推荐理由:Replit 这次把并行代理的上限拉到 10 个,每个代理独立跑应用副本再合并,相当于让多个 AI 程序员同时改代码然后合分支。正文没讲合并冲突怎么处理、代理间怎么分工,这点先别太激动。整体是个中等体量的开发者工具更新,还没到 Cursor Agent 模式那种量级,所以放在 featured 档。

AI HOT 精选

Anthropic 把 Claude 平台搬上了 AWS,现在能用 AWS 账号直接买单了

Claude 平台在 AWS 上正式上线,AWS 客户可以直接用现有的 AWS 账号登录、走 AWS 的账单付款,还能用已承诺的消费额度来抵扣。这意味着你不用再单独搞一套 Anthropic 的账户和支付,采购流程会简单不少。功能上,这次把完整的 Claude API 套件都带过来了,包括能托管运行 AI 智能体(让模型按流程自动干活)、代码执行、文件...

推荐理由:这事说白了就是 Claude 在 AWS 上开了个官方旗舰店。以前你可能得单独找 Anthropic 申请、单独结账,现在直接用 AWS 的账号体系和承诺消费额度就能买单,对已经绑在 AWS 上的公司来说,采购和合规流程会顺滑很多。功能上没新东西,就是把智能体、跑代码、传文件这些 API 打包进 AWS 的计费管道里。正文没提价格有没有变化,这点先别太激动。

The Verge · AI

Google 首次拦截了一个用 AI 辅助开发的零日漏洞攻击

Google 威胁情报团队(GTIG)发现并拦下了一个用 AI 帮忙写的零日漏洞。攻击者打算拿它搞一次大规模攻击,绕过某个开源网页系统管理工具的双因素认证,但报告没提具体是哪个工具。漏洞利用脚本里留下了 AI 痕迹,比如一段胡编的 CVSS 评分,还有像教科书一样工整的代码结构,这些都很像大模型训练数据里出来的东西。

推荐理由:这条消息抓人是因为它把 AI 安全从“可能”拉到了“已经发生”。Google 亲自下场说拦住了 AI 开发的零日,目标是绕 2FA,这比泛泛而谈的威胁报告有分量。我会先打个折:正文没披露具体工具名和漏洞细节,没法验证攻击的复杂度,所以分数卡在 78–84 区间是合理的。但光是“AI 造零日”这个事实,就足够让做安全的人多看两眼。

5月11日星期一

AI HOT 精选

Cognition AI 总部首次曝光:Scott Wu 和他 18 个月做到 4.45 亿美元年化收入的 Devin

推文放出了 Cognition AI 总部“Cog House”的内部画面。创始人 Scott Wu 是顶尖竞技程序员,拿过三次国际信息学奥赛金牌。他在 2023 年 11 月母亲去世、Sam Altman 被 OpenAI 解雇的同一天创立了公司,赌的是 AI 会变成能全天干活的智能体。他们做的 AI 软件工程师 Devin 刚上线时表现一般,但 1...

推荐理由:HKR 三项都过,因为这篇既有 Cognition AI 罕见的内部揭秘,又甩出了 Devin 的营收和估值数字。没给 P1 是因为它本质上是人物+公司特写,不是融资、产品发布或模型发布那种硬消息。

AI HOT 精选

OpenRouter 用真实市场需求给模型排座次,DeepSeek V4 Pro 排第一

OpenRouter 搞了个叫 Pareto Code 的排名方法,不看跑分,直接看用户在实际调用中怎么选模型,找出性价比最优的那条线。目前排第一的是 DeepSeek V4 Pro,后面跟着 GPT 5.4 Mini 和 Gemini 3.1 Pro。不过正文没披露具体怎么算分、样本量多大,所以这个排名到底多稳,我会先打个折。

推荐理由:我会先打个折:OpenRouter 只发了一篇帖子,没公布样本量、统计时间窗口和具体定价依据,所以这个排名不能当严谨评测用。但它的价值在于思路——用市场实际调用数据来反映模型性价比,比跑分更贴近真实使用场景。DeepSeek V4 Pro 排第一这点先别太激动,得看后续有没有更透明的数据支撑。整体上,这条信息对正在选模型的开发者有参考意义,但信息缺口明显,够 featured 但上不了更高分。

r/LocalLLaMA

ExLlamaV3 连续更新:DFlash 让编程吞吐量翻三倍,多款模型推理再提速

ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后,编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67,翻了近三倍。v0.0.32 专门优化了五款模型,其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...

推荐理由:我会先打个折:这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息,不是全行业当天必读的大新闻。但提速数字很实在,Coding 场景三倍提升、特定显卡上 72.4% 的涨幅,对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用,这点先别太激动,但作为一次开源推理库的版本更新,信息量够、指向明确,值得推给关注推理效率的读者。

新智元 · 公众号

Anthropic 估值可能冲到近万亿美元,Jack Clark 预测 2028 年底前 AI 有超一半概率能自己造出更强的自己

这篇文章本身因为微信环境验证问题,正文内容没抓到,只能看到标题和外部信息。标题里提到 Anthropic 在考虑接近 1 万亿美元的估值,年化收入五个月内涨到 450 亿美元,IPO 规模可能超过 SpaceX。Jack Clark 判断,到 2028 年底,AI 系统能自主迭代出更强版本的概率超过 50%,Kalshi 预测市场上这个 IPO 在 1...

推荐理由:我会先打个折,因为来源是二手媒体,IPO和ARR数字都没看到官方确认。但文章把几个高关注点串在了一起:估值、收入增速、自主迭代的时间预测。对从业者来说,这些数字即使有水分,也反映了市场对头部AI公司定价的疯狂程度,以及内部对技术奇点临近的判断。信息量够,争议性也够,值得推。

新智元 · 公众号

Claude Mythos 在 METR 长任务评测里拿到 50% 成功率,对应人类 16 小时的工作量

METR 的 Time Horizons 测试里,Claude Mythos 预览版在人类需要 16 小时才能完成的任务上,成功率达到了 50%。不过整个测试集一共 228 个任务,只有 5 个任务的时间跨度超过 16 小时,所以这个成绩能说明它在长任务上有进步,但样本太少,还测不出它在更长时间尺度上的真实水平。

推荐理由:我会先打个折:50% 成功率听起来很猛,但只测了 5 个超过 16 小时的任务,样本太少,不能当定论。正文自己也说更长区间样本不足。所以 2027 奇点加速这种说法先别太激动。不过这个结果确实把 AI 评测的天花板往上顶了一截,从跑分转向了按人类耗时衡量的任务,对做智能体和安全的团队有直接参考价值。整体给 82 分,因为数据有料但外推太远,不算当天必读的头条。

机器之心 · 公众号

ICML 2026 论文:PRISM 框架让扩散语言模型做推理时扩展不再烧算力

这篇 ICML 2026 的论文给扩散语言模型(dLLM)提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层:先让模型并行生成多条推理路径,再对每条路径局部“回退重写”不靠谱的步骤,最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上,LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...

推荐理由:这篇 ICML 论文给扩散语言模型做 test-time scaling,核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%,靠的是三层搜索、局部 remasking 和自验证,把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折:这只是单模型单数据集的实验,正文没披露在其他 benchmark 或更大模型上的表现,泛化性还不好说。但思路本身对做推理优化的人有参考价值,尤其适合预算有限又想压榨小模型推理能力的场景。

量子位 · 公众号

菲尔兹奖得主实测 ChatGPT 5.5 Pro,17 分钟跑出论文级数学结果

陶哲轩的同事、菲尔兹奖得主 Timothy Gowers 拿 ChatGPT 5.5 Pro 试了一道加法数论里的难题,模型在 17 分 05 秒内给出了一个最优的二次上界构造,相当于直接产出了一篇小论文的核心证明。之后他又让模型把整个过程写成 LaTeX 预印本,总共花了 47 分钟。Gowers 把结果发在了自己博客上,因为 arXiv 目前拒收 ...

推荐理由:三条都过:Gowers 的第一人称实测、17 分 5 秒和 47 分钟预印本都是可讨论的硬信息。不是模型发布,但有名有姓的实验和数学推理冲击让它必须写。

AI HOT 精选

Codex 自己找了个安全审计的活,花了 22 小时赚到 16.88 美元

有人让 Codex 去赚 5 美元,它自己找到开源项目的安全审计赏金,提交了能用的代码修复,跟维护者来回沟通,还搞定了 GitHub 的验证流程,最后代码被合并,拿到了 16.88 美元。整个过程大约 22 小时,如果每天重复,一个月能赚 506.40 美元。金额不大,但这是 AI 第一次自己跑通“接活—干活—收钱”的闭环。正文没披露 Codex 具体...

推荐理由:HKR 三项都站得住:一个 Codex agent 在 22 小时内走完了从接任务到收钱的闭环,有具体金额和流程细节。不过目前只有一条社交帖子作为证据,没有可复现的日志,所以先不打最高级。

r/LocalLLaMA

MTP 实测:写代码能加速 71%,写小说反而变慢 9%,任务类型决定投机推理是帮忙还是帮倒忙

一位 Reddit 用户用 Qwen 3.6 27B 的 MTP 量化模型跑了 300 多次测试,发现投机推理(让模型先猜后验证)的效果完全看任务类型。写代码时草稿被采纳的比例高达 79% 到 89%,用 F16 精度跑代码生成速度提升了 171%;但换成创意写作,Q4_K_M 量化下推理速度反而慢了 9%。结论很直接:别只看模型和量化,先看你要让模型...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次实验,不是官方基准,但 300 多次测试把投机推理的任务依赖性讲得很清楚。编码任务接受率高、加速明显,创意写作接受率低、反而变慢,这个结论对本地跑模型的开发者有直接参考价值。正文没披露测试硬件和具体 prompt,但数据量够大,可以先信一半。

5月10日星期日

r/LocalLLaMA

ByteBell 开源了一套代码索引方案:用 LLM 给每个文件生成语义信息存进图数据库,比向量、语法树和暴力塞上下文都管用

他们试了三种路线:向量相似度搜代码、用抽象语法树(AST)结构化匹配、以及直接把代码块塞进大窗口模型。最后发现,让 LLM 先给每个文件提炼出用途、摘要、业务背景、实体、类、函数、关键词和依赖关系,存到 Neo4j 图数据库里,再用全文搜索去查,效果最好。正文没披露具体评测指标和对比数据,这点先别太激动。工程上有个省钱设计:用 SHA-256 比对文件...

推荐理由:我会先打个折:文章来自 Reddit 分享,没有给出系统性的对比数据和量化指标,所以不能当正式评测看。但它的价值在于把一条反直觉的工程结论讲清楚了——向量、AST、暴力塞上下文都试过,最后是语义图赢了。做法也够具体:逐文件跑 LLM 摘要写入 Neo4j,用 SHA-256 diff 做增量更新,只重建改过的文件。这对正在搭代码检索或 agent 的人是个直接可抄的思路,踩坑记录比方法论更有用。信息缺口是没披露用了哪个模型做摘要、图查询的延迟和成本也没给,这点先别太激动。

r/LocalLLaMA

网友用一张 RTX PRO 6000 工作站显卡跑起了 DeepSeek V4 Pro

Reddit 用户 fairydreaming 发帖说,他在自己机器上跑通了 DeepSeek V4 Pro。用的是一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡,搭配修改过的 llama.cpp CUDA 分支。模型文件是 Q4_K_M 量化版,体积 859GB。他分享的日志显示,在 1M 上下文窗口下,生成速度跑到每秒 ...

推荐理由:我会先打个折:这是 Reddit 单帖,没有第三方复现,稳定性、量化损失、长上下文下的实际效果都还没谱。但帖子里把文件大小、上下文长度、生成速度和运行分支全摊出来了,对想自己折腾本地推理的人来说,比很多官方博客都直接。单卡跑 859GB 模型这件事本身就是一个信号——大模型本地化的硬件门槛在往下走,这点先别太激动,但值得盯着。