跳到正文

#其他

今日 3 条

8月14日星期五

FT · 科技

OpenAI 和 Anthropic 被中国对手逼着打价格战

FT 报道,OpenAI 和 Anthropic 正在大幅降价抢企业客户,压力来自 DeepSeek 这类成本更低的中国模型。两家公司都在推更便宜的小模型,同时靠高价订阅和 IPO 预期撑估值。文章没给出具体降了多少、什么时候生效,更像一篇趋势分析。

推荐理由:FT 这篇是趋势分析,不是硬消息稿。它点出了 OpenAI 和 Anthropic 被中国低价模型逼着降价的大背景,但正文没披露具体降了多少、什么时候开始,信息密度不够硬。我会先打个折:格局判断有参考价值,但缺可执行的数据,所以 H 和 R 都成立,K 不成立,刚好够 featured 门槛。

Computing Life · Share · 鸭哥调研

Agent 授权之争,争的不是密码学,而是信任该交给谁

Vercel Connect 把长寿命的 refresh token 从应用代码里挪走,靠 OIDC 短命凭证换 token,真正的卖点是集中管理,不是更强的安全性。Cloudflare OS 管的是数据读取后的去向,不碰凭证签发。OpenAI 收购 Ona,押注客户自己保管凭证。四套思路各管一段,凭证线和数据线至今没打通。

推荐理由:这篇分析把 Agent 授权拆成凭证签发、数据去向、凭证保管三条线,用 Vercel、Cloudflare、OpenAI 的具体动作对照着讲,比泛泛的趋势文扎实。扣分在于它是综合解读而非一手爆料,而且文章没给出打通凭证线和数据线的明确路径,更像把问题摊开。

Computing Life · Share · 鸭哥调研

Agent 浏览器两极分化:Cloudflare Kitesurf 在边缘做轻,Ego-Lite 在桌面做厚,真实态与并发密度不可兼得

2026 年春夏,Cloudflare 的 Kitesurf 和 CitroLabs 的 Ego-Lite 给出了两种完全相反的 agent 浏览器方案。Kitesurf 把用 Rust 写的轻量渲染引擎编译成 WASM,挂到 Cloudflare 全球边缘网络上跑,单页内存压到 39.4 MiB,比预热好的 Chromium 省了约 7 倍,适合高并...

推荐理由:文章把 Cloudflare Kitesurf 和 CitroLabs Ego-Lite 两条 agent 浏览器路线摆在一起对比,用内存数据说明云端轻量方案省资源但牺牲真实环境,本地方案保真但难扩并发。属于行业趋势分析而非硬新闻,信息密度和冲突感都不错,但缺少更多实测或第三方验证,所以给到 78 分放在 featured 档。

彭博科技

OpenAI 年化收入跑过 400 亿美元,赶在 IPO 前亮出商业化底牌

OpenAI 的年化收入跑率(用最近一个月收入乘以 12 估算)已经超过 400 亿美元,三个月内翻了一倍多。这是它 IPO 前最关键的数字,说明商业化在加速。收入主要靠 ChatGPT 订阅和 API 调用,但文章没拆各自占比。我会先打个折——跑率不是实际全年入账,只是把单月数字放大,不过增长势头确实猛。

推荐理由:OpenAI 在 IPO 前放出最关键的收入数字:年化跑率超 400 亿美元,三个月翻了一倍多。文章是 Bloomberg 独家,信源加分,但没拆 ChatGPT 订阅和 API 各自贡献多少,也没说利润情况。我会先打个折——跑率是把单月数字放大,不是真金白银入账,不过增速确实猛,直接关系到市场怎么给它定价。

AI HOT 精选

有人让 Claude 接管了日常代码维护,几周自动开了 388 个 PR

Boris Cherny 把应用的日常维护丢给 Claude 去跑,通过 Slack 频道让它自动做崩溃模糊测试、重复代码统一、死代码清理这些活。几周内 Claude 开了 388 个 PR,其中 180 个经过它自己 Code Review 和人工审核后合进去了。大部分时候一次就改对,偶尔翻车的话,调一下例行任务的描述,第二天就能修正。

推荐理由:Boris Cherny 的第一手实验,有具体数字和可复现流程,不是公关稿。Claude 做维护不算行业地震,但 388 个 PR 的规模让它在同类实验里很突出。没给更高分是因为正文对失败案例的细节披露有限,只说'偶尔翻车调一下描述就能修正',没展开翻车类型和比例。

TechCrunch · AI

Databricks 本想融 10 亿,投资人塞了 150 亿,最后拿了 50 亿,估值 1900 亿

Databricks 的 CEO Ali Ghodsi 说,他们本来只打算融 10 亿美元,结果融资消息被提前泄露后,投资人蜂拥而至,开价高达 150 亿。最后他们折中拿了 50 亿,公司估值定在 1900 亿。Ghodsi 解释,搞 AI 太烧钱,而且如果拒绝太多现有投资人的钱,会闹得不愉快。不过,文章没披露这笔钱具体要怎么花,也没说新加入的投资方都有谁。

推荐理由:Databricks以1900亿估值融了50亿,CEO把从10亿到150亿再到50亿的谈判过程讲得很直白,数字和叙事都有料。没给更高分是因为文章没披露这笔钱具体怎么花、新投资方是谁,信息有缺口。

The Verge · AI

OpenAI 一周内再走一位高管,首席营收官 Denise Dresser 宣布离职

Denise Dresser 去年 12 月才从 Slack CEO 的位置上过来,当 OpenAI 的首席营收官,现在发帖说几周后就要走,去“找别的机会”。接她班的是云安全公司 Wiz 的总裁兼 COO Dali Rajic。这周稍早,前 COO、后来管特殊项目的 Brad Lightcap 也宣布离开。Dresser 之前还接过 Lightcap ...

推荐理由:一周内两位高管出走,Dresser 从 Slack 过来不到一年就离开,接任者来自 Wiz 而非传统 SaaS 巨头,信号很强。扣分点:正文没披露 Dresser 离职原因和 Rajic 具体到任时间,所以我会先打个折——变动本身够重要,但信息有缺口,别急着下结论。

Hacker News 首页

Airbnb 的评测驱动开发:把生成式 AI 评测当成正经工程来做

Airbnb 工程团队分享了一套大规模评测生成式 AI 的方法。核心规矩就一条:先写评测,再写代码,别搞反了。他们用了三种评测手段——规则指标做快速检查、用大模型当裁判评主观质量、人工评估来校准。虚拟裁判必须先跟人的打分对齐,才敢放心用。对于那种会串联工具调用和推理的智能体系统,他们建议把每一步拆开单独评,最后再跑端到端测试。文章从头到尾走了一遍完整流...

推荐理由:Airbnb 工程团队分享了一套大规模评测生成式 AI 的实操方法,核心纪律是评测先行,代码后写。文章把评测手段拆得很清楚:规则指标做快速检查、用大模型当裁判评主观质量、人工评估来校准,而且强调虚拟裁判必须先跟人的打分对齐才敢用。对智能体系统还给出了分步评测加端到端测试的建议。全是工程落地经验,没有虚词,对正在搭评测体系的团队很有参考价值。

TechCrunch · AI

OpenAI 给 GPT-5.6 Sol 加了“超快模式”,推理速度拉到 14 倍

OpenAI 推出了一个叫 Ultrafast 的预览模式,让自家最强的 GPT-5.6 Sol 模型跑到每秒 750 个 token,是标准速度的 14 倍。以前想要实时响应,通常得换个小模型,这次相当于让大模型自己快起来。这个模式跑在 Cerebras 的芯片上,目前只开放给一小批客户,后续会扩大范围。Anthropic 的 Claude 也有快速...

推荐理由:GPT-5.6 Sol 直接提速 14 倍,对需要实时响应的场景是个实打实的推理突破。没给更高分是因为现在还只是小范围预览,没有正式上线时间,而且绑定了 Cerebras 的硬件,能不能大规模铺开还不确定。

Hacker News 首页

理解成了新瓶颈:为什么你还是要读 agent 写的代码

Geoffrey Litt 在 AI Engineer 大会上的演讲里抛出一个观点:就算 agent 写代码越来越强,人还是得看懂它在干什么。不是为了挑错——agent 自己会越来越擅长验证——而是为了能继续参与创作。一个项目要跟 agent 来回好多轮,你对系统的理解直接决定你下一轮能不能想出好点子。他把这叫做“认知债”,跟技术债一样,短期不还没事,...

推荐理由:Geoffrey Litt 在 AI Engineer 大会上的演讲整理,不是产品发布或论文,所以上限给到 78。核心观点是 agent 写代码越强,人越需要看懂,不是为了挑错,是为了能继续想出新点子。他把这叫做“认知债”,跟技术债一样会累积。这个框架对天天用 agent 的开发者很实在,不是泛泛而谈。正文是个人博客转录,没有产品指标或实验数据,所以分数没往上拉。

Hacker News 首页

Cerebras 用整块晶圆芯片跑 OpenAI 的 GPT-5.6 Sol,每秒吐 750 个 token

Cerebras 和 OpenAI 放出了一个叫 Ultrafast 模式的新服务,目前只在小范围测试。它把 GPT-5.6 Sol 部署在 Cerebras 自家的晶圆级芯片上,推理速度最高能到每秒 750 个输出 token。在 Humanity's Last Exam 这个全是博士级难题的测试里,它跑完 2500 道题只用了 11 小时 11 分...

推荐理由:Cerebras 和 OpenAI 把 GPT-5.6 Sol 搬上晶圆级芯片,搞了个 Ultrafast 模式,推理速度拉到 750 tok/s,前沿模型第一次摸到这种实时交互的门槛。HLE 那套博士级难题跑完只用了 11 小时 11 分,给部署团队一个能直接算账的参考值。不过目前还是小范围测试,正文没披露并发数、成本结构和实际可用性,这点先别太激动。

Hacker News 首页

算力最优不等于集群最优:MoE 架构怎么选,得看真实集群能跑多快

Sheng Zha 的新论文 MOSAIC 把系统性能直接塞进了缩放法则里。以前的做法是先按理论算力预算挑架构,再交给系统团队去调优,但集群计费看的是 GPU 小时,不是理论浮点运算次数。他们在约 150 次 MoE 预训练实验上拟合出联合缩放法则后发现:如果只看理论算力,稀疏度越高越好,最优解会被推到搜索边界。但在真实的 512 张 GPU 集群上,...

推荐理由:Sheng Zha 这篇 MOSAIC 干了一件很实际的事:把集群的真实开销塞进缩放法则里重新算一遍。以前大家先按理论算力挑架构,再丢给系统团队去调优,但集群计费看的是 GPU 小时,不是理论浮点运算次数。他们在约 150 次 MoE 预训练实验上拟合出联合缩放法则后发现:如果只看理论算力,稀疏度越高越好,最优解会被推到搜索边界;但在真实的 512 张 GPU 集群上,通信开销和低利用率会把最优稀疏度往回拉一大截。这个结论对做预训练预算的人挺有用——选架构时就得把系统效率算进去,不然账单会教你做人。信息量扎实,实验规模也够,不是纯理论炫技。分数给 ...

TechCrunch · AI

OpenAI 上任仅 9 个月的营收官被换,从 Wiz 挖来总裁 Dali Rajic 接任

OpenAI 把干了 9 个月的首席营收官 Denise Dresser 换掉了,接替她的是 Wiz 的前总裁兼首席运营官 Dali Rajic。Wiz 今年刚被 Google 以 320 亿美元收购,是 Google 史上最大一笔并购。这次换人不是孤立事件——过去一个月里,OpenAI 的首席运营官 Brad Lightcap 和二号人物 Fidji...

推荐理由:连续的高管变动本身就有新闻性,加上 Wiz 被天价收购的背景让这次任命多了层看点。但说到底还是人事消息,没有产品和技术实质,所以放在 featured 里偏低的分数段。

AI HOT 精选

Google DeepMind 发布 Gemini 3.7 Flash,一个专为写代码和跑智能体任务设计的轻量模型

Gemini 3.7 Flash 是 Google DeepMind 新推出的轻量级模型,定位是给开发者当“干活主力”,主要用在代码生成、工具调用和长上下文任务上。官方说它在这些方面比前代有明显提升,延迟更低、成本也更友好。不过这篇公告没给出具体的跑分数据和定价,只说会通过 Google AI Studio 和 Vertex AI 开放。我会先打个折,...

推荐理由:Google DeepMind 发了个新轻量模型,定位清晰,但公告里缺了跑分和定价这些关键信息。产品更新本身值得关注,可数据不全,没法给更高分。

AI HOT 精选

MiniMax 发布 Music 3.0:开源权重的音乐模型,一次生成一首完整的 5 分钟歌曲

MiniMax 今天放出了 Music 3.0,一个开源权重的音乐生成模型。你给它一个创意方向和可选的歌词,它就能一次性把编曲、演奏和人声全搞定,最长能到 5 分钟。这次升级主要想解决三个老问题:准确理解你想表达什么、把这种感觉撑满整首歌、让人声和乐器听起来像真人实录而不是机器合成的。技术上换了一套新架构,叫 Hybrid-LM,用一个 80 亿参数的...

推荐理由:MiniMax 这次把 Music 3.0 开源权重放出来,一次生成最长 5 分钟的带人声完整歌曲,直接对标 Suno/Udio。我会先打个折:正文没披露训练数据规模和具体推理延迟,但公开的 Hybrid-LM 架构和 80 亿参数已经比多数闭源模型透明,对想自己部署和调参的团队来说,上手门槛低了不少。

8月13日星期四

TechCrunch · AI

英伟达用自家资产负债表给老显卡兜底,撬动 5000 亿美元建 AI 数据中心

英伟达拉来了 Apollo、黑石、高盛等六家金融巨头,口头承诺最高 5000 亿美元用于 AI 数据中心建设。真正的戏肉是英伟达自己掏钱担保旧款 GPU 的残值,让这些芯片能当抵押品去贷款。债券市场一度被吓到,直到黄仁勋出来解释才稳住。这个 5000 亿的数字我会先打个折——它只是上限,不是已经签好的合同。另外正文没披露担保在什么条件下触发,也没说英伟...

推荐理由:英伟达拉来六家金融巨头,口头承诺最高 5000 亿美元用于 AI 数据中心建设。真正的戏肉是英伟达自己掏钱担保旧款 GPU 的残值,让这些芯片能当抵押品去贷款。债券市场一开始被吓到,直到黄仁勋出来解释才稳住。这个 5000 亿的数字我会先打个折——它只是上限,不是已经签好的合同。正文没披露担保在什么条件下触发,也没说英伟达自己扛多少风险,这点先别太激动。

The Verge · AI

谷歌到底还想不想赢 AI 这场仗?

谷歌上周又重组了 AI 部门:Jeff Dean 离职去搞新实验室,Demis Hassabis 退居二线只做长期研究,Google DeepMind 现在连 CEO 都没了,只剩一个 SVP。Hayden Field 在播客里聊了这件事,她的判断是:谷歌底子太厚,搜索、分发、数据都是护城河,就算现在前沿模型落后,也不至于出局,但高管接连出走会加速人才...

推荐理由:一周内谷歌 AI 三位顶层人物同时变动,Hayden Field 的分析既没夸大危机也没粉饰太平,把护城河和人才流失风险都摆出来了。正文没给具体技术细节,但人事信号本身已经够强,对从业者判断大厂走向有参考价值。

AI HOT 精选

阿里开源 Qwen3.8-2.4T-A95B,硅基流动当天就接上了

阿里放出了一个总参数 2.4T、激活参数 95B 的 MoE 模型,主要想干自主编程、深度研究和让模型直接跑完整业务流程这些事。硅基流动在发布当天就上线了 API,输入每百万 token 2 美元,输出 6 美元,缓存输入 0.25 美元。正文没给任何跑分或架构细节,所以性能到底怎么样还得等第三方评测,先别急着上头。

推荐理由:阿里把 Qwen3.8-2.4T-A95B 开源,硅基流动当天就接上了 API,动作很快。2.4T 总参、95B 激活的 MoE 架构,体量上直接对标 DeepSeek V4 Pro 那个级别,而且明确冲着自主编程和 agent 场景去,信号很强。价格也直接给了,输入 2 美元、输出 6 美元、缓存 0.25 美元,不算离谱。但正文没披露任何 benchmark 或架构细节,性能到底怎么样完全没底,这点先别太激动,等第三方跑完分再说。

AI HOT 精选

Cursor 推出 builds 功能:云智能体启动速度提升至 3 倍

Cursor 现在会每小时在后台自动把代码仓库克隆好、依赖装好,提前做成一个“就绪环境”。当你启动云智能体时,它直接从这个环境启动,不用再等几分钟的冷启动,响应速度最多能快 3 倍。如果某次构建因为依赖更新或配置错误失败了,系统会自动隔离这个坏版本,智能体会继续用上一次成功的环境,不影响干活。Faire 公司每周跑 2000 多次自动化智能体任务,大仓...

推荐理由:Cursor 把云智能体冷启动从分钟级压到秒级,靠的是后台预构建环境和自动回退,不是空喊口号。Faire 每周 2000 次任务给了具体锚点。没给 p1 是因为这属于体验优化,不是模型能力跃升,但确实解决了高频痛点。

AI HOT 精选

OpenAI 发布 GPT-5.6 构建指南:用便宜模型跑出接近顶配的效果

OpenAI 放出了一份给开发者的实战指南,核心就一句话:GPT-5.6 系列让前沿智能体(让模型进业务流程干活)的成本大幅下降。指南里举了几个创业公司的例子:Hex 把 GPT-5.6 直接接入现有流程,发现用“低推理强度”效果反而最好,模型不会在没数据的地方死磕,省下不少 token。Hypha 用 Luna 模型做文档信息提取,准确率只比 GPT...

推荐理由:OpenAI 官方出的开发者指南,用创业公司的真实案例讲怎么用 GPT-5.6 系列省钱跑智能体。有具体操作和成本对比,对正在用 OpenAI 的团队挺实用。但这就是一份产品说明书,不是技术突破,所以重要性我给打个折,放在推荐阅读档。

OpenAI News

OpenAI 给 GPT-5.6 Sol 加了“极速模式”,用 Cerebras 芯片跑到 14 倍快

OpenAI 在 API 里先放出了一个叫 Ultrafast 的预览版,让 GPT-5.6 Sol 最快每秒能吐 750 个 token,比标准模式快 14 倍。这背后是换了 Cerebras 的芯片来跑推理。速度快到这种程度,主要想解决那些等不起的场景:比如线上事故时实时扒日志、找代码改动、辅助定位问题;金融交易里一边看行情一边扫异常;客服电话里不...

推荐理由:OpenAI 在 API 里放出了 GPT-5.6 Sol 的 Ultrafast 预览版,靠 Cerebras 芯片把推理速度拉到标准模式的 14 倍,每秒能吐 750 个 token。文章给了三个等不起的真实场景,信息量够硬。但没公布价格,也没说什么时候正式上线,所以分数停在 82,没冲到必须当天写的那档。

OpenAI News

OpenAI 挖来 Wiz 前总裁 Dali Rajic 当首席营收官,要把企业生意做成可复制的流水线

OpenAI 宣布 Dali Rajic 接替 Denise Dresser 出任首席营收官。Rajic 之前在 Wiz 当总裁兼 COO,擅长用数据指标驱动规模化销售,他的任务是把 OpenAI 早期拿下的企业客户转化成一套可重复、可度量的营收体系。公告同时披露了两个数字:周活用户超过 10 亿,企业客户超过 200 万,比一年前翻了一倍。我会先打个...

推荐理由:OpenAI 官方公告,既有高管换人又有业务规模数据,信息量撑得起 featured 级别。但本质是人事任命,没有产品和技术层面的新东西,所以 H 和 K 都满足,唯独缺了 R,按规则落在 72-77 这个分数段。

Hacker News 首页

Bullet 是一个追求低延迟的编程助手,把简单任务交给快模型,复杂任务才上重模型

Bullet 是 YC S26 的项目,做了一个本地的编程 agent,核心卖点是快。它用三招省时间:第一,按任务难度分流,简单活直接调快模型,只有复杂任务才升级到推理更强的模型;第二,搜索代码时不把整个仓库塞进上下文,而是按需读相关文件,减少无关信息干扰;第三,把能并行的工具调用同时跑,并拦截重复调用和死循环。它在 SWE-bench Verifie...

推荐理由:YC S26 首发,SWE-bench 分数亮眼,技术方案也踩中了 agent 太慢这个高频抱怨。但文章本质是产品落地页,缺用户故事和横向对比,信息密度撑不起更高的推荐位,放在 featured 低段比较合适。

AI 群聊日报

闭源模型的推理过程被批量扒光,Coze CLI 偷偷劫持本地 AI 工具

今天最值得看的是闭源模型的加密思维链被大规模提取。研究人员发现,把 Claude Opus 4.8 的加密推理块直接扔给同厂的 Haiku 4.5,后者就能逐字解码。这个方法在 Claude、GPT、Gemini 三家的 API 上都跑通了,用 Haiku 解码一万条轨迹的成本大概是 720 美元。另一篇论文更狠,说就算不接触加密块,光看模型公开输出的...

推荐理由:这条信息来自群聊日报,属于二手摘要,但信号很强:三篇论文指向同一个问题,且给出了可复现的方法和成本。我会先打个折,因为原文没披露具体实验细节和样本量,但核心判断——加密思维链可被跨模型解码——有足够的事实支撑。对从业者来说,这比一般的模型能力更新更值得警惕。

Hacker News 首页

OpenAI 把编程助手 Codex 塞进了 ChatGPT 桌面版,还发了 Linux 安装包

Codex 现在直接长在 ChatGPT 桌面应用里了,能端到端处理写功能、重构、迁移这类工程活。它用多智能体并行干活,号称能把几周的活压缩到几天。团队可以通过 Skills 系统教它自己的规范和流程,还能设成后台常驻,自动处理 issue 分诊、监控告警、CI/CD 这些杂事。正文没提具体定价和底层模型名。Ramp、Duolingo、Harvey 等...

推荐理由:OpenAI 把 Codex 集成进 ChatGPT 桌面版,是一次对开发者工具链的渠道打击,直接对标 Cursor 和 Claude Code。多智能体并行工作树和 Skills 系统是实打实的机制,不是包装词。扣一点分是因为正文没提定价和底层模型名,Linux 版也只说‘很快推出’没给确切日期,实际交付和成本都还有变数。

FT · 科技

Anthropic 投资人押注 2 万亿美元估值,准备冲击史上最大 AI IPO

FT 引述知情人士消息,Anthropic 的 IPO 目标估值接近 2 万亿美元。它上一轮私募估值约 1200 亿美元,IPO 定价相当于直接翻了十几倍。正文没披露发行规模、时间表和承销商。我会先打个折——从私募到公开市场跳这么多,得有 S-1 文件里的营收和利润率数据才撑得住,现在先别太激动。

推荐理由:FT 独家:Anthropic 的 IPO 目标估值接近 2 万亿美元,比上一轮私募估值 1200 亿翻了十几倍。这是 AI 行业有史以来最高的 IPO 定价锚点,冲击力够大。没给 95 分以上是因为正文没披露营收、利润率或 S-1 文件数据,2 万亿目前只是投资方预期,缺硬数字支撑,先别太激动。

彭博科技

彭博社消息:Anthropic 正洽谈以约 60 亿美元收购 AI 初创公司 Decart

彭博社援引知情人士称,Anthropic 打算花大约 60 亿美元买下以色列 AI 公司 Decart。Decart 去年才成立,团队大概 50 人,主要做 AI 基础设施和模型训练优化。如果成了,这会是 Anthropic 至今最大一笔收购,目的很明确——跟 OpenAI、Google 抢基础设施方面的人才。不过,报道没透露谈判现在到了哪一步、是现金...

推荐理由:彭博独家消息,Anthropic 史上最大收购,金额和标的都够硬。没给到 85 分是因为正文没披露谈判进展和 Decart 具体技术细节,信息有缺口。

Computing Life · Share · 鸭哥调研

编程 Agent 换形态,抢的都是同一件东西:执行数据

DeepSeek 开始招 Agent Harness 产品经理,说明它正在补一个空位:没有自己的编程工具运行环境。之前它只卖模型接口,把工具端交给第三方,但这样拿不到用户在真实编程场景里的行为数据——模型输出了代码,但用户怎么改、哪里报错、改了几轮才跑通,这些细节都留在第三方工具里。LangChain 的测试显示,同一个模型有没有针对性的运行环境配置,...

推荐理由:一篇用招聘动作和测试数据把产业逻辑讲清楚的分析。DeepSeek 招 Agent Harness 产品经理这件事本身不大,但作者把它和 LangChain 的 10-20 个百分点性能差距、Codex 做桌面端串起来,点出模型厂抢的不是工具市场,是用户改代码、修 bug 的行为数据。判断都挂在事实和数据上,没有吹概念,对从业者来说信息密度够、可读性强。按政策,观点分析类文章打 78-84 分段的低区,78 分合理。

Computing Life · Share · 鸭哥调研

Anthropic 烧了 3100 万 token 搜黎曼猜想,真正的信号在搜索架构

Anthropic 用未发布的 Claude 把黎曼 zeta 函数零点在临界线上的比例下界从 41.6% 推到了 67.2%,离证明黎曼猜想还差得远。真正值得看的是搜索过程:两次 Claude Code 会话烧掉 3100 万输出 token,第一轮 650 个想法全部失败,但留下了一份记录 106 条局部存活路线的台账,标明了每条路卡在哪、重新打开...

推荐理由:Anthropic用未公开模型做数学搜索,3100万token的工程细节和敌对评审机制是真正的信号,不是纯PR。扣分是因为纯数学离产品落地还远,而且正文没披露模型名称和token成本。

FT · 科技

华尔街大行押注英伟达 AI 芯片能用六七年,比传统服务器折旧年限更长

高盛、摩根士丹利和摩根大通在财报里把英伟达 AI 芯片的折旧年限定在 6 到 7 年,而传统服务器硬件一般是 4 到 5 年。他们的理由是:即便下一代芯片发布,现款芯片算力依然够用,可以转去做推理(也就是让模型上线回答问题)或者租出去。这更像是一种财务上的乐观假设,而不是技术上的实测结论。文章没有提到英伟达或审计机构对这些折旧年限的正式表态,所以这个“...

推荐理由:这篇FT的稿子抓到了一个被忽略的财务信号:大行在用折旧表表达对英伟达芯片长线价值的乐观。有具体数字和具名机构,不是空谈。我会先打个折——文章没拿到英伟达或审计方的正式确认,所以这个“6到7年”目前只是银行单方面的会计判断,别急着当技术定论。但作为行业风向标,它比很多技术博客更直接地反映了市场对算力资产贬值的真实预期。

AI HOT 精选

Claude 浏览器侧边栏升级为 Cowork 会话,跨设备接着干活

Anthropic 把 Chrome 扩展的侧边栏直接变成了一个 Claude Cowork 会话。现在你在浏览器里让 Claude 做的事,比如打开多个供应商后台抓发票数据填进表格,进度和上下文会跟着账号走,之后在桌面端、网页版或手机 App 上都能接着干。这解决了以前侧边栏会话独立、换个地方就得重来的问题。目前 Max 和 Team 套餐可用,Pr...

推荐理由:Anthropic 把 Chrome 侧边栏直接变成了 Claude Cowork 会话,跨设备进度同步是个实打实的 workflow 改进,不是换个皮。分数定在 78 是因为目前只开放给 Max 和 Team 套餐,Pro 用户还得等几周,覆盖面暂时有限,所以没往上拉。

TechCrunch · AI

亚马逊默认拿 Twitch 主播内容训 AI,主播得自己手动关掉

Twitch 更新政策,默认允许母公司亚马逊用主播的直播录像和音频训练生成式 AI 模型。Twitch 首席产品官 Mike Minton 在直播里回应质疑时直接说:“如果改成主动加入,根本没人会加入,这是实话。”主播需要自己去后台手动退出,很多人可能压根不知道这回事。文章没说明这些数据具体用来训练亚马逊的哪个模型,也没提会不会分享给第三方。

推荐理由:Twitch 把训练数据改成默认允许,CPO 还公开说主动加入根本没人会来,三个维度都打中了。我会先打个折,因为文章没说明这些数据具体用来训练亚马逊哪个模型,也没提会不会分享给第三方——关键信息缺了,所以分数没给更高。

Hacker News 首页

SQLite 一个潜伏了 15 年的 WAL-Reset 数据竞争漏洞,被 Antithesis 工程师用手机在 15 分钟内复现了

SQLite 3.51.3 修复了一个从 2010 年就存在的 WAL-Reset 数据竞争漏洞,这个漏洞会导致已提交的写入丢失。Tailscale 为了排查它花了六个月,期间还专门搭了新的日志管道和调试工具。Antithesis 的工程师 Carl Sverre 在休假时看到这个消息,用手机指挥 AI 助手给有漏洞的 3.51.2 版本加了断言,写了...

推荐理由:SQLite 3.51.3 修了一个藏了 15 年的 WAL-Reset 数据竞争漏洞,最坏情况下已提交的写入会直接消失。Tailscale 为了抓这个 bug 花了六个月,还专门搭了新的日志管道和调试工具。Antithesis 的工程师 Carl Sverre 在休假时看到消息,用手机指挥 AI 助手给有漏洞的 3.51.2 版本加断言、写测试,快速复现了问题。这件事对 AI 从业者的看点在于:一个底层基础设施的静默数据损坏 bug,靠确定性模拟测试和 AI 辅助调试才被揪出来,说明关键依赖的验证链路仍然很脆弱。正文没披露漏洞在生产环境造成的实际...

Hacker News 首页

Zed 发布 Delta:一个让开发者与 AI 结对编程、实时审阅代码的多人协作环境

Zed 今天推出了 Delta 的私测版。它把代码和讨论放在同一个实时协作的线程里,你可以直接在任意一行代码、差异对比或聊天消息上写评论,AI 代理就在旁边解释或修改它生成的代码。DeltaDB 会把工作目录和对话同步到本地、云端和浏览器——浏览器版是把完整的 Rust 应用编译成 WebAssembly 跑的,不是阉割版。目前先接入了 Claude ...

推荐理由:Zed 发了 Delta 私测版,把 agent 协作和代码审查揉进一个实时线程里,交互模型挺新鲜。DeltaDB 的浏览器版用 Wasm 跑完整 Rust 应用,技术上有点意思。扣分是因为现在还只是邀请制,没公开可用,也没用户反馈,实际好不好用不知道。

TechCrunch · AI

AI 编程公司 Cognition 三个月估值又要翻倍,传正谈 400 亿美元新融资

Cognition 今年 5 月刚拿了 10 亿美元,估值 260 亿,现在又传出在跟投资人谈新一轮,估值直接跳到至少 400 亿美元。消息源头是彭博社,说这次涨价的底气来自年化收入跑到 10 亿美元。但我会先打个折——三个月前他们老板 Scott Wu 自己说的数字是 4.92 亿美元,一个季度翻倍,文章没解释钱是怎么多出来的,这点先别太激动。他们的...

推荐理由:Cognition估值三个月从260亿跳到400亿,年化收入号称翻倍到10亿美元,但文章只引了彭博社一个信源,老板之前自己报的数是4.92亿,这个收入跳涨没给任何拆解,先别全信。对AI从业者来说,这组数字是判断AI编程赛道资本泡沫程度的关键参照,所以给了78分,没再高是因为信息缺口明显。

AI HOT 精选

AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的拉取请求

AutoGPT 项目现在超过 60% 的拉取请求来自 AI 工具。维护者 Reinier van der Leer 在仓库里放了一个 AGENTS.md 文件,给 AI 贡献者立规矩,还加了技能门控:只有通过代码格式检查和单元测试的 AI 代理才能提交代码。垃圾 PR 数量大幅下降,但正文没披露有多少人类贡献者被误拦了。

推荐理由:AutoGPT 维护者的一手经验,有硬数字(60% AI PR)和两套可复现的机制。缺点是正文没披露多少人类贡献者被误拦了,而且只是单个项目的案例,能不能推广到别的项目还不好说。

TechCrunch · AI

AI 安全争议升温,三位大佬在 Ai4 大会上为开放模型站台

Geoffrey Hinton、李飞飞和吴恩达在 Ai4 大会上同台,三个人对具体怎么监管意见不一,但都反对让少数几家大公司垄断 AI。Hinton 还是担心 AI 可能带来生存风险;李飞飞和吴恩达则强调,开放权重模型(也就是把模型参数公开、允许自由下载使用)能推动创新和竞争。不过文章没写他们到底提出了哪些具体的政策方案,只记录了各自的立场。

推荐理由:三位 AI 先驱同台反对垄断,话题本身重要,但文章更像会议记录,没有具体提案或新证据。我会先打个折:重要性和相关性都到位,知识增量偏弱,刚好卡在 featured 门槛上。

Hacker News 首页

Grok 4.6 追平 GPT-5.6 Sol,靠更低成本在智能体任务上领跑

Grok 4.6 在 Artificial Analysis 的智能指数上拿了 61 分,比上代高了 5 分,和 GPT-5.6 Sol 打平,只比 Claude Opus 5(63 分)和 Claude Fable 5(62 分)低一点。它最亮眼的是智能体任务:在模拟真实知识工作的 GDPval-AA v2 测试里 Elo 分达到 1753,仅次于 ...

推荐理由:Grok 4.6 在第三方基准上和 GPT-5.6 Sol 打平,智能体任务分尤其亮眼,成本优势也摆在那里。没给更高分是因为这只是一家评测机构的数据,不是官方发布,而且从 4.5 到 4.6 只隔了一个月,需要更多独立验证才敢全信。

Hacker News 首页

Lovable 拿了 4 亿美元 C 轮,估值冲到 133 亿,想做成普通人经营生意的软件工厂

Lovable 刚宣布完成 4 亿美元 C 轮融资,估值 133 亿美元,由 Menlo Ventures 和 EQT 的基金领投。这家公司做的是 AI 应用搭建平台,让不会写代码的人也能靠描述想法直接生成软件。从 2024 年 11 月上线到现在,用户已经建了超过 6000 万个项目,用 Lovable 搭出来的应用每月总访问量超过 9 亿次。近八成...

推荐理由:Lovable 的 C 轮是 AI 应用搭建领域迄今最大的一笔融资,133 亿估值和 6000 万项目数够得上 featured。没给更高分是因为这是公司自己发的公告,数字未经审计,而且正文没披露营收和付费用户数,我会先打个折。

Hacker News 首页

DeepSeek V4 Pro 0813 上架 OpenRouter,输入每百万 token 0.435 美元

DeepSeek 把 V4 Pro 的正式版(GA)挂上了 OpenRouter。这是个超大规模的混合专家模型,上下文窗口能塞进 100 万 token,差不多是一整套三体三部曲的量。价格定在输入 $0.435/1M、输出 $0.87/1M,在目前的大模型里算便宜的那档。不过现在只有一个供应商在跑,OpenRouter 收到请求直接转发,没得选路。页面...

推荐理由:DeepSeek V4 Pro 正式版悄悄上了 OpenRouter,100 万 token 上下文和 $0.435/1M 输入价是这次能确认的新信息,对从业者有直接参考价值。没给到 85 分是因为信息源只有 OpenRouter 页面,缺少官方公告和独立评测,验证链条还差一环,所以稍微压了一点分。