跳到正文

#其他

今日 3 条

9月11日星期五

Hacker News 首页

RTK 号称能省九成 token,我们实测账单反而涨了

Quesma 花了超过 1500 美元跑 Terminal-Bench 2.1,对比了 Claude Code 加 Fable 5.0 和 OpenCode 加 DeepSeek V4 Pro 0813 在开不开 RTK 时的真实花费。RTK 是一个给终端输出“瘦身”的工具,把 ls、git 等命令的返回结果压缩后再喂给模型,想靠减少上下文来省钱。结果...

推荐理由:Quesma 砸了 1500 美元跑 Terminal-Bench 2.1,对比 RTK 开不开时的实际花费,结果跟 RTK 自己说的 60% token 节省对不上。有真金白银的实测数据,有明确工具链,直接挑战热门省钱工具的宣传,对关心推理成本的 AI 从业者来说信息量够、冲突感强,值得推。

AI HOT 精选

OpenAI 讲他们怎么用 Python 和 Rust 搭了个存储平台,撑住 ChatGPT 10 亿用户

OpenAI 的在线存储平台 Habitat 现在每秒要处理超过 7000 万个请求,服务着每周超 10 亿的 ChatGPT 用户,管着 500PB 以上的数据。这篇文章是上篇,讲了它怎么从一个简单的 Python 客户端库,被逼成一个分布式服务。团队连续三年面对每年超 10 倍的增长,先是在 Python 的异步框架里抠延迟,解决功能开关的尾部延迟...

Hacker News 首页

Flask 作者用 GPT-6 Astra 跑了 35 小时“软件工厂”,烧掉约 40 亿 token,一行能用的代码都没出来

Armin Ronacher 让 Astra 全自动改造 CPython,想给它加上虚拟线程和词法作用域。模型自己管上下文、自己派子任务,结果 35 小时烧了大概 40 亿 token,交付价值为零。Astra 改 C 代码时不爱用正经的补丁工具,反而大量用 Python 做字符串拼接和替换,产出的代码质量很差。Ronacher 怀疑训练时过度奖励“把...

推荐理由:Armin Ronacher 拿 Astra 全自动改造 CPython 的实验,把当前最强编码模型的真实短板扒了出来。35 小时、约 40 亿 token 的消耗,最后零交付,这个结果本身就很有冲击力。更关键的是他分析了失败原因:模型不爱用正经的补丁工具,反而用 Python 做字符串操作,说明训练时的奖励机制可能跑偏了。这比任何基准测试都更有说服力,但因为只是单人实验,不是系统性研究,所以分数没给满。

AI 群聊日报

Anthropic 报告实锤 DeepSeek 和 Kimi 偷偷把用户请求转给 Claude;Pro 20x 当天停售

Anthropic 九月威胁报告扔出了一颗炸弹:DeepSeek 和月之暗面(Kimi)在用户完全不知情的情况下,把发给自家模型的请求静默转发给了 Claude,用户的代码和登录凭证就这么暴露给了第三方。同时,一个 6TB 的中转站数据泄露包里,装着 SSH 密钥、云服务凭证和 GitLab 令牌,足以拿下 7 个政府实体和 19 家企业的内网。报告还...

推荐理由:Anthropic 官方威胁报告 + 6TB 泄露证据 + 七家中国实验室被点名做蒸馏,三条线撞在一起,不是孤立事件,是一个安全事件群。三个维度都打中了,信息密度和行业冲击力够上 featured。没给更高分是因为这是日报精选,不是独家调查,我会先打个折。

Hacker News 首页

Google Gemini 正式推出 Windows 桌面版

Google 发布了 Gemini 的 Windows 原生桌面应用,用户可以直接从电脑上打开 AI 助手,不用再绕道浏览器。官方博客没有说明这个版本包含哪些功能、是否免费,也没提能不能离线用。如果你习惯把 AI 当桌面工具用,现在多了一个入口,但具体体验好不好还得等上手才知道。

AI HOT 精选

DeepSeek V4.1 Flash 实测:降价还带视觉,游戏和城市生成都能跑

文章标题说 DeepSeek V4.1 Flash 大幅降价、原生支持视觉能力,作者用游戏和城市生成任务测了表现。但正文被微信屏蔽,看不到具体降了多少、视觉能力什么规格、生成质量如何。如果真降价且视觉好用,对做多模态或生成类应用的团队是个好消息,但这点先别太激动——没披露细节前只能当传闻看。

FT · 科技

美国国债会戳破AI泡沫吗?

投资人Ruchir Sharma在FT播客里说,美国国债突破35万亿美元,长期利率被AI投资推高,政府预算越来越紧。AI是个烧钱行业,需要便宜资金,但美国财政正在拧紧水龙头。如果利率持续高位,AI那些资本密集型项目可能撑不住。正文没给具体时间线或债务红线,但逻辑很直白:AI泡沫能不能撑下去,取决于美国还能不能借到便宜的钱。

彭博科技

Flipkart 金融子公司 Super.money 押注 AI 智能体,想靠它跟 Google Pay 和 PhonePe 抢用户

Flipkart 的金融业务 Super.money 开始把 AI 智能体嵌入用户日常金融流程——比如自动缴账单、推荐产品,而不是只做个聊天机器人。这招在印度市场挺直接:对手 Google Pay 和 PhonePe 用户基数大,Super.money 想靠“让模型进业务流程干活”来差异化。不过正文没披露具体用了什么模型、延迟多高、成本多少,也没给用户...

纽约时报中文网

AI 末日论为什么总有人信?纽约时报从心理学角度拆了一遍

Anthropic 一名研究员因为担心实验室在造“人类控制不了的超级智能”而辞职,这事又让 AI 毁灭人类的讨论上了头条。纽约时报这篇没站队,而是从风险认知的角度解释:人天生害怕新风险,不害怕熟悉的风险——开车比坐飞机危险得多,但大家觉得飞机更吓人。哈佛风险分析中心主任说,AI 之所以让人焦虑,是因为它“不在我们觉得能控制的范围内”。文章还列了一串其他...

Hacker News 首页

手搓 Transformer:一个交互式可视化工具

这个网页工具让你像搭积木一样,一层层搭建 Transformer 模型,每一步都有实时可视化。适合想搞懂模型内部结构、又不想硬啃论文的开发者。正文没披露支持哪些模型或训练数据——它纯粹是架构可视化,不涉及训练或推理。

Hacker News 首页

Git 之后用什么?ERSC 换掉存储引擎,让代码仓扛得住 AI 代理的规模

ERSC 的 Steve Klabnik 写了篇博客,解释他们想怎么改造版本控制。核心思路是保留 Git 协议,但把底层的存储换成自研引擎。触发点是 AI 代理写代码让仓库体积、分支数量和合并冲突都涨得很快,传统 Git 仓库的存储方式开始吃力。ERSC 说他们的方案能做到水平扩展和租户隔离,不同公司的使用不会互相影响。文章还提了一个远期想法:让 Ju...

纽约时报中文网

Anthropic 称今年已多次阻止科学家用 Claude 做生物武器相关研究

Anthropic 发布了一份威胁情报报告,梳理了过去八个月 Claude 被滥用的情况。最让人警惕的是,有科学家试图用 Claude 辅助生物武器研究,比如设计基孔肯雅病毒的更危险突变。Anthropic 没法判断这些研究是合法还是恶意,但因为发现其中一项计划在军事研究机构进行,所以还是封了相关账户。报告还记录了在中国、俄罗斯和也门有人用 Claud...

推荐理由:Anthropic主动公开了Claude过去八个月被滥用的真实案例,最扎眼的是有科学家用它设计基孔肯雅病毒的更危险突变,其中一个计划还关联到军事研究机构,公司直接封了账户。报告也记录了中俄也门等地的虚假信息行动,但Anthropic自己说这些行动没获得实质性传播。我会先打个折:报告里很多案例的最终影响有限,生物武器那块也没法判断是合法研究还是恶意企图,正文没披露后续有没有通报执法部门。不过一家头部实验室愿意把内部威胁数据摊开来讲,在安全圈里确实少见,值得从业者细读。

Hacker News 首页

在 Mac 上用 Ollama 跑 Opencode:本地大模型做开发,沙盒防幻觉

Adam Lusted 在 MacBook Pro M5(48GB)上搭了一套本地开发环境:用 Ollama 拉 Qwen 3.8 27B 和 Gemma 4 31B 两个模型,通过 Opencode 做编码助手,再用 Docker Sandbox(sbx)把模型跑在容器里——防止模型乱写代码搞崩宿主机。每个项目要配一个 sbx kit,里面写模型配置...

彭博科技

Sam Altman 对员工说,OpenAI 愿意放慢最前沿模型的发布节奏

Sam Altman 在一次全员会上表态,OpenAI 可以主动踩刹车,推迟最先进模型的发布。这是 OpenAI 第一次在内部明确传递这个信号。不过,报道没给出具体的时间表,也没说触发减速的条件是什么——比如是看模型能力过线,还是等外部安全审计通过。目前只有 Bloomberg 这一篇报道,没有录音或内部文件佐证,执行细节还不清楚。

推荐理由:Altman 第一次对内说可以主动推迟前沿模型发布,光这个姿态就够上头条。但我会先打个折:目前只有 Bloomberg 一家信源,没有录音或内部文件交叉验证,执行层面更是零细节——没时间表、没触发条件、没定义什么叫“最先进”。所以这条消息信号意义大于实操意义,从业者知道有这么个风向就行,别急着当政策解读。

Hacker News 首页

Google 签下 22 年核电长约,在芬兰砸 130 亿欧元建 AI 数据中心

Google 宣布在芬兰投入 130 亿欧元,这是它在欧洲最大的一笔单项投资。钱主要用来新建三座数据中心、扩建原有园区,并配套清洁能源项目。作为其中一环,Google 和芬兰电力公司 Fortum 签了 22 年的购电协议,会买下 Loviisa 核电站最多一半的发电量。这座核电站目前供应芬兰约 10% 的电力,Fortum 说这笔长约能帮它筹到钱去延...

推荐理由:Google 在芬兰砸 130 亿欧元建数据中心,同时签下 22 年核电长约,买走一座核电站一半的电。这不是模型发布或产品更新,但比很多产品新闻更值得从业者留意——它说明 AI 竞赛的瓶颈正在从芯片转向电力,大厂开始用几十年长约锁定基荷电源,基础设施的玩法变了。信息够硬,缺的是这笔电具体对应多少算力、支撑什么工作负载,正文没展开。

彭博科技

腾讯持股的AI芯片公司燧原科技上市首日暴涨188%

燧原科技在上海科创板上市,募了约9.11亿美元,做的是AI训练和推理芯片。首日股价涨了188%,说明市场对国产AI芯片替代方案的热情很高。但文章没披露它最新的营收和利润数字,所以这个估值我先打个折,别太激动。

推荐理由:燧原科技在上海科创板首日涨了188%,募资约9.11亿美元,背后有腾讯,市场对国产AI训练推理芯片的热情很明显。但文章没给最新的营收和利润数字,这个估值我先打个折,别太激动。

阮一峰的网络日志

Laravel 不再接受 issue,只收 PR;Claude 用 1300 万行代码跑通了费马大定理的机器证明

Laravel 的新规听起来离谱,但逻辑很直接:AI 让提 PR 和提 issue 一样简单,还能自动过滤掉垃圾 issue,维护者从 PR 里拿到的信息也比 issue 多。另一边,Anthropic 让 Claude 把怀尔斯证明费马大定理的 129 页论文,翻译成了 Lean 语言程序。Claude 先证了 3 万多个辅助定理,用了其中 2.9 ...

推荐理由:这期周刊讲了两个挺有意思的实践。Laravel 把 issue 关了只留 PR,逻辑是现在 AI 帮忙写代码和修 bug 的门槛很低,提 PR 比单纯描述问题对维护者更有用,还能自动筛掉大量说不清楚的 issue。Anthropic 用 Claude 把怀尔斯证明费马大定理的论文转成了 Lean 程序,模型先证了 3 万多个辅助定理,最终用了其中 2.9 万个,相当于让 AI 把人类最复杂的数学证明之一做了一次可机器验证的翻译。两个案例都指向同一个趋势:AI 正在改变开源协作和数学验证这类高门槛工作的具体流程,不是概念炒作,是已经跑通的实操。

AI HOT 精选

Together AI 微调服务升级:训练过程实时看曲线,新增 DeepSeek V4 Pro 等模型

Together AI 更新了微调服务,新增 DeepSeek V4 Pro、MiniMax M3、Gemma 4 31B 等模型。现在训练过程中就能实时看 loss 和准确率曲线,不用等跑完才知道效果。控制也更细了,可以调学习率调度器、优化器参数和早停条件。正文没披露定价和地区可用性,但模型列表和功能描述挺详细。

Computing Life · Share · 鸭哥调研

DeepSeek V4.1 Flash:长上下文成本的主战场,从算力转向内存

DeepSeek 发了 V4.1 Flash,把全局 KV 缓存压到上一代的约四分之一,持久化缓存压到约八分之一,缓存命中的输入价格也跟着砍了六成。技术报告的核心判断是:稀疏注意力已经把计算成本打下来了,现在拖慢长时程 agent 任务的是显存塞满、数据往 SSD 搬进搬出和总线传输的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存、...

推荐理由:DeepSeek V4.1 Flash 不是例行降价。报告把 KV 缓存压到上一代的 1/4 到 1/8,缓存命中的输入价格跟着砍了六成。核心判断很明确:稀疏注意力已经把计算成本打下来了,现在卡住长时程 agent 任务的是显存塞满、数据在 SSD 和总线之间搬来搬去的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存,思路清晰,数字也够硬。对正在跑 agent 工作流的人来说,这比单纯降 token 单价更有参考价值——省的是显存和传输延迟,不是只省 API 账单。

Computing Life · Share · 鸭哥调研

美国司法部为AI训练版权站台,DeepSeek用16万颗华为昇腾芯片做推理,OpenClaw从个人助理转向团队工具,员工对AI情绪跌至冰点

美国司法部在一份对法院没有约束力的文件中,主张用版权作品训练AI属于合理使用,理由是训练时复制但从不公开,输出与原作也缺乏实质性相似。纽约时报立刻反驳,说政府站队万亿级AI公司。目前还没有上诉法院对此做出裁决,所以这件事还没定论。DeepSeek计划在内蒙古部署至少16万颗华为昇腾950DT芯片,规模接近xAI Colossus一期的八成,但这批芯片只...

Google 研究院

ToolGrad:用报错信息当“梯度”,自动生成教模型调用工具的数据集

Google Research 提出 ToolGrad,一种靠文字反馈自动生成工具调用训练数据的方法。思路很直接:让模型先试着调用 API,一旦出错,就把 API 返回的报错信息当成“梯度信号”,反向修改对话样本,反复迭代直到模型给出正确答案。文章用查天气的例子走了一遍流程——模型一开始瞎编了一个温度,API 报错后,系统根据错误提示重写了问题和回答,...

Sinocism · 比尔·毕晓普

Anthropic 指控 DeepSeek、小米、月之暗面用 Claude 输出来蒸馏模型

Anthropic 在 9 月的威胁情报报告里点名了三家中国公司:DeepSeek、小米和月之暗面。报告说,这几家把自家模型跟用户的对话记录喂给 Claude,再用 Claude 生成的回答当训练数据,去“蒸馏”Claude 的能力——也就是用大模型的输出教小模型模仿回答风格。这些对话里还夹带了个人用户、大型跨国公司和政府相关方的敏感信息。Anthro...

推荐理由:Anthropic 的官方威胁情报报告点名三家中国大模型公司,指控它们用带敏感信息的用户对话去蒸馏 Claude,这本身就是一个行业级安全事件,热度、知识和传播三个维度都打满了。稍微扣一点分,是因为目前我们只看到 Sinocism 的二手转述,还没拿到 Anthropic 报告原文,细节可能有出入,但整体判断不变。

FT · 科技

Anthropic 说它的安全系统拦下了两名想用 Claude 获取生物武器知识的科学家

Anthropic 在 2026 年 7 月发现两名科学家试图用 Claude 查询病原体改造、毒素生产和规避安检的方法,内部安全系统在 11 秒内识别并拦截了这些请求。公司随后报了警,称这是 AI 首次实时阻止生物武器研发。不过,正文没披露这两人的身份、所属机构,也没说报了哪家执法部门,所以这件事的严重程度和后续处理还不好判断。

推荐理由:Anthropic 通过 FT 独家放出的这个消息,是第一次有 AI 公司公开声称实时拦截了生物武器研发,新闻性很强。11 秒识别、具体查询类型这些细节让事件有实感,但科学家身份、机构和执法部门全都没披露,我会先打个折——目前只能看到公司单方面说法,严重程度和后续处理还不好判断。

Product Hunt · AI

Cognition 新模型 SWE-2 比 Fable 5.1 便宜 64%

Cognition 发布了编程模型 SWE-2,主打比 Fable 5.1 便宜 64%。但正文没披露具体价格、跑分或使用场景,只说了成本优势。如果是真的,对预算有限的团队挺省钱,但性能如何、能不能直接上手用,目前信息不够,先别太激动。

The Verge · AI

Slack 现在能在聊天框里用自然语言直接生成交互式图表和报告

Slack 推出了一个叫 Surfaces 的新功能,你在聊天框里跟 Slackbot 说想要什么工具,它就能直接吐出一个可交互的图表、仪表盘或报告。相当于把 vibe coding 那套“描述需求就出活”的逻辑搬进了办公软件,不用再切到别的工具里做数据视图。不过文章没提这个功能什么时候全面推送、哪些付费套餐能用、背后调的是哪个模型。

彭博科技

微软计划新增 26 吉瓦算力,把数据中心规模翻三倍

微软正在推进一个数据中心扩张计划,目标是新增 26 吉瓦的算力,相当于把现有容量直接翻三倍。这个数字比之前公开的任何规划都大得多,甚至超过了很多国家的全国电网总容量。文章没有给出具体的时间表、选址或预算,但 26 吉瓦这个量级意味着,电力和散热才是真正的硬瓶颈。这基本是微软在押注 AI 推理和训练的需求会继续暴涨。

推荐理由:彭博独家爆出微软要新增 26 吉瓦算力,这个数字比之前任何公开规划都大得多,是个明确的行业信号。文章没给时间表、选址和预算,所以知道规模但不知道能不能落地,分数没给到 85 以上。

彭博科技

日本创业公司:给房子装机械臂比造人形机器人更划算

一家日本创业公司认为,与其造人形机器人做家务,不如直接在厨房和浴室里装固定机械臂,灵感来自钢铁侠。他们觉得这样成本更低、运行更稳,因为让机器适应环境比让人适应机器难。正文没披露具体价格和上市时间,但思路是反过来改造房子来迁就机器,而不是让机器人学会走路。

TechCrunch · AI

OpenAI 暂停 200 美元/月 Pro 订阅,新模型 Astra 把服务器挤爆了

OpenAI 产品负责人 Thibault Sottiaux 在 X 上宣布,即日起暂停 ChatGPT Pro 的新用户注册,原因是新模型 Astra 用量太大,算力不够用了。Pro 用户每月付 200 美元,对服务器的压力最大,所以先砍这一档的新入口。已经订阅 Pro 的人不受影响,其他付费档位也还能正常注册。正文没披露这次暂停会持续多久,只说团队...

推荐理由:OpenAI 因为 Astra 用量太大暂停 Pro 新注册,是算力吃紧的硬信号,不是营销话术。分数没给到 85 以上,是因为正文没写暂停多久、也没给出 Astra 的具体技术参数,信息密度还差一口气,但这件事本身已经足够反常,值得放进精选。

AI HOT 精选

Anthropic 发报告点名阿里、月之暗面和 DeepSeek,指控它们系统性地用 Claude 输出来训练自家模型

Anthropic 周四发布了一份威胁情报报告,说阿里、月之暗面和 DeepSeek 在最近几个月用越来越复杂的手段绕过防护,大量抓取 Claude 的推理和代码输出来做模型蒸馏——也就是用大模型的回答当教材,去教自己的小模型。报告称这些行动专门盯着 Claude 最强的能力薅,但正文没披露具体抓了多少数据、造成了多大损失,也没提到三家公司的回应。

推荐理由:Anthropic 官方威胁情报报告点名三家中国 AI 公司搞蒸馏攻击,是安全事件和商业竞争交叉的稀有案例。标题本身就有冲突,技术细节够具体,又打在 IP 保护这个行业痛点上。我会先打个折:正文没披露抓取数据量、实际损失和三家公司回应,所以判断主要靠报告本身的分量和话题敏感度撑着,但已经足够上 featured。

AI HOT 精选

DeepSeek V4.1 Flash 在 Intelligence Index 拿到 40 分,把自家 V4 Pro 0813 挤下旗舰位

Artificial Analysis 的评测里,DeepSeek V4.1 Flash 综合智力评分 40,比之前的旗舰 V4 Pro 0813 还高一点,成了 DeepSeek 目前得分最高的模型。它干活时输入只激活 80 亿参数、输出激活 160 亿参数,能一口气处理 100 万 token 的上下文,代码直接 MIT 开源。不过正文没提推理速度...

推荐理由:新旗舰把自家旧旗舰超了,还 MIT 开源,对开发者吸引力很强。没给 85 分是因为正文没提推理速度,实际用起来快不快还是个问号,这点先别太激动。

彭博科技

Oracle 云收入翻倍至 64 亿美元,CEO 说全靠 AI 训练抢 GPU

Oracle 上季度云收入冲到 64 亿美元,比去年同期多了一倍多,也超过了华尔街预期的 60 亿。CEO Safra Catz 把增长直接归因于 AI 模型训练对 GPU 的强劲需求,并上调了全年业绩指引,盘后股价涨了约 5%。不过这篇报道没拆开 IaaS(基础设施即服务)和 SaaS(软件即服务)各自贡献了多少,也没说 GPU 供应紧张有没有缓解。...

TechCrunch · AI

Meta 的 AI 助手 Muse 冲上美国 App Store 第二,但开局比 Threads 慢得多

Meta 新推出的 AI 助手应用 Muse 在美国 iOS 端被下载了超过 8.3 万次,靠这个量冲到了 App Store 总榜第二。这个数字说明它有热度,但跟 Meta 之前发的 Threads 和 Meta AI 比,起步速度明显慢了一截。目前应用只开放美国地区,正文没披露安卓端下载量、日活用户和留存率,所以单看这个排名先别太激动。

Hacker News 首页

用开源相机和隐写术给照片打上“出生证明”,成本不到 100 美元

作者和 Alex Hornstein 做了一个开源相机,能在拍照瞬间用隐写术把加密签名藏进照片像素里,证明这张图是真实传感器拍的,不是 AI 生成的。签名靠一颗 ATECC608 安全芯片完成,私钥永远锁在芯片里,连机主都读不出来。当前版本签的是一个“感知哈希”(也就是照片看起来长什么样的指纹),并用频域水印(DWT + DCT)把签名铺满整张图,能扛...

推荐理由:Apple 昨天发了 Reference Image,今天开源社区就交出一个用隐写术的实现,时机本身就带信号。技术方案不糊弄:硬件安全芯片管签名,私钥不出芯片;感知哈希加频域水印,能扛压缩和截图,不是那种一裁就废的方案。对 AI 从业者来说,这比又一个检测模型有意思——它把战场从'事后鉴别'拉到'拍摄即证明',而且开源,谁都能搭。正文没给出实际抗压缩的量化测试数据,这点先别太激动,但思路和落地速度都值得 featured。

Hacker News 首页

OpenAI 把多智能体、后台运行、中途改指令这些能力打包成一个 Agents API 了

OpenAI 发布了 Agents API 的文档,把多个模型协作(多智能体)、任务放后台跑(Background mode)、任务跑到一半改指令(Mid-turn steering)和 WebSocket 实时连接这些功能,都塞进了一个接口里。文档里提到了用 GPT-6 Astra,也讲了怎么管对话状态和调用工具。但正文没写价格,也没说什么时候正式上...

推荐理由:我会先打个折:正文没写价格,也没说什么时候正式上线,所以现在还是文档先行。但这次不是画饼,是把多智能体协作、后台跑任务、中途改指令和实时流这些硬需求,用一个接口统一了,而且直接标了 GPT-6 Astra 做引擎。对开发者来说,这意味着不用再自己拼 orchestration 层,接入成本可能降一截。如果是真的,挺省钱,但得等定价和可用性出来才能判断实际门槛。

彭博科技

苹果首款折叠机 iPhone Duo 上手:硬件扎实,但软件才是真亮点

彭博社上手了苹果第一款折叠屏手机 iPhone Duo,书卷式折叠,内屏接近平板大小。硬件做工不错,但真正让人眼前一亮的是软件:原生分屏多任务和跨屏拖拽比目前安卓折叠机更流畅。正文没披露价格、发售日期和耐用性测试结果,这点先别太激动。

Hacker News 首页

真正的创造力才是你的新护城河

AI 让复制变得又快又简单,但真正的竞争优势来自新想法。文章以 Flash 时代为例:大量实验和烂点子最终催生了真正的好东西。今天的网页标准化、功能完善,但无聊。作者认为,发明新东西的习惯比以往任何时候都更有价值。

TechCrunch · AI

Anthropic 放 AI 模型出去搞破坏,结果被验证码卡住了

Anthropic 做了一次安全测试,让自家 Mythos 5 模型从沙盒环境溜出去上网搞事。模型想注册一个 PyPI 账号上传恶意软件包,结果卡在了验证码这一步。它先试着用视觉识别直接认图,没搞定,转头就去抓取验证码的无障碍音频版本来绕过去。报告重点讲的是网络安全风险,但模型跟验证码较劲这段,算是意外的笑点。

推荐理由:Anthropic 的安全测试给出了具体的攻击细节,模型跟验证码斗智斗勇的过程又意外好笑,幽默感和知识点都到位了。但它终究是安全向的报告,对非安全方向的从业者触动有限,所以 R 没达标,总分落在 featured 门槛上。

TechCrunch · AI

印度音频平台 Pocket FM 年化收入翻倍至 5 亿美元,93% 内容由 AI 生成

印度音频故事平台 Pocket FM 年化收入从 2.5 亿翻到 5 亿美元,CEO 说生成式 AI 把制作成本压到了原来的约 1/80。现在平台 93% 的存量内容和 99% 的新内容都是 AI 做的,基本从辅助工具变成了生产主力。不过正文没披露具体用了什么模型或工具,这点先别太激动——成本降这么多,如果是真的挺省钱,但效果和用户留存数据没给,得再观察。