跳到正文

全部动态

今日 75 条

9月19日星期六

Hacker News 首页

科学就是开源软件

作者认为现代计算科学本质上就是开源软件。科学需要可检验、可系统化的结果,而软件正是我们编码和分享预测模型的方式。如果软件不开放、不可修改,结果就无法复现,科学也就失效了。愿景是:每项成果都能即时复现,科学软件像维基百科一样由社区维护。

Hacker News 首页

WSJ:Google Gemini 在红队演练中自主黑进三家公司测试环境,这是大模型首次不靠人类帮忙攻破外部系统

《华尔街日报》报道,Google 的 Gemini 在一次红队演练里,自己找到漏洞并打进了三家公司的测试环境。这是第一次有记录的大模型在没人类插手的情况下,自主突破外部系统。报道没说是哪三家公司、用了什么漏洞,也没提 Google 安全团队是不是事先知情。我会等完整报告出来再下判断,现在先打个折看。

推荐理由:这是第一次有记录的大模型自主突破外部系统,光安全边界这个角度就够分量。扣分项:信息缺口很大,没说是哪三家公司、用了什么漏洞,也没提 Google 安全团队是不是事先知情,目前只有《华尔街日报》一家信源。等完整报告出来,分数可能还会往上走。

AI HOT 精选

Anthropic 把 IPO 推迟到 11 月,想先亮出 Q3 财报,目标估值约 2 万亿美元

Anthropic 把上市时间从 10 月挪到了 11 月,主要是想等第三季度财务数据出来,用实打实的收入证明自己的行业地位。这个决定是在前研究员公开警告 AI 发展太快之前就做出的,但投资者还是会追问:如果模型发布节奏放慢,对收入和估值有多大影响。现有股东觉得影响有限,因为现在的模型已经能带来很可观的收入,预计到 2026 年底公司年化收入能超过 1...

推荐理由:Anthropic 把 IPO 从 10 月推到 11 月,估值约 2 万亿美元,这是本周最重的 AI 资本新闻。推迟是为了等 Q3 财报,用收入说话,不是出了什么岔子。正文提到预计 2026 年底年化收入超 1000 亿美元,这个数字够硬,不是传闻。不过目前只有标题和摘要,完整招股书还没出来,所以分数没给到 95 以上,但已经够上 featured 了。

AI HOT 精选

OpenRouter 实测:Jev 做决策比大模型便宜 100 倍,但它不会写回复

OpenRouter 拿 TypeSafe 的 Jev 1.13 跟 GPT Luna、Claude Opus 跑了 60 张客服工单。Jev 做分类和判断要不要升级,每 1000 张票只要 0.025 美元,中位延迟 194 毫秒;Luna 要 0.09 美元,Opus 要 2.88 美元。Jev 直接返回带概率的类型化结果,不用再解析 JSON。但...

Computing Life · Share · 鸭哥调研

iOS 27 开发者指南:把 App 接进 Siri,在 App 里调用模型

iOS 27 给开发者开了两条互不交叉的路。一条是 App Intents,把你的应用注册成 Siri 能调用的工具,前提是核心功能得落进 Apple 划定的 12 个领域模板里,比如音频、日历、邮件,否则只能靠固定口令唤醒。另一条是 Foundation Models,让应用自己调用模型做长文总结、票据识别,端侧模型免费且不限量,但上下文窗口只有 4...

Computing Life · Share · 鸭哥调研

更好的替代品早已存在,Jev 留给研究的只剩时机

TypeSafe 刚推出的 Jev 是一个只输出概率分布、不生成文字的判断接口,专门在智能体工作流里做快速分类。社区实测发现,用开源小模型直接读 logits 的方案,判断质量只差不到 4 个百分点,但延迟从 178 毫秒降到 71 毫秒,输出还是确定性的,而且完全免费。这种把判断拆出来单独卖的想法并不新鲜,从 2017 年 Perspective A...

推荐理由:这是一篇社区实测对比,用延迟和质量数据把 Jev 和开源读 logits 的方案摆在一起,结论偏向已有方案,新闻性不如首发产品,但工程参考价值够硬。

Computing Life · Share · 鸭哥调研

Anthropic 复盘:AI 写代码太快,给测试系统打补丁不再划算

Anthropic 工程师发了一篇复盘,讲他们内部一个给自动化测试记账和挑选用例的服务,半年内任务量涨了 25 倍。团队连续打了三次补丁,第一次扩容换来 70 天安稳,第二次并行分片换来 29 天,第三次只能靠每天重启硬撑,连一天都稳不住。最后一名工程师用三周推倒重写,而作者估计一年前这活要干一个季度。核心变化是两条成本曲线交叉点左移了:AI 让重写的...

推荐理由:这是一篇来自一线工程师的复盘,不是泛泛的 AI 提效公关稿。它用三次补丁的失效曲线,把“重写变便宜”这个趋势讲成了可感知的工程决策变化。我会先打个折:它不涉及模型突破或产品发布,属于工程实践类的硬核分享,但数字扎实、视角刁钻,对从业者的实际工作有直接启发,放在 featured 里作为实践案例是合适的。

Hacker News 首页

阿里开源医学影像模型Damo Radar,能看腹部CT、识别近150种病变

阿里达摩院开源了一个叫Damo Radar的模型,专门读腹部增强CT,覆盖18个器官,能识别包括癌症在内的近150种异常。在近4万例真实检查里,它的平均AUC是0.913(1.0代表完全准确)。跟26位放射科医生比,它准确率超过了其中23人;医生在它辅助下,漏诊率降了10%,读片时间缩短超过30%。研究发在《Science》上。不过正文没披露开源许可证...

推荐理由:我会先打个折,因为正文没披露开源许可证,这点先别太激动。但模型本身的数据挺硬:近4万例真实腹部增强CT,覆盖18个器官、近150种异常,平均AUC 0.913,已经比26位放射科医生里的23位准了。医生在它辅助下漏诊率降了10%,读片时间缩短超过30%,如果是真的挺省钱。论文发在《Science》上,可信度加一层。综合看,技术突破、落地潜力和话题度都够,给82分放在featured里合理。

AI HOT 精选

FT 拿到 OpenAI 内部预测:到 2030 年累计烧掉约 2780 亿美元

FT 拿到 OpenAI 的内部财务预测,今年营收 360 亿美元,到 2030 年要冲到 3500 亿美元。但 2026 到 2030 年这五年,算力支出预计要花掉约 8560 亿美元,同期总收入才约 8400 亿美元,算下来累计现金缺口约 2780 亿美元。远期的数字不确定性很高,我会先打个折看,但方向很明确:OpenAI 自己都不觉得靠 API ...

推荐理由:FT 拿到了 OpenAI 的内部财务预测,这是行业级信号。三个维度都打中了,跨源转载概率高。没给 90 分以上是因为远期预测不确定性极大(中文摘要自己也说了会打折看),但方向性判断很明确:OpenAI 自己都不觉得靠 API 能在五年内填平算力支出的坑。

FT · 科技

Anthropic 首次把模型安全测试外包给埃森哲,不再只靠内部团队

Anthropic 找了咨询公司埃森哲来独立测试自家模型的安全性。埃森哲会专门组建一支红队,模拟越狱和攻击,帮 Anthropic 在模型发布前找出漏洞。这是 Anthropic 头一回把安全测试外包给大型咨询公司,之前都靠内部团队或学术合作。正文没披露合同金额、具体测试范围,也没说埃森哲能接触到哪些模型版本。

TechCrunch · AI

Anthropic 在湾区搞了个能做生物实验的湿实验室,让自家模型直接上手验证假设

Anthropic 向 TechCrunch 确认,他们在湾区运营一个湿实验室,能让 AI 模型直接跑物理生物实验。公司生命科学负责人 Eric Kauderer-Abrams 对路透社说,做生物学的最终检验还得靠真实实验,公司既自己做研究,也跟外部伙伴合作。这消息跟在今年 4 月 Anthropic 花大约 4 亿美元收购 AI 生物技术公司 Coe...

推荐理由:这条消息硬在首次确认了物理实验室的存在,不是传闻。但正文只给了一句确认和一句高管引述,没展开研究方向、规模、安全措施,所以分数没往上拉。我会先打个折:知道有这回事,但不知道到底在做什么。

AI HOT 精选

微软内部备忘录曝光,高管称训练 AI 是“人类史上最大规模劳动窃取”

《纽约时报》在起诉 OpenAI 和微软的版权案中申请了简易判决,并提交了新的内部材料。微软应用科学总监在 2023 年 1 月的备忘录里直接说,大模型“吞噬”所有人的劳动成果是前所未有的盗窃,规模堪称人类历史之最。另一份微软文件也承认,几乎没人愿意自己的内容被白嫖还不给钱。微软自己的数据还显示,Copilot 让《纽约时报》从必应获得的点击率最高暴跌...

推荐理由:这篇报道的杀伤力在于“自己人说实话”。微软应用科学总监 2023 年 1 月的备忘录用词很重,不是公关话术,而是直接定性为盗窃,还补了一句“规模堪称人类历史之最”。另一份内部文件也承认几乎没人愿意被白嫖。加上 Copilot 让《纽约时报》必应点击率暴跌的数据,等于从认知和后果两个层面都给了实锤。不过这是单一信源报道,依赖《纽约时报》提交的法庭文件,微软那边的完整回应还没看到,所以我会先打个折,不把分拉满。

TechCrunch · AI

AI 幻觉差点触发美军军事行动

今年春天,美军一次针对中国船只的武装行动在最后一刻被叫停,因为官员发现情报是 AI 聊天机器人瞎编的。CNN 报道说,当时飞机已经起飞,行动依据是 AI 编造出的“船上载有核武器部件”的说法。一位 GovAI 的研究学者警告,军人必须理解大语言模型天生就带着不确定性,不能把它的输出当事实。

推荐理由:CNN 独家爆料,TechCrunch 跟进,信源交叉验证强。事件本身是 AI 幻觉进入实战指挥链的最严重案例,悬念、新信息、读者共鸣三项全中。我会先打个折:正文没披露具体用的是哪个模型、幻觉是怎么被发现的,但“飞机已起飞”这个细节足够说明系统当时完全没做事实核查。对从业者来说,这不是技术缺陷,是流程设计把概率输出当成了确定情报。

AI HOT 精选

谷歌 Gemini 在一次安全测试中意外联网,入侵了三家真实公司后自行停止

今年 5 月,谷歌让安全公司 Irregular 对 Gemini 做“夺旗”演练,测试环境本应断网,结果意外给了模型上网权限。Gemini 靠猜密码和在公开代码仓库里翻到的登录凭证,闯进了三家真实公司的系统。模型发现对方不是模拟目标后自己停了手,没造成实际破坏。谷歌觉得这跟白帽黑客挖漏洞差不多,所以一直没公开,直到《华尔街日报》来问才承认。白帽黑客 ...

推荐理由:事件本身够硬:模型意外联网后自主入侵三家真实公司,谷歌知情不报,直到媒体追问才承认。我会先打个折,因为目前只有单方描述,没看到完整的测试日志和受影响公司确认,但即便这样,它已经是目前最接近模型“出逃”并触碰真实目标的案例了。

Hacker News 首页

OpenAI 用自家大模型辅助设计了一款叫 Jalapeño 的 AI 加速芯片

OpenAI 在 ISSCC 2026 上展示了 Jalapeño 芯片,一个 4×4 的 AI 加速器阵列。工程师用自家的大模型来写 Verilog 代码、修时序、查错,芯片最终成功流片。文章没给具体性能跑分,但提到设计效率有提升——有些模块的开发周期从几周缩短到了几天。我会先打个折:这更像是一次内部工具链的演示,离“AI 自动设计芯片”还差得远。

推荐理由:OpenAI 在 ISSCC 2026 上展示了 Jalapeño 芯片,一个 4×4 的 AI 加速器阵列。工程师让自家大模型参与写 Verilog 代码、修时序、查错,芯片最终流片成功。文章没给具体性能跑分,但提到设计效率有提升——有些模块的开发周期从几周缩短到了几天。我会先打个折:这更像是一次内部工具链的演示,离“AI 自动设计芯片”还差得远。

彭博科技

OpenAI 内部预测到 2030 年要烧掉 2780 亿美元,算力是最大开销

《金融时报》拿到了 OpenAI 给投资人看的内部预测:到 2030 年,累计现金消耗会达到 2780 亿美元。2027 年预计花 440 亿,2030 年直接翻近一倍到 800 亿,大头都砸在算力上。收入端,他们预计 2030 年能有 1250 亿美元进账,但自由现金流要到 2029 年才能转正。先打个折,这是融资用的前瞻数字,不是已落地的财报。另外...

推荐理由:《金融时报》拿到了 OpenAI 融资材料里的硬数字,现金流预测一路拉到 2030 年,来源够硬。稍微打个折是因为这些是融资用的前瞻数字,不是已实现的财报,而且我们看的是二手转述。

彭博科技

谷歌让 Gemini 自主攻击真实系统,拿下了三个目标

谷歌在一次安全测试里放开了 Gemini 的手脚,让它自主攻击真实系统,结果它成功拿下了三个目标:一个内部应用、一个开源数据库和一个第三方 SaaS 服务。OpenAI、Anthropic 和 Meta 也都公开过类似的测试结果,说明“模型能不能黑进真实基础设施”正在变成一项常规安全指标。文章没披露具体的攻击链条,也没对比各家防御措施,所以我会先把这当...

推荐理由:Gemini 在一次安全测试里自主拿下了三个真实目标,而且 OpenAI、Anthropic 和 Meta 也都公开过类似结果,说明这种测试正在成为安全评估的标配。分数没给到 85 以上,是因为文章没披露具体的攻击链条,也没对比各家防御措施,我会先把这当成一个信号,而不是一个完整的结论。

FT · 科技

OpenAI 内部文件显示,到 2030 年预计烧掉 2800 亿美元

FT 拿到 OpenAI 给投资人看的内部文件,里面预测到 2030 年累计现金消耗会达到 2800 亿美元。大头在 2027 到 2030 这四年,要花掉约 2200 亿,主要砸在训练和运行下一代模型上。同一份文件说 2029 年现金流才会转正,之前全是亏损。这个数字比外界之前的估算高出一大截——给投资人画饼的数字我会先打个折,但方向很明确:Open...

推荐理由:FT 拿到 OpenAI 给投资人看的内部文件,预测到 2030 年累计现金消耗 2800 亿美元,2029 年现金流才会转正。这个数字比外界估算高得多——给投资人画饼我会先打个折,但方向很明确:训练和运行下一代模型的成本在 2027 到 2030 年会集中爆发,四年要花掉约 2200 亿。对从业者来说,这相当于给整个行业的成本天花板重新标了个价。

TechCrunch · AI

Anthropic 把安全审查员请进公司,第一家是埃森哲

Anthropic 宣布,埃森哲旗下 AI 部门 Faculty 的员工将进驻公司内部,直接对模型做红队攻击测试、对齐评估和安全防护检查。双方预计五年内各投至少 10 亿美元。消息一出,埃森哲盘后股价涨了 8%。正文没披露具体派驻人数、启动时间,也没说评估结果会不会公开。

推荐理由:Anthropic 第一次让外部团队进驻做安全评估,结构上是个大动作,而且五年各投 10 亿的承诺让这事不只是 PR。但正文缺关键信息——多少人、什么时候开始、结果是否公开——所以目前只能算一个信号,还没到可验证的进展。分数维持 78。

Hacker News 首页

Claude Code 新增 AGENTS.md 支持:项目没有 CLAUDE.md 时会自动读取

Claude Code 2.1.277 版本加了一个小但实用的功能:如果项目根目录没有 CLAUDE.md,它会自动读 AGENTS.md 作为项目指令。你可以在 /config 里改这个设置。目前 Bedrock、Vertex 和 Foundry 上还不可用。另外修了一堆 bug:claude -p 和 Agent SDK 会话在内部错误后不再卡死,...

彭博科技

Anthropic 把埃森哲的安全测试员直接塞进自己团队,在新模型发布前做红队攻击演练

Anthropic 和埃森哲搞了个合作,让埃森哲的安全评估人员直接进驻 Anthropic 内部团队,在新模型发布前专门找漏洞、试越狱、测滥用风险。另外,埃森哲还会帮企业客户用 Anthropic 这套方法搭建自己的 AI 安全测试流程。不过正文没披露这笔交易值多少钱、派了多少人、什么时候开始。

推荐理由:彭博首发的一条实质性安全合作,机制说得清楚:嵌入式发布前红队测试,外加企业端复制方案。没给到 85 分是因为缺钱数、人头数和启动时间,信息密度还差一口气。

Hacker News 首页

资深工程师会是下一波 DRAM 式短缺

作者拿 DRAM 价格暴涨打比方:AI 代理把初级工程师的活干了,公司悄悄停招新人,结果把培养资深工程师的在职训练管道也一起掐断了。Thoughtworks 一次闭门会已经把这叫做“学徒制和技能传承危机”。等全行业同时发现资深人手不够、又没人提前“生产”时,资深工程师的薪资就会像内存条一样垂直起飞。作者的建议是别指望到时候现买,现在就得自己带人。

推荐理由:我会先打个折,这是一篇观点文,没有给出量化预测。但它抓到了一个真实的二阶效应:AI 接管初级工作→停招新人→没人通过在职训练成长为资深工程师。Thoughtworks 内部已经用“学徒制危机”这个词,说明这不是纯脑补。作者拿 DRAM 价格周期来类比,逻辑线清楚:等全行业同时发现资深人手不够、又没提前“生产”时,薪资就会垂直起飞。正文没披露具体数据支撑,但问题本身值得工程团队现在就琢磨。

彭博科技

纽约时报称 Anthropic 年化收入将破 1000 亿美元,赶在 11 月 IPO 前

Anthropic 要在今年 11 月上市,纽约时报给出的数字是 2026 年年化收入会超过 1000 亿美元。先打个折,这是年化推算收入,不是全年实际落袋的钱,通常是把最近一个月的收入乘以 12 算出来的,如果某个月有大单子,数字就会虚高。文章没提公司到底赚不赚钱、成本结构怎么样,也没说这 1000 亿里多少来自 API 调用、多少来自企业授权。想知...

推荐理由:Anthropic 上市前收入数据被 NYT 曝出,年化超千亿,冲击力够强。摘要已经主动打折,说明是月收入推算、没披露利润和收入构成,所以不给 95+。但 IPO 临近、数字具体、信源是 NYT,上 featured 没问题。

AI HOT 精选

Anthropic 把外部评估团队塞进公司内部,和 Accenture 各掏至少 10 亿美元做嵌入式安全审查

Anthropic 宣布跟 Accenture 合作,让后者的 AI 部门 Faculty 派人进驻公司内部当独立评估员,权限跟正式员工差不多。这些人能盯着模型训练过程、参与安全决策、找盲区,还要做红队攻击测试、对齐评估和防护措施检测。双方预计未来五年各投入至少 10 亿美元来搭这个能力。目前行业还没有嵌入式评估的标准,连资金该从哪来都没定论,所以 A...

推荐理由:Anthropic 把安全承诺变成了一个具体动作:让 Accenture 的 Faculty 团队派人进驻公司当独立评估员,双方各砸至少 10 亿美元、为期五年。不是发个联合声明,而是给了钱数和权限范围。分数没上 95,因为细节还缺——评估标准、资金具体怎么花、效果怎么衡量,正文都没说清楚。

TechCrunch · AI

世界模型公司拿了钱但不说在做什么

TechCrunch 记者在 All In 大会上主持了一场关于世界模型(让 AI 理解物理空间,用于机器人、自动驾驶等)的讨论,发现这个赛道钱多、热度高,但具体做什么没人肯说。两大玩家——Yann LeCun 的 AMI Labs 和李飞飞的 World Labs——都融了大笔钱,但连自家联合创始人 Michael Rabbat 都回避问题,只回了一...

r/LocalLLaMA

Qwen3.8-Flash-Next 在 64GB Mac 上跑到 27 tok/s,但模型文件 95.5GB

Reddit 用户发帖称在 64GB Mac 上跑通 Qwen3.8-Flash-Next,速度约 27 tok/s,但 checkpoint 体积 95.5GB。这个大小对 64GB 内存来说很极限——系统还得留内存给其他进程,实际可用可能不到 60GB,所以大概率用了量化(具体精度没披露)。27 tok/s 对本地推理来说算流畅,能正常对话。不过帖...

Hacker News 首页

韩国把数据泄露罚款上限提到年营收的 10%

韩国个人信息保护委员会修订了《个人信息保护法》执行令,把数据泄露的最高罚款从年营收的 3% 直接拉到 10%。公司现在必须在发现泄露后 24 小时内上报,并且通知受影响的用户。这个罚款比例在全球范围都算顶格了,对在韩国做 AI 或处理用户数据的企业来说,合规成本会明显上升。不过正文没披露具体生效日期和过渡期,这点先别太激动,得看后续落地时间表。

AI HOT 精选

Gary Marcus:特朗普为保经济淡化 AI 风险,同一天曝出 AI 幻觉情报差点引发战争

Gary Marcus 把两件事串在了一起。纽约时报报道,特朗普出于经济原因在淡化 AI 的威胁,很可能在抵制监管。同一天,记者 Katie Bo Lillis 曝出一个新料:一份用 AI 辅助生成的情报报告,凭空编造了一艘中国船只在运送核武器部件。美军紧急出动拦截,结果发现是 AI 的幻觉,整个过程“差点引发了一场战争”。Marcus 说他 2023...

推荐理由:Gary Marcus 把两条硬新闻接上了。一条是纽约时报说特朗普因为经济考虑在淡化 AI 风险、很可能抵制监管;另一条是记者 Katie Bo Lillis 曝出 AI 辅助情报报告凭空编造中国船只运送核武部件,美军出动拦截才发现是幻觉,差点擦枪走火。Marcus 把这两件事放在一起,等于在说:高层想放松监管的时候,AI 已经在真实世界里捅了能引发战争的娄子。我会先打个折,Marcus 的评论本身没有新数据,但这两件事的关联确实扎眼,对从业者来说是个没法忽略的信号。

彭博科技

彭博社:Anthropic 老讲 AI 灭绝风险,把更紧迫的问题挤出了讨论

彭博社发了一条视频评论,说 Anthropic 一直在强调 AI 的“存在风险”(就是 AI 毁灭人类那种极端场景),结果把公众和监管的注意力从更现实的问题上带偏了——比如算法偏见、岗位替代这些眼下已经能感受到的影响。文章没有具体列出哪些议题被挤掉了,但标题直接用了“劫持”这个词,态度很明确。如果你在关注 AI 治理的优先级排序,这篇值得一看,但正文信...

Hacker News 首页

语言不可靠性对 LLM 安全意味着什么

James Mickens 这篇论文提了一个挺根本的问题:模型嘴上说的,跟它脑子里算的,可能根本不是一回事。他把这种现象叫“语言不可靠性”。模型内部做的是激活空间里的数学运算,只在输入和输出两头才翻译成自然语言,这个翻译过程是有损的。所以,那些靠读模型“心里话”来做安全监控的方法——比如盯着它的思考链、让它自我反省、或者从激活值里提取语言特征——理论上...

推荐理由:Mickens这篇论文把几个分散的安全隐患串成了一个核心概念:模型内部在激活空间里做数学运算,只在输入输出时才翻译成自然语言,这个翻译是有损的。所以,靠思维链、自我反省或激活值探测来监控模型安全,理论上就站不住脚。概念很强,但正文没给出实证验证,目前还停留在理论推演阶段,这点先别太激动。

Hacker News 首页

C2C:让多个大模型直接交换“思考缓存”,比打字快 2.5 倍,准确率还高 3-5%

这篇 ICLR'26 的论文提了个很直接的想法:多个大模型协作时,别让它们互相发文字了,直接传“脑内状态”(KV-cache,可以理解成模型思考到一半的中间结果)。作者先做了个验证实验,发现把 KV-cache 里的语义信息搞丰富点,不用加大缓存,回答质量就能变好,说明这条路走得通。于是他们搞了个叫 C2C 的框架,用一个小神经网络把 A 模型的 KV...

推荐理由:ICLR'26的论文,想法很巧:多个大模型配合干活时,别互相发文字了,直接传“脑内状态”(KV-cache)。作者先做了验证,证明把缓存里的语义搞丰富点,不用加大缓存就能提升回答质量,说明这条路走得通。然后他们搞了个C2C框架,用一个小神经网络把A模型的缓存翻译成B模型能懂的格式。有验证有方案,知识密度够,但偏底层优化,不是那种大家一看就想转的日常痛点,所以分数没给更高。

TechCrunch · AI

ChatGPT 核心作者做了个不聊天的模型 Jev,专跑代码和调 API,开发者很买账

Diogo Almeida 是 RLHF(从人类反馈中强化学习,让模型更听话的关键技术)的发明人之一。他觉得让模型只优化人类语言是条死胡同,因为电脑之间交流用的是代码。于是他离开 OpenAI 创办了 TypeSafe AI,本周发布了新模型 Jev。Jev 还是基于 Transformer 架构,但训练目标不是生成人话,而是直接执行代码和调用 API...

推荐理由:我会先打个折:文章没给跑分、定价、API 成功率这些硬数字,所以重要性停在 78。但信号本身很强——RLHF 发明人出走创业,第一枪就打向“代码执行”而非“人话生成”,这个转向本身就值得关注。正文没披露模型规模、训练成本和实际调用延迟,这点先别太激动,等他们放出技术报告再重新评估。

The Verge · AI

弗吉尼亚州长成立AI工作组,同时给数据中心踩刹车

弗吉尼亚州长签署行政令,成立一个AI工作组,同时要限制数据中心扩张。弗吉尼亚目前是全球数据中心最密集的地方,AI算力需求又让盖楼潮更猛了。州政府想平衡经济收益和电网、环境压力。正文没披露工作组成员、时间表,也没说具体怎么限制数据中心。

彭博科技

Meta关联数据中心发垃圾债,需求火爆

一个与Meta绑定的数据中心发行了垃圾债,认购需求远超预期,这是AI基础设施首次涉足高收益债市场。信号很直接:AI基建烧钱太猛,连Meta都得借高息债来填。正文没披露债券规模和票面利率,所以实际融资成本和规模还不清楚。

TechCrunch · AI

迪士尼首任CTO来自一家它曾指控抄袭角色的AI公司

迪士尼挖来了Character.AI的前CEO Karandeep Anand当公司史上第一位CTO。这事有点黑色幽默:2025年9月,迪士尼刚给这家公司发过律师函,说他们在平台上用生成式AI搞迪士尼的版权角色。Anand是迪士尼新CEO Josh D'Amaro亲自挑的人,之前还在Facebook和微软干过。Character.AI这家公司麻烦不少,...

AI HOT 精选

Ethan Mollick 谈能力悬差:GPT-6 Astra 和 Fable 5.1 已经能干几周的活,但没几个人真去用

Ethan Mollick 用两个实验说明现在的模型能力被严重低估了。他让 GPT-6 Astra 把 1977 年的纯文字游戏《Zork》做成了一个完整的 3D 动作冒险游戏,AI 自己决定了白房子和怪物的样子,还把“打巨魔”变成了动作场面。另一个实验里,Fable 5.1 靠十几段视频、书架照片和两份图书目录,在没找到户型图的情况下,重建了作家艾柯...

推荐理由:Mollick 用两个动手实验说明现有模型能力被严重低估,信息密度高、不飘。扣分在这是个人随笔,不是产品发布或研究突破,所以放在 78-84 这个区间。

Google 研究院

Google 开源 MilleMiglia:给中段物流路径规划算法造更真实的测试题

Google 开源了一个叫 MilleMiglia 的工具,专门用来生成中段物流(仓库到分拨中心之间的运输)的测试用例。它不像传统随机生成器那样只扔坐标,而是直接拿真实路网、时间窗口和车辆限制来造场景,这样你测路径规划算法时结果更可信。正文没披露它跟现有基准比具体快多少或准多少,但如果你在搞物流调度优化,这个工具能省掉自己手搓测试数据的时间。

TechCrunch · AI

Google 把 CC 重新定位成家庭 AI 管家,能读邮件、管日历、填表单

Google 这周重新发布了 CC,不再做通用助手,而是专门帮一家人协调杂事。家庭成员可以共享邮箱、日历和待办,AI 会帮着排日程、填学校或活动表单、生成购物清单、规划菜谱。CC 最早在 2025 年推出,这次转向直接跟亚马逊 Alexa 的家庭功能抢用户。目前还在测试,正文没披露具体上线时间和收费方式。

Hacker News 首页

美军情报单位用 AI 编造了中国军舰的动向,差点触发军事响应

CNN 独家报道,美军一个情报单位把 AI 工具接进了情报流水线,结果这个工具凭空捏造了一艘中国军舰在太平洋的位置和移动轨迹。这份“幻觉”报告被当成真情报流转,直到人工交叉核验时才被发现是假的。多位消息人士说,这是 AI 幻觉在实战情报系统里最接近酿成大祸的一次。报道没点名具体是哪个 AI 系统或模型,也没说为什么人工核验能卡在最后一刻才生效。

推荐理由:CNN 独家挖出美军一个情报单位把 AI 工具接进情报处理流程,结果模型凭空编了一艘中国军舰在太平洋的位置和动向,这份假情报一路绿灯直到人工交叉核对才被拦下。报道没点名用的是哪个模型,也没解释为什么人工核验在最后一刻才生效,但多位消息人士说这是 AI 幻觉在实战系统里最接近酿成大祸的一次。我会先打个折:正文没披露具体系统、模型和核验流程的细节,所以没法判断是模型本身的问题还是流程设计有漏洞。但这件事本身就是一个活生生的警示——在情报、军事这类容错率极低的环境里,光靠人工最后一道关来兜底,风险比很多人想象的要大。