跳到正文

#评测/基准

今日 0 条

9月25日星期五

Hacker News 首页

NSA 今年花了几十亿美元测试前沿 AI 模型,远超此前公开的数字

两个消息源透露,NSA 在闭门简报中告诉国会议员,今年光是用纳税人的钱评估和测试先进 AI 模型就花了几十亿美元。这个数字比外界之前知道的要高得多,导致议员们估算,要建一套完整的联邦 AI 监管体系,每年可能要花掉几百亿美元。文章没提具体在测哪些模型、用的是谁的算力,也没说这笔钱怎么拆分的。特朗普目前基本顶住了加强联邦 AI 监管的压力。

推荐理由:独家披露了一份保密简报里的预算数字,信息密度够高,三条都踩中了。没给更高分是因为正文没写清楚测的是哪些模型、算力是谁提供的、钱怎么拆分的——信息缺口不小,所以这更像一个政策信号,先别急着下结论。

8月31日星期一

Hacker News 首页

欧盟 AI 法案开始动真格:OpenAI、Anthropic 和谷歌收到首批安全质询

8 月 29 日,欧盟委员会副主席 Henna Virkkunen 确认,欧盟 AI 办公室已向几家通用 AI 模型提供商发出了正式的信息请求(RFI),要求它们说明模型安全、独立外部评估和上市后监控的具体做法。Euractiv 点名了 OpenAI、Anthropic 和谷歌。通用 AI 模型的合规义务从 8 月 2 日起生效,布鲁塞尔在四周内就动用...

推荐理由:我会先打个折:正文没披露 RFI 具体问了什么、回复截止日是哪天,所以目前只能按“执法启动”这个事件本身来理解。重要性给到 82 是合理的——动作够快、目标够明确,但细节还缺一块。对国内读者来说,最值得看的是欧盟从法案生效到发函只隔了不到一个月,没有观望期,这点别不当回事。

8月27日星期四

Google DeepMind

Google DeepMind 试点全球首个双盲 AI 评测

Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。Google 称此举针对基准污染问题,在零日志协议和合同保障之外增加了技术与加密层面的保护。

推荐理由:Google DeepMind 与新加坡 AI 安全研究所等机构试点双盲评测,读者可了解基准污染问题的技术应对路径。

6月2日星期二

新智元 · 公众号

墨芯 AI 完成近 10 亿元 C 轮融资,下一代推理卡 SparsePrime 年内亮相

墨芯人工智能刚拿了一笔近 10 亿人民币的 C 轮融资。他们做的是 AI 推理芯片,主打稀疏计算,简单说就是只算有用的部分来省电省时间。正文提到他们的 S30 和 S40 卡在 MLPerf 推理测试里拿了三连冠,但没展开说具体跑什么模型、跟谁比。下一代卡叫 SparsePrime,计划年内发布,目前还没公布详细规格和定价。

推荐理由:我会先打个折:这是一条融资加路线图消息,不是产品实测。墨芯拿了近10亿,计划年内出SparsePrime,还说自己S30、S40在MLPerf推理上三连冠——但正文没放具体分数和对比基线,这点先别太激动。对在找国产推理卡、被Token成本压着的团队来说,这条值得放进雷达,但下单前得等真机跑分和量产时间。

纽约时报中文网

中国一家公司正尝试用 AI 预测谁会变成异见者,但美国芯片限制可能拖慢了进度

范德比尔特大学的研究人员翻看了 10 万份泄露的公司文件,发现一家叫积至的中国公司正在开发一套 AI 系统,想通过分析电信数据、社交媒体和位置信息,在一个人还没公开表达不满之前就判断他未来会不会批评政府。这听起来像《少数派报告》里的情节,但文件显示,这套预测技术目前还停留在研究阶段,美国官员也说没有证据表明它已经定型或实际部署。积至的团队在 2024 ...

推荐理由:这篇报道把 AI 监控从猜测推到有文件佐证的层面,10 万份泄露材料让讨论不再是空对空。我会先打个折:正文没披露模型效果、误报率、是否真的跑通了,美方也说没证据显示已定型或部署,所以别急着当成已落地的系统。但选题本身够重,安全、治理、芯片供应链伦理全搅在一起,从业者很难绕开。

5月29日星期五

纽约时报中文网

Anthropic 估值冲到 9000 亿美元,把 OpenAI 挤下最贵 AI 初创公司位置

Anthropic 刚拿了 650 亿美元新融资,投前估值 9000 亿美元,超过了 OpenAI 上一轮的 7300 亿。公司同时发了新旗舰模型 Claude Opus 4.8,在 Vals AI 的 vibe coding(用口语化指令写代码)基准上比自家前代高了 10%。Anthropic 说它的年化收入运转率已经突破 470 亿美元,主要靠 C...

推荐理由:Anthropic 靠 650 亿美元融资把投前估值推到 9000 亿,压过 OpenAI,这是基础模型市场格局的一次实打实变动。Opus 4.8 在 Vals AI 氛围编程基准上比前代提了 10%,正文没展开具体测试条件和误差范围,这点先别太激动,但至少说明模型在代码场景还在往上走。HKR 三项全中,NYT 信源也撑得住,放 p1 没问题。

5月28日星期四

Latent Space

Cognition 拿了 10 亿美元,估值冲到 260 亿,预计年底年经常性收入超 10 亿

Cognition 完成了 10 亿美元的 D 轮融资,估值 260 亿美元,比 8 个月前 C 轮时的 100 亿估值涨了 1.5 倍。公司自己预计到年底年经常性收入能超过 10 亿美元,客户里包括 Exa 和 Modal 这类挑剔的企业。正文没披露具体的利润率或成本结构,所以这个收入数字先别直接等同于利润。 这期 AI 新闻还提了几个技术趋势:推...

推荐理由:Cognition 这轮融资信息量很足。我会先打个折:260 亿估值和 10 亿年收入预期都是公司自己说的,正文没披露第三方验证,但即便打个七折也够猛。8 个月估值涨 2.5 倍,说明市场对 AI 编程 agent 这条路的买单意愿很强。对从业者来说,这不是又一家模型公司融到钱,而是一个把模型塞进开发流程干活的产品拿到了大额支票,信号比纯模型融资更实际。

5月9日星期六

机器之心 · 公众号

DeepSeek 被曝正在谈一笔 500 亿人民币的融资,梁文锋自己掏四成,估值可能到 3500 亿

这条消息来自机器之心,但原文页面被微信判定环境异常,需要验证才能看,所以正文内容没拿到。标题和摘要里提到的关键数字是:融资额约 500 亿人民币(折合约 73 亿美元),估值约 3500 亿人民币(折合约 515 亿美元)。梁文锋个人计划出资 40%,腾讯和 600 亿规模的国家 AI 基金也在谈。这些数字如果属实,说明 DeepSeek 这轮融资规模...

推荐理由:这条DeepSeek融资传闻数字大、出资比例明确、资方有名有姓,HKR三项都站得住。但正文也说了还在谈,没有官方确认,所以分数和级别不动,保持84分和featured,不升p1。

5月6日星期三

新智元 · 公众号

Salesforce 为推 AI 销售代理要招 1000 名应届生,岗位从写提示词到验收结果全包

Salesforce 的 CEO Marc Benioff 放话,因为 Agentforce 这个 AI 销售代理业务增长太猛,公司打算新招 1000 名应届生或实习生。Agentforce 的年化经常性收入涨了 169%,干到了 8 亿美元。新招的人主要干四件事:写提示词、做效果评估、盯着代理干活别出岔子、以及把项目交付落地。说白了,初级岗位的活儿变...

推荐理由:这条消息我会先打个折——招 1000 人听着多,但正文没披露是净增还是含离职补缺,也没说这 1000 人里多少是销售交付、多少是技术岗。不过 Agentforce 年化收入 8 亿、同比增 169% 这两个数确实说明 Salesforce 在 agent 产品上下了重注,不是 PR 吹风。对想入行的应届生来说,真正值得盯的不是“招人”本身,而是岗位描述里提到的 prompt 流程、evals 和 agent 监督——这些才是 agent 时代的新基础技能,比传统搬砖岗更有长期价值。

5月5日星期二

The Verge · AI

Google、微软和 xAI 同意让美国政府在新模型发布前先做安全审查

三家大模型公司跟美国政府的 AI 标准与创新中心(CAISI)达成了协议,以后新模型在公开前会先交给 CAISI 跑一遍评估。CAISI 说从 2024 年到现在已经审了 40 个模型,但这次公告没提具体审了哪些模型、审多久、审完能不能卡发布。我会先打个折:这更像是一个流程上的公开表态,实际约束力要看后续审查范围和发布时间线怎么定,正文没披露这些细节。

推荐理由:Google DeepMind、Microsoft 和 xAI 都点头让 CAISI 在公开发布前审新模型,CAISI 自称 2024 年起已完成 40 次审查。我会先打个折:正文没披露具体审了哪些模型、审查标准是什么、会不会卡发布。真正值得盯的是审查边界和发布节奏,而不是单次合作公告。

4月23日星期四

纽约时报中文网

Anthropic 造了个能找软件漏洞的模型 Mythos,现在只给美国用,连盟友都急了

Anthropic 发布了一个叫 Mythos 的模型,专门用来发现银行、电网和政府软件里的隐藏漏洞。公司说它太危险,不能公开,目前只跟美国 11 家科技公司和 40 多家关键基础设施机构共享,海外只有英国拿到了访问权。英国安全研究所的测试证实,Mythos 能完成以前任何 AI 都做不到的复杂网络攻击。欧盟、德国等盟友还没拿到模型,只能干着急;中国和...

推荐理由:这篇不是常规模型发布,更像一次准地缘政治的网络能力管制实验。Anthropic 把 Mythos 圈在极小范围,只给美国及英国部分机构用,还拉上 11 家合作方修漏洞,说明他们自己都怕这东西被滥用。正文没披露具体评测方法和基准分数,所以“比核弹还糟糕”这种说法先打个折,但 18 个月内类似能力扩散的预估值得盯紧。

2月26日星期四

OpenAI News

OpenAI 与 PNNL 合作测试用 AI 帮联邦政府写环评报告,每小节能省 1 到 5 小时

OpenAI 跟美国能源部旗下的太平洋西北国家实验室(PNNL)合作,找了 19 位专家一起搞了个叫 DraftNEPABench 的测试集,专门看 AI 能不能帮忙起草联邦基建项目的环境评估文件。测试用的是 Codex CLI 这个命令行工具搭配 GPT-5,让模型去读几百页的技术报告、交叉核对资料,再按法规要求写出结构化的分析草稿。在覆盖 18 个...

推荐理由:HKR 三项都过了:联邦审批这个场景够意外;有 19 位专家、102 个任务和 1–5 小时的时间节省,信息量不空;争议点在于代理开始碰监管流程,但文章自己划了边界,说这只是起草辅助,不是自动决策。分数没往上拉,因为这只是个限定范围的基准测试,不是已经落地的产品能力。