跳到正文

全部动态

今日 0 条

9月14日星期一

NVIDIA 博客

Perplexity 本地搜索版上线 Windows,靠 NVIDIA RTX 离线跑

Perplexity 把它的 AI 搜索做成了 Windows 本地版,叫“便携计算机”,靠 NVIDIA RTX 显卡在本地跑推理。离线也能查资料、总结内容,适合在意隐私或没网的时候用。但正文没提支持哪些 RTX 型号、需要多少显存,也没说本地版比云端版慢多少。另外,离线意味着搜不到实时网页,这点先别太激动。

OpenAI News

Fyxer 把邮件拆成 30-50 个小模型,草稿采纳率 53%

Fyxer 用 OpenAI 模型做了个 AI 行政助理,核心是把邮件处理拆成 30-50 个专用小模型,分别负责判断要不要回、分析意图、调取记忆、生成草稿。训练数据来自 50 万小时真人行政助理的工作记录,用 LoRA 微调,再通过用户编辑草稿的差异做 DPO 训练(偏好样本教模型学风格)。目前草稿直接采纳率 53%,90 天用户留存 90%。正文没...

OpenAI News

Perplexity 把 GPT-6 Astra 放进真实系统里干活,人工检查的频率低了很多

Perplexity 的联合创始人 Johnny Ho 说,GPT-6 Astra 现在能直接写对外沟通文案、改线上代码、盯着生产环境运行,这些事以前的模型做不来。他们让 Astra 自己写测试程序,模拟外部 API 返回的数据,跑通完整的业务流程。因为模型更稳了,团队不用像以前那样频繁盯着看。不过正文只给了定性的说法,没披露具体的性能指标或延迟数据,...

推荐理由:Perplexity 联合创始人的说法比普通客户案例实在,给出了 Astra 在生产环境的具体用法。但正文只有定性描述,没给性能指标或延迟数据,所以分数卡在 featured 门槛上。

9月12日星期六

OpenAI News

Cognition 把 GPT‑6 Astra 接进 Devin,让 AI 编程助手自己测自己写的代码

Cognition 把 GPT‑6 Astra 用在了 Devin 身上,让这个 AI 编程助手能自己跑测试、录屏并生成报告。文章举了个例子:Devin 用 Astra 去测一款叫 Otter Run 的 iPhone 游戏,最后返回了模拟器运行录像和一份测试清单,标明了哪些检查过了、哪些还没覆盖。团队还把客户发来的 bug 截图丢给 Devin,修完...

推荐理由:GPT‑6 Astra 被塞进 Devin 做自测,是一个落地的开发流程,不是概念视频。文章给了三个场景:录屏、出测试清单、修客户 bug,细节够用。分数没给到 85 以上,因为这是 OpenAI 的客户案例,不是独立评测,效果得打个折看。

9月11日星期五

Google 研究院

ToolGrad:用报错信息当“梯度”,自动生成教模型调用工具的数据集

Google Research 提出 ToolGrad,一种靠文字反馈自动生成工具调用训练数据的方法。思路很直接:让模型先试着调用 API,一旦出错,就把 API 返回的报错信息当成“梯度信号”,反向修改对话样本,反复迭代直到模型给出正确答案。文章用查天气的例子走了一遍流程——模型一开始瞎编了一个温度,API 报错后,系统根据错误提示重写了问题和回答,...

GitHub Blog · AI & ML

GitHub Copilot 应用新手指南:使用 diff、终端与浏览器面板

GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示代码的增删改,终端面板支持直接运行项目命令并可通过 Run 按钮配置脚本,浏览器面板则提供 Pick & Polish 工具来选取页面元素并让智能体调整。

NVIDIA 博客

Skild AI 用 NVIDIA 模拟器生成数据,让机器人看一遍人类示范视频就能学会新任务

Skild AI 发布了机器人基础模型 S1,核心卖点是看一段人类操作视频就能学会抓取、开门、拧瓶盖这类动作。训练方法是用 NVIDIA Isaac Sim 模拟器批量生成合成数据,再混入少量真人遥操作数据。在抓取、开门、拧瓶盖三项测试里成功率都超过 90%。换到新机器人本体上,只需要 5 分钟微调就能适配。不过正文没披露模型参数量和具体使用成本,这点...

OpenAI News

用 ChatGPT 和 Codex 扫描基因组找抗生素,候选分子筛选从几年缩到几小时

宾大团队用自研深度学习模型扫描现存和灭绝物种的基因组,找能对抗耐药菌的分子。传统方法找候选分子要几年,AI 把初筛压到几小时。ChatGPT 和 Codex 用来写代码、处理数据、跨学科沟通——比如生物背景的人用它写程序,程序员用它补生物知识。2021 年全球约 500 万人死于细菌耐药感染,预计 2050 年翻倍。但正文没披露找到了哪些具体分子、有没...

9月10日星期四

OpenAI News

OpenAI 在 ChatGPT Work 里加了个数据助手,用大白话就能查公司数据库

OpenAI 给企业版 ChatGPT Work 上线了一个 Data agent,员工不用写 SQL 也不用找人拉报表,直接问“上季度销售为什么下滑”就能从公司数据库里拿答案。它支持 Amazon Redshift、Snowflake、Databricks、MongoDB 等数据库,也能读 Google Drive 和 SharePoint 里的文件...

推荐理由:OpenAI 在 ChatGPT 企业版里加了个 Data agent,员工用自然语言就能查数据库、出图表。功能实用,但更像是补课,不是范式突破。目前只有官方公告,没有第三方实测,实际查数准不准、权限管不管得住都还不知道,所以对效果先打个折。

Mistral AI

Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与模型所有权均归企业,模型基于开放权重。Cloudera 平台上客户管理的数据规模达 30 exabytes。

OpenAI News

OpenAI 与美国总务管理局签了 27 个月协议:政府用 ChatGPT 免月费,用量打五折

OpenAI 和美国总务管理局(GSA)达成了一项新协议,把原本每人每月 15 美元的 ChatGPT 授权费直接降到 0,用量成本也砍半。这个叫 OneGov 的方案现在覆盖联邦、州、地方和部落政府,大约 2300 万公职人员都能用。文章举了几个例子:疾控中心(CDC)把文献综述时间从几天压到 30 分钟以内,佐治亚州税务局把税单数字化从两周缩到 1...

推荐理由:我会先打个折:这是 OpenAI 自家博客,没有第三方验证,案例数据也是自报的,别当独立评测看。但信息量够——价格从 15 美元降到 0、用量成本减半,这两个数字本身就说明 OpenAI 在政府市场下了重注。CDC 和佐治亚州的案例给了可量化的效率提升,不是空泛的“赋能”。2300 万人的覆盖规模也把这件事从试点拉到了基础设施级别。正文没披露免费授权的具体条款(有没有用量上限、数据如何处理),这点先别太激动。整体看,价格信号和案例数字让它值得上 featured,但信源单一,重要性给 78 不算低。

OpenAI News

OpenAI 推出金融专用版 ChatGPT,内置投行常用数据库和 GPT-6 Astra

OpenAI 发布了 ChatGPT for Financial Services,一个专门给投行和证券研究用的工作台。它把 GPT-6 Astra 的推理能力直接接上了 Daloopa、PitchBook、LSEG News 和 Crunchbase 这些付费数据库,省去了自己搭数据管道的麻烦。产品是和摩根士丹利、Evercore 一起设计的,主要解...

推荐理由:这是 OpenAI 第一个垂直行业产品,直接整合了四个付费金融数据库,还是跟摩根士丹利和 Evercore 一起设计的,不是通用聊天工具。但正文没提定价、数据延迟和合规认证,这几个在金融采购里是硬门槛,所以重要性我会先打个折。

OpenAI News

OpenAI 把 ChatGPT 的全双工语音能力做成 API 了,叫 GPT‑Live‑1

OpenAI 发布了 GPT‑Live‑1,一个能同时听和说的语音模型,之前只在 ChatGPT 里用,现在开放给开发者接 API。它把语音识别、理解和合成合到一个模型里,不再需要把 STT、LLM、TTS 串起来,省掉了中间环节的延迟和状态丢失。语言学习产品 Speak 试过后说,学生回答前的等待时间变长了,系统打断学生的次数比之前的轮流对话方案少了...

推荐理由:OpenAI 把 ChatGPT 的全双工语音模型拆出来做成 API,对做语音产品的团队是直接可用的更新。我会先打个折:Speak 的反馈说明生产环境里延迟和打断的平衡还没完全调好,但管线简化本身省掉不少工程麻烦。正文没披露定价和并发限制,这点先别太激动。

OpenAI News

Paul Christiano 加入 OpenAI 基金会董事会,担任无投票权观察员

OpenAI 把 Paul Christiano 请进了基金会董事会和安全委员会。他在 OpenAI 干过四年对齐研究,是 RLHF(用人类反馈训练模型偏好)的早期贡献者,后来自己创立了 Alignment Research Center。现在他还在美国 NIST 下属机构当高级技术顾问,专门评估前沿模型。这次任命有个关键限制:他在 NIST 的工作会...

推荐理由:OpenAI 官方任命公告。Christiano 的三重身份——前 OpenAI 对齐研究员、ARC 创始人、NIST 高级顾问——叠加上基金会董事会和安全委员会,结构上值得关注。分数卡在 78,因为公告只说了任命事实,没披露他在安全委员会的具体职责、信息防火墙怎么划、以及他对未来模型发布有多大实际影响力。

9月9日星期三

Hugging Face 博客

IBM 发布 Granite 时序预测模型 r2,零样本预测、可商用

IBM 发布了 Granite Time Series PatchTST-FM-r2,一个专门做时序预测的基础模型。最大的卖点是零样本预测——也就是拿一个没见过的数据集直接跑,不用重新训练。它在 GIFT-Eval 基准上零样本成绩最好,甚至能打平那些允许用基准数据训练过的模型。架构基于改进版 PatchTST,训练数据也比上一代多。许可证对商用友好,...

OpenAI News

OpenAI 政策主管喊话:AI 监管窗口正在关闭,现在就得动手

OpenAI 全球事务官 Chris Lehane 发了一篇公开文章,核心就一句话:AI 能力跑得太快,政策再不上车就来不及了。他直接呼吁美国国会尽快通过一套强制性的、按模型能力分级的安全法规。在联邦层面还没动静之前,OpenAI 先表态支持加州四项法案:SB 813 是给独立安全评估搭基础设施,AB 1405 是给 AI 审计师定标准,SB 1119...

OpenAI News

OpenAI 发布 GPT-6 Astra:能直接操作 Excel 和 Figma,干活更快,成本更低

OpenAI 推出了 GPT-6 Astra,一个主打干复杂活儿的模型。它不用 API 就能直接操作你电脑上的日常软件,比如 Excel 和 Figma。在一个 Excel 建模比赛里,它的速度比人类冠军快了大约 4 倍。在 Terminal-Bench 4.0 这个测试智能体干终端杂活能力的基准上,Astra 得分 57.9%,超过了 GPT-5.6...

推荐理由:OpenAI 放出 GPT-6 Astra,主打直接操作电脑软件和复杂任务,速度碾压人类冠军,属于行业级震动。HKR 三项全中,分数接近天花板。正文没提定价和具体铺开范围,这是目前唯一的信息缺口。

OpenAI News

GPT-5.6 Sol 帮麻省理工研究生跑量子芯片校准,晚上睡觉时实验自己做完

OpenAI 发了一个案例:MIT 量子工程组的研究生 Beatriz Yankelevich 把 GPT-5.6 Sol 连到实验室软件上,让它自动给超导量子比特做校准测量。模型能自己跑标准流程——找频率、校准脉冲、测相干时间——信号干净时基本不用人管。但信号弱或噪声大时,还是需要研究员介入指导。现在这个组经常让 agent 在夜里跑实验,研究员早上...

9月8日星期二

Hugging Face 博客

安全对齐不该一刀切:只拒绝话题里的有害部分,而不是整个话题

现在的安全对齐有个通病:把整个话题当成拒绝单位。比如 LlamaGuard-3 把“选举”归为“事实错误信息”,导致模型连“选举流程是什么”这种无害问题也拒答。Multiverse Computing 这篇论文提出“窄边界安全”,核心想法是,在同一个话题(比如政治)里,只拒绝有害的子集(比如写定向操纵内容),正常回答无害问题(比如选举事实)。做法是让部...

推荐理由:H 和 K 都打中了:角度尖锐,LlamaGuard-3 误标选举话题的例子很具体。R 偏弱,这是安全对齐的细分话题,不会在更广的圈子里被主动提起。定在 featured 门槛 72 分,没再往上是因为正文只给了摘要,完整实验和验证细节还没看到。

Google DeepMind

Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部单碱基变异

Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。

推荐理由:原文给出覆盖 90 亿单核苷酸变异的预测数据集与 AVI 评分,读者可据此了解基因组变异解读的新工具形态。

OpenAI News

OpenAI CFO 发文:GPT-6 Astra 已来,消费者与企业业务互相喂养

OpenAI CFO Sarah Friar 发了一篇博客,核心是给 GPT-6 Astra 定调:这是目前最聪明、对齐做得最好的模型。文章没给技术细节,更像一份战略叙事。她提到 ChatGPT 周活用户超过 10 亿,付费企业客户 250 万,内部研究团队现在每 1 个人类工作日,就对应 3.1 个智能体工作日(agent-workday)的产出。最...

推荐理由:OpenAI CFO 发了一篇博客给 GPT-6 Astra 铺路,说这是目前最聪明、对齐最好的模型。文章没给技术细节,更像一份战略叙事。她提到 ChatGPT 周活用户超过 10 亿,付费企业客户 250 万,内部研究团队现在每 1 个人类工作日,就对应 3.1 个智能体工作日的产出。我会先打个折——这个 3.1 倍是内部自报,没第三方验证,但数字本身够猛,从业者会拿来当参照。文章没披露模型参数、训练成本或具体评测基准,所以这篇的价值不在技术,在于 OpenAI 怎么对外讲自己的故事。

OpenAI News

OpenAI 发布 ChatGPT Images 2.5,生图速度翻倍,还加了个手绘板功能

OpenAI 推出了新的图像模型 Images 2.5。最直接的变化是生图延迟比上一代低了最多 50%,出图更快。画质上,光照更自然、材质细节更丰富,多轮改图时也能更稳地保住画面主体不走样。目前每周通过 ChatGPT 和 API 生成的图片已经超过 30 亿张。这次还加了一个叫 Sketch 的新功能,允许你在 ChatGPT 里直接画草图当参考,让...

推荐理由:OpenAI 正式发了 Images 2.5,延迟最多降 50%,画质上光照和材质更自然,多轮改图时主体更稳,还加了 Sketch 草图输入。每周 30 亿张的量说明这已经是大众工具了。这次更新是实打实的体验升级,不是换皮,三个维度都踩中了。没给更高分是因为这算迭代优化,不是范式级变化。

OpenAI News

OpenAI 投 500 万美元,研究生成式 AI 对 13–17 岁青少年的影响

OpenAI 拿出 500 万美元资助独立研究,专门看生成式 AI 怎么影响 13–17 岁青少年的情绪、社交、安全等方面。申请全球开放,但优先考虑 AI 使用率高的国家。研究必须包含伦理审查、知情同意、隐私和数据安全说明。钱不算多,但方向明确:不是让 OpenAI 自己出报告,而是让外部学者做,结果更可信。正文没披露资助数量和每笔上限,也没说研究周期多长。

9月4日星期五

GitHub Blog · AI & ML

GitHub Copilot 应用新手指南:如何同时运行多个智能体

GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在会话视图中查看各任务标题与进度,例如在同一项目上并行执行 funded sort 开发、无障碍审查和测试运行。

9月3日星期四

Hugging Face 博客

H公司开源NeoMME:一个不用独立视觉塔、直接处理图片和文字的多语言编码器

H公司放出了NeoMME,有2.6亿和8亿参数两个版本,主打多语言、多模态。它没走主流路线——不挂单独的视觉塔,也不接自回归语言模型,而是用一个双向Transformer同时吃进文字和原始图片块,从头训练,训练方式叫“掩码离散扩散”,可以理解成用猜被遮住的文字来学图片内容。微调后的NeoMME-Retriever能在一次前向计算里同时输出稠密向量和“后...

NVIDIA 博客

《NBA 2K27》首发支持 DLSS 5,GeForce NOW 本周新增 28 款游戏

NVIDIA 本周给云游戏平台 GeForce NOW 加了 28 款游戏,头牌是《NBA 2K27》,而且它首发就支持 DLSS 5。这是 DLSS 5 第一次跟着年货大作一起上线,对云游戏玩家来说算个信号。但正文没提 DLSS 5 具体能提多少帧、延迟降多少,也没说其他 27 款里哪些也用了 DLSS 5。所以这点先别太激动,等跑分出来才知道实际效果。

OpenAI News

Playco 用 GPT-6 Astra 做游戏原型,手动修复减少 50%

Playco 用 GPT-6 Astra 做了一个叫 Playbot 的 AI 游戏开发 IDE,直接连 Unity 和 Godot 引擎,让模型自己编辑场景、跑测试、找 bug。他们先搭了一个灰色方块原型,然后让模型一次性生成三个不同主题的游戏世界,大部分第一次跑就能玩。相比上一代模型,手动修复量砍了一半。空间推理、UI 响应和手感都有提升。模型还能...

OpenAI News

法律科技公司 Legora 用 GPT-6 Astra 几分钟审完 41 份财报文件

法律科技公司 Legora 用 OpenAI 的 GPT-6 Astra 跑了一次财报核对任务:一次性处理 41 份文件,几分钟内完成所有数字比对,包括找出藏在营收附注里的 50 万英镑差额。之前这个活要花一整个晚上甚至几天。Legora 自己的评测显示,新模型在这个流程上比上一版提升了近 40%,4 个故意埋的错误全抓到了。不过正文没披露具体用了什么...

Hugging Face 博客

用 100 步 GRPO 微调 3.5 亿参数模型,结构化输出合规率从 22.6% 提到 29.7%

Hugging Face 和 Liquid AI 发了一份实操指南,拿 LFM2.5-350M 这个小模型做实验。他们用 TRL 库跑 GRPO(一种按组比较、挑好回答来优化的强化学习方法),只用了 500 条样本、训练 100 步,在免费 Colab GPU 上就能跑完。在 IFStruct 结构化输出基准上,模型按指定格式返回有效结果的比例从 22...

推荐理由:一份实操向的教程,数字具体、方法可复现,H 和 K 都站得住。但内容只对微调工程师有用,缺乏破圈潜力,R 不成立。放在 featured 档给 72 分合理。

Google DeepMind

Google DeepMind 推出 Fairwind 计划,向政府和可信伙伴开放 Gemini 3.8 Flash Cyber 网络防御能力

Google DeepMind 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全伙伴限量开放其最先进的网络防御能力。该计划将专用网络模型 Gemini 3.8 Flash Cyber 与 CodeMender harness 结合,可自主发现、验证并修复漏洞,把原本数周的手动修复压缩到数分钟内生成可部署补丁,且运行成本低于传统前沿模型。

推荐理由:原文给出 Fairwind 计划的准入对象、模型与工具组合,读者可据此判断自主漏洞修复在企业与政府场景的落地方式。

9月2日星期三

Hugging Face 博客

Allen AI 用心理测量学给大模型基准做“体检”,发现很多题目测的根本不是你以为的能力

Allen AI 开源了一套叫 BenchMIRT 的方法,用多维项目反应理论(MIRT)来审查大模型评测基准到底在考什么。他们分析了 100 个模型在 16 个基准、超过 3.4 万道题上的表现,没给任何预设,系统自动分离出两个核心能力维度:安全性和通用推理能力。比如 BBQ 基准里一道关于祖孙俩叫 Uber 的题,表面测年龄偏见,实际上还要求模型理...

推荐理由:Allen AI 开源了一套方法,拿项目反应理论来审计评测基准,背后有 100 个模型和 3.4 万道题撑腰。分数没上 80 是因为它是个方法论工具,不是能直接上线的产品更新,但 H、K、R 三个点都踩实了,信息也够硬。

OpenAI News

OpenAI 拆了三家 AI 公司的 agent 用法:入职、客户管理、开发者集成

OpenAI 发了一篇博客,讲了 Basis、Clay 和 Exa Labs 三家创业公司怎么用 agent 干活。Basis 把新员工入职从两小时压到半小时——录一次操作流程就能重复用,HR 还能随时改。Clay 给每个客户账户配一个专属 agent,晚上自动翻 CRM、邮件、Slack 更新信息,早上给销售列当天该干啥,省了大概一小时翻收件箱的时间...

9月1日星期二

OpenAI News

OpenAI 把 ChatGPT 接入了 Epic 电子病历和九大官方医疗数据库

OpenAI 给企业版 ChatGPT for Healthcare 加了两项新能力:一是能直接读取 Epic 电子病历里的授权患者信息,医生可以问“上次就诊后病情有什么变化”这类问题,系统会从病历里抓取摘要并标出来源;二是上线了一个“医疗公共数据插件”,把 PubMed、DailyMed、ClinicalTrials.gov、CMS 医保覆盖政策等九...

推荐理由:OpenAI 给企业版 ChatGPT for Healthcare 加了 Epic 病历直读和一个九合一公共数据插件,产品层面确实往前走了一步。分数定在 78 没动,因为目前只有官方公告,没有一线医生的真实使用反馈,也没披露错误率或漏读率,实际效果还得等第三方验证。

Anthropic News

Anthropic 发布 Enterprise Frontier Safeguards,客户自持数据存储与密钥

Anthropic 发布 Enterprise Frontier Safeguards(EFS),把零数据留存(ZDR)的隐私性与检测滥用的安全监控结合,数据存放在客户自控的云基础设施而非 Anthropic。

推荐理由:原文给出 EFS 的数据留存与监控架构细节,读者可据此判断企业部署前沿模型时的隐私与安全取舍。

Google 研究院

Google 发布 TimesFM-3:一个不用微调就能预测多条时间序列的零样本模型

Google Research 推出了 TimesFM-3,一个零样本(zero-shot)的多变量时间序列预测基础模型。简单说,你给它一组相关的历史数据——比如温度、湿度、风速——它不用针对你的场景再训练,直接就能预测未来走势。这对供应链、能源、金融这些经常要同时预测多个指标的领域挺实用,省去了每个场景单独训练模型的麻烦。不过正文没披露模型参数量、训...

8月31日星期一

OpenAI News

OpenAI 公开支持加州 SB 1119 法案,要求 AI 产品对 13-17 岁用户默认开启安全保护

OpenAI 副总裁 Ann O'Leary 发博文说,公司支持加州参议院第 1119 号法案。这个法案要求 AI 产品必须估算用户年龄,对 13 到 17 岁的青少年自动屏蔽自残、性剥削等有害内容,并接受独立审计、限制定向广告。OpenAI 刚推出的 ChatGPT for Teens 已经这么干了:系统判断用户未满 18 岁,就直接切进青少年模式,...

OpenAI News

日本创业公司 Polimill 用 GPT 给 1050 个地方政府搭了套公共 AI 系统

日本创业公司 Polimill 基于 OpenAI 的 GPT 和 Codex 做了一个叫 QommonsAI 的政务平台,目前已有约 1050 个地方政府、55 万公务员在用。核心是把各市町村分散的会议记录、福利档案、法律文书等数据统一成可跨地区搜索的知识库,公务员查资料不用再翻几年旧档案。开发速度提升了 3-5 倍,主要靠 Codex 辅助写代码和...

8月27日星期四

Google DeepMind

Google DeepMind 试点全球首个双盲 AI 评测

Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。Google 称此举针对基准污染问题,在零日志协议和合同保障之外增加了技术与加密层面的保护。

推荐理由:Google DeepMind 与新加坡 AI 安全研究所等机构试点双盲评测,读者可了解基准污染问题的技术应对路径。

OpenAI News

OpenAI 和博科尼大学做了个实验:用 ChatGPT 的学生作业质量更高,练过因果推理的学生想法更独特

博科尼大学找了 1000 多名大一新生做随机分组实验,让他们给学校纪念品店写营销方案。用 ChatGPT(GPT‑4o)的学生在 5 分制评分里高了将近 1 分,答案更连贯、更像专家写的。另一组学生没碰 AI,而是练了一个因果推理游戏——教他们解释方案为什么行得通、什么时候会翻车。这组人评分没涨,但想法种类明显更多,而且更会讲清楚自己方案的逻辑和风险。...

推荐理由:我会先打个折:这是 OpenAI 自己做的实验、自己写的博客,立场不可能完全中立。但实验本身不水——博科尼大学拉了 1000 多名新生做随机对照,用 GPT-4o 写营销方案的学生评分涨了将近 1 分(5 分制),答案更连贯、更像专家写的。另一组没碰 AI,练了一个因果推理游戏,教他们解释方案为什么行得通、什么时候会翻车,这组评分没涨,但想法种类明显更多,而且更会讲清楚自己方案的逻辑和风险。正文没披露评分者是不是知道哪份答案来自 AI 组,这点先别太激动。整体来说,研究把“AI 帮你写得好”和“训练让你想得宽”拆开看了,对做教育产品的团队有启发,但...