Google 解释 harness 工程:给编程 AI 套上缰绳,让它自己改 bug
Shir Meir Lador 把 harness 工程讲得很直白:别让 AI 编程助手裸奔,要用一套确定性的规则把它框住——比如限定工作区、自动抓错误日志喂回去让它自己修、让代码仓库结构清晰方便它逐步理解上下文。她引用了 OpenAI 的一个实验,3 个工程师一行手写代码都没写就交付了一个内部测试版产品。文章还给了段代码示例,用 Google 的 A...
Shir Meir Lador 把 harness 工程讲得很直白:别让 AI 编程助手裸奔,要用一套确定性的规则把它框住——比如限定工作区、自动抓错误日志喂回去让它自己修、让代码仓库结构清晰方便它逐步理解上下文。她引用了 OpenAI 的一个实验,3 个工程师一行手写代码都没写就交付了一个内部测试版产品。文章还给了段代码示例,用 Google 的 A...
HiddenLayer 三年前 A 轮拿了 5000 万,当时大家还在怀疑针对 AI 的大规模攻击到底存不存在。现在情况变了,安全厂商都在抢着做能监控 AI 智能体(agent)以及它们调用的工具和插件的产品。虽然公开报道里 AI 智能体被攻击的案例还不多,但它们在正式环境里跑偏的风险是真实存在的。这篇报道没披露这轮融资的估值和领投方。
推荐理由:HiddenLayer 这轮 1 亿美元在 AI 安全圈算大手笔,而且文章把叙事从“有人攻击模型吗”推进到“得盯着智能体和它用的工具链”,信息增量是实的。我会先打个折:正文没披露估值和领投方,这两个关键数字缺失,让判断只能停在 72 分这一档。
亚马逊给 Alexa for Shopping 加了个新功能:你把可疑的邮件或短信转发给它,AI 会拿官方发过的几十亿条消息做比对——看发件人、内容、时间戳和元数据,然后告诉你这条是不是真的。每年大约有 36 万用户找客服问“这消息是亚马逊发的吗”,现在可以直接问 AI。用户举报越多,系统识别能力越强。正文没披露上线时间和地区范围。
加拿大 Tumbler Ridge 大规模枪击案受害者家属对 OpenAI 提起 30 起新诉讼,指控其向嫌疑人提供了“实质性帮助和鼓励”,构成协助教唆。正文未披露具体证据或 OpenAI 的回应,目前无法判断诉讼依据是否充分。
纽约市长宣布从 2026-2027 学年开始,全市约 60 万从 2-K 到八年级的公立学校学生,一年内不能在课堂上使用 AI 工具,老师也不能用 AI 来批改作业。禁令期间会同步跑一个小规模的 AI 教育工具试点,但正文没提违规怎么处理、试点具体包含哪些工具。
推荐理由:这条新闻本身信号很强,一个 60 万人的学区直接叫停低龄 AI 使用,还连带禁了老师批改。我会先打个折,因为正文没写违规了怎么办、试点到底测哪些工具,这两个缺口让政策的可执行性打了问号。但光凭禁令本身,就足够让做教育 AI 的人紧张一下。
MLC-AI 开源的 WebLLM 让你在浏览器里直接跑 Llama、Gemma 等大模型,靠 WebGPU 加速,在普通消费级显卡上能达到接近原生的速度。好处是隐私数据不出本地,离线也能用,适合做个人助手或敏感场景。代价是首次加载要下载几个 GB 的模型权重,内存占用也高,别指望它能替代云端推理。
Trellner Research 用 380 个软件品类测试了 Perplexity 的两个模型,发现返回的 7534 条引用里,近六成来自全球排名十万开外的网站,还有 23.4% 根本不在前一百万名里。最扎眼的是 wifitalents.com、worldmetrics.org 和 gitnux.org 这三个站,它们总共用机器生成了 215128...
推荐理由:这篇研究的方法很直接:拿 380 个软件品类去测 Perplexity 两个模型,统计引用来源的域名排名。结果很扎眼——wifitalents.com、worldmetrics.org 和 gitnux.org 三个站合计用机器吐了 21.5 万页内容,却被频繁引用。我会先打个折:研究没披露具体查询词和模型版本,也没说明这些引用在答案里的权重有多大,但近六成引用来自低权威域这个比例已经足够说明问题。对从业者来说,这不是 Perplexity 一家的事,而是整个“搜索+生成”模式在信源质量上的系统性漏洞。
Haus Research 用 310 个关于科技公司的具体问题去测 Perplexity 的两个搜索模型,然后逐个点开它给的引用链接核对。结果发现,在 1826 个带数字的句子后面附上的引用里,有 34.7% 的链接要么打不开,要么打开的页面里压根找不到那句话里的任何一个数字。如果按“只要有一个引用能对上就算过”的宽松标准,也有 14.4% 的说法找...
推荐理由:Haus Research 用 310 个科技公司问题测了 Perplexity 两个搜索模型,手动点开 1826 条带数字的引用链接核对,发现 34.7% 的链接要么失效要么页面里根本没有那个数字。方法交代得清楚,样本量也够,不是随便黑一下。我会先打个折——宽松标准下 14.4% 的说法找不到任何支撑链接,这个数字更贴近实际使用感受,但依然说明引用质量有硬伤。正文没披露测试时用的具体模型版本和日期,这点信息缺口让结论的时效性打了点折扣。
OpenTeams 工程师 Guido Imperiale 认为 ArtificialAnalysis 那张“智商 vs 成本”图会误导人。对数刻度把最便宜和最贵模型之间 250 倍的真实价差给抹平了,反而放大了便宜货之间那点微不足道的价格差异。他自己用线性刻度重画了三张图,并且把官方 API 价格换成了 OpenRouter 上能找到的最便宜的第三方...
最近人形机器人看起来很猛:宇树在春晚上翻跟头,天工机器人百米跑进 8.86 秒。但作者 Kai Williams 跟一圈专家聊完,结论是别慌。特斯拉 2024 年 Optimus 调酒其实是人在背后遥控的,不是自主操作。跳舞和冲刺这类演示,比拿起一罐可乐这种真正的物体操作要简单得多。机器人现在还没法在不同任务间泛化,不能边干边学,也处理不了耗时几小时的...
推荐理由:一篇用事实给机器人热降温的文章。作者没被春晚翻跟头和百米冲刺带节奏,而是抓住特斯拉调酒靠人遥控这个关键细节,把操作、泛化、持续工作三个短板讲透了。我会先打个折,因为正文没给出解决这些短板的时间线或量化对比,但作为一篇帮人冷静看待 demo 的科普,信息量和可读性都到位。
Mistral 现在默认用免费和 Pro 用户的输入输出数据训练模型,企业版不受影响。用户可以在设置里关掉这个选项。正文没说明关掉后历史数据是否会被追溯删除,也没说训练数据具体保留多久。如果你在用免费版或 Pro 版,且不想自己的对话被拿去训练,记得手动去设置里关掉。
这个工具在浏览器里跑,上传文件后只读取文件里嵌的 C2PA 凭证(一种数字水印),不会把文件传出去。如果凭证显示文件被 Claude 处理过,工具就会告诉你。它不判断内容真假,也查不出文件是不是 AI 编的。没查到凭证不代表文件跟 Claude 无关——凭证可能被洗掉了,或者生成文件的模型、平台压根不支持打标。支持 JPG、PNG、MP4、MP3 等格...
Anthropic 推出了 MHS(模型硬件标准),可以理解为 MCP 的物理版——让 Claude 这类模型直接控制实验仪器或机器人。标题提到了“实验室自动化”和“具身智能”,但正文没披露协议细节、支持哪些设备、以及什么时候能用。目前信息有限,先别太激动。
Cursor 的云智能体现在可以在你公司自己的机器上执行操作了。以前,智能体从思考到动手全在 Cursor 的云端完成,现在你可以把“动手”这部分挪到内网服务器上。做法是在你的机器上装一个叫 worker 的小程序,它会主动和 Cursor 云端保持一条加密连接,等着接任务。这样智能体就能直接访问你公司内部的代码库、私有服务,或者用上 GPU、Mac ...
推荐理由:Cursor 这次把云智能体的执行层从自己机房拆出来,让企业装个 worker 就能在内网跑任务。架构上确实动了真格,不是小修小补。不过刚发布,还没有用户实际验证的数据,所以分数先不打太高,78 分合理。
用大模型当裁判去检查 AI 写的病历,发现它特别不擅长抓“漏写”——信息在问诊里提到了,但病历没记。论文建了一个 500 对的测试集,每对只有一处改动。对于“多写了”或“改写了”的内容,裁判的识别准确率在 0.79-0.94 之间;但对于“漏写了”,准确率只有 0.50-0.63,基本等于瞎猜。换个做法能救:先让模型把问诊记录里所有事实列出来,再逐条核...
Multiverse Computing 推出了他们的第一个大模型 Quasar 438B,一个面向企业级智能体和编程的推理模型,支持英语和西班牙语。在 Artificial Analysis 的智力指数上,它拿了 43 分,是目前欧洲模型里的最高分,比 Mistral Medium 3.5 的 30 分和 NVIDIA Nemotron 3 Ultr...
推荐理由:欧洲第一个 438B 推理模型,有具体跑分和对手对比,信号够强。但来源是厂商自述,还没看到独立评测,所以分数卡在 featured 门槛上。
Anthropic 在 9 月 1 日推出了 Claude Fable 5.1 和 Mythos 5.1,主打编程和知识工作。Fable 5.1 在 Terminal-Bench 4.0 上拿到 55.8% 的分数,官方把它定位成能自己跑多步复杂任务的模型。价格方面,缓存读取费砍了 75%,降到每百万 token 0.25 美元,但 Artificia...
推荐理由:Anthropic 发了 Claude Fable/Mythos 5.1,Terminal-Bench 4.0 得分 55.8%,缓存读取价砍了 75% 到每百万 token 0.25 美元,输出 token 上限涨了 70%。能力升级加定价大调整,当天就该写。没给 95 是因为目前只有 Lat 的初步数据,实际表现和稳定性还得等更多反馈。
群友用 DSH 加 DeepSeek V4 Flash 跑了两个月对比和一周 51 亿 token 的活,结论是实际干活比 GPT-5.6 Sol 舒服。Sol 想太多、输出假大空,V4 Flash 首 token 平均 2.3 秒,总花费才 ¥362.84。有人提出“订阅制健身房悖论”,认为卖月费的 harness 会悄悄限制使用强度,按量付费的才不...
推荐理由:群聊实测数据够扎实——51 亿 token 跑下来才花三百多块,首 token 2.3 秒,成功率接近百分百,对比 Sol 的啰嗦和假大空,结论很明确。但来源是匿名群聊记录,不是官方发布或可复现的基准测试,权威性要打个折。H、K、R 全中,放 featured 没问题。
约翰·特纳斯周二正式接手苹果,库克退居执行董事长。他接手的摊子不太平:超过400名前苹果员工现在在OpenAI工作,硬件部门好几个负责人也走了。特纳斯一边得稳住苹果的财务纪律,一边要推折叠iPhone这类新东西,还得把AI真正塞进产品线。文章点出一个关键隐患:如果特纳斯和库克在AI投入、已取消的造车项目或Vision Pro头显的去留上意见不合,真正的...
推荐理由:苹果CEO交接本身就是行业大事,这篇深度稿把人才流失的具体数字和内部战略拉扯都摆出来了,HKR三个维度都踩得实。没给更高分是因为这更像人事和战略分析,不是产品突破或技术硬核发布,但信息量和警示意味足够。
美团 LongCat-2.0 现在可以在 Cline 上免费试用了。不过正文没披露模型规格、能力或试用时长,只有标题确认了这件事。
UU远程发布了新版本,核心是两个功能:完整TUI渲染(终端界面能完整显示,不只是文字流)和多终端会话管理(可以同时连多个远程终端,切换方便)。目标场景是远程Vibe Coding——即一边写代码一边让AI实时辅助的编程方式。正文没披露版本号、发布日期或技术实现细节,信息量有限,但标题确认了这两项更新。
Atlas 是 World Labs 推出的一个“全能世界模型”,目前处于早期测试阶段。它吃进去的可以是文字、图片、视频,甚至是 3D 模型,吐出来的是一段你能自由控制镜头运动的 1440p 高清视频,最长能到一分钟。除了生成视频,它还能用几张照片重建出一个 3D 场景,甚至为机器人模拟时空环境。正文没披露定价和公开发布时间,所以想用上还得先排队等资格。
通义千问刚发的 Qwen3.8-Max-0902 在 Code Arena 的 WebDev 榜单上首次亮相就拿了 1691 分,排总榜第一。这个分数说明它在网页开发任务上表现很强。更值得看的是性价比:混合价 $5/百万 token,在 Pareto 前沿(就是性能和价格的最优平衡线)上是得分最高的模型。现在 QwenCloud 上就能用。不过正文没披...
推荐理由:Qwen3.8-Max-0902 登顶 Code Arena 总榜,同时把价格压到 $5/百万 token,还占了 Pareto 前沿,属于国产旗舰模型的一次硬核更新,正面信号很强。HKR 全中:登顶制造悬念,具体分数和定价有料,性价比话题直接戳中开发者痛点。
Bloomberg 说 Nvidia 接近完成收购 Hugging Face,价格约 129 亿美元,加上其他条款总交易额可能到 140 亿。这个价是 Hugging Face 2023 年融资时 45 亿估值的 2.9 倍,按它现在一年大概 1.5 亿美元收入算,相当于 86 倍的年收入。Nvidia 还谈了一个 10 亿美元的员工留任方案,防止人跑...
推荐理由:Bloomberg 信源,129 亿价格、10 亿留任金、86 倍年收入,三个硬数字撑起一条大新闻。Hugging Face 是开源模型的默认分发层,Nvidia 吃下它,等于把训练和推理的工具链上游捏在自己手里。没给更高分是因为正文没披露监管审批进展和整合后对社区的具体影响,这些缺口让判断先打个折。
Qwen3.8-Max 这次升级主要把参数量堆到了 2.4T,一次能读 1M token 的上下文,差不多是整本《三体》三部曲的量。后训练重点放在写代码和协作任务上,目标是让模型能跑复杂的企业流程、科研项目和长链条工作。正文没给跑分对比,也没提价格,所以实际效果和成本现在还没法判断。
推荐理由:阿里通义千问发了新旗舰 Qwen3.8-Max-0902,参数堆到 2.4T,上下文窗口拉到 1M token,差不多能塞下整部《三体》三部曲。后训练重点在写代码和协作任务上,目标是让模型能扛复杂的企业流程和长链条科研项目。按规则国产旗舰更新给 featured 档。但正文没放跑分对比,也没提价格,实际能打几分、花多少钱现在全不知道,所以分数先稳在这,等后续实测出来再调。
Simon Willison 拿他经典的“画一只骑自行车的鹈鹕”提示词,把 Claude Fable 5.1 的五档推理强度全测了一遍。低和中两档几乎没区别,都没显示推理过程,23 秒左右出图,成本约 10 美分。开到 xhigh 档,模型花了 7 分 51 秒、烧了 1.83 美元,细节明显变多。最高档 max 跑了 13 分 54 秒,成本 3.3...
推荐理由:Simon Willison 做了一次很实在的对照实验,把同一句提示词在 Claude Fable 5.1 的五档推理强度下各跑一遍,给出了每档的耗时和花费。低档和中档几乎没区别,23 秒左右出图、成本约 10 美分;开到 xhigh 档细节明显变多,但花了近 8 分钟和 1.83 美元;最高档 max 跑了快 14 分钟、烧了 3.3 美元。这种带具体数字的横向对比比官方公告更有用,从业者可以直接判断自己该选哪一档。分数没给更高是因为这只是一次个人评测,不是模型能力的重大突破。
作者是 Claude Max 的老用户,每月付 200 美元,某天突然收到一封模板邮件,说检测到“可疑信号”违反了使用政策,账号直接被封,没给任何具体原因。他的一位同事在菲律宾刚付完 100 美元升级 Max 也被秒封。GitHub 上还有巴西、新加坡、马来西亚的用户报告了类似情况,有人升级后几小时内关联账号全挂。Anthropic 的执法像 2010...
推荐理由:多个国家的付费用户都报告了付款后立刻被封的情况,这不是偶发 bug,更像风控系统误伤。H、K、R 全中,但因为信息完全来自用户单方面投诉,Anthropic 官方没回应,事实全貌还不清楚,所以分数卡在 78,不能更高。
Thariq 在 X 上说这两个模型他用了很久,觉得不错,完整评测后面会出。他提了两个实操点:一是对验证要求不高、边界情况少的任务,可以把 effort 调低,省点算力;二是现在切换 effort 不会清掉 prompt cache 了,这对频繁调参的人是个好消息。
彭博社报道了这轮融资的规模和估值,但正文因为反爬机制没抓到,具体条款、投资方和资金用途都没披露。470 亿这个估值放在现在的 AI 创业公司里算很高了,不过在没有更多信息之前,先别急着下判断。
有人在 Strix Halo 笔记本上外挂一块 RTX 3090 Ti,跑通 104GB 的 MoE 模型 Qwen3.8-Flash-Next,推理速度从纯笔记本的 22 tok/s 拉到 84 tok/s。对比双 3090 的 vLLM 服务器,HumanEval+ 编程测试只差一道题,而且总耗时只有服务器的 0.4 倍——如果是真的挺省钱。不过原...
Scott Aaronson 写了篇个人随笔,核心观点很直接:像 GPT 5.6 Pro 和 Fable 这些模型,聊哥德尔定理、聊自己都聊得很溜,但整个技术栈里没人刻意往里面塞“自指”或“奇怪循环”的设计。这些能力纯粹是预训练时“什么都学”顺带出来的副产品。他认为《哥德尔、埃舍尔、巴赫》那套把自指当成智能秘密的旧观念,该跟地心说、燃素论一起埋了。文章...
推荐理由:Aaronson 拿 2026 年的模型行为去反驳 GEB 和 Penrose 的老观念,观点尖锐且有具体模型参照。缺点是这是个人博客随笔,没有实验数据,更像高质量观点输出而非研究成果。选为 featured 是因为这个话题确实能引发讨论,而且他说的‘没人刻意塞自指’这个事实判断本身就有信息量。
彭博社的消息,英伟达快要把Hugging Face买下来了,出价大概140亿美元,这周就可能签字。Hugging Face是AI圈里最大的模型和数据集分享平台,相当于开源模型的GitHub。不过正文被付费墙挡住了,具体的交易条款、监管审批和收购后怎么整合都没披露。140亿这个数字不小,如果成了,英伟达就从卖GPU的硬件商直接变成了掌握核心开发者社区的平...
推荐理由:彭博社爆的料,英伟达快把Hugging Face收了,140亿美元,这周可能签字。Hugging Face就是开源模型的GitHub,AI圈最大的模型和数据集分享平台。不过正文被付费墙挡了,具体交易条款、监管怎么批、收购后两家怎么整合,都没披露。140亿这个数不小,如果真成了,英伟达就从硬件商直接卡住核心开发者社区,影响面很宽。但信息缺口也明显,先别急着下结论。
fal 的 H3 Max Live 在生成 5 秒短片时,推理时间压到了 2.53 秒,比视频本身播完还快,观众在聊天框发句话就能改画面。但 15 秒片段仍需 16 秒生成,跨片段的人物和场景一致性也没解决。按 768p 算,一条视频流连续跑一小时成本在 144 到 288 美元,需要 1,400 到 2,900 人同时在线才能打平。这笔账决定了业务形...
推荐理由:这篇把 fal 的实时视频生成拆成了两笔账:速度账和成本账。5 秒短片确实比播放还快,但 15 秒就慢了,跨片段一致性也没解决,这点先别太激动。一小时视频流要 144 到 288 美元,得 1400 到 2900 人同时在线才回本——这个盈亏线是全文最硬的信息,直接决定业务能不能跑。正文没提人物和场景一致性具体怎么修,也没给更高分辨率的成本,但现有数字已经够从业者做初步测算。
Nvidia打算花129亿美元买下开源模型平台Hugging Face,这是它史上最大一笔收购。Hugging Face年收入大概1.5亿美元,这笔交易相当于86倍的年收入,显然不是冲着账面上的钱去的。它真正值钱的地方在于,全球1300万开发者已经把这里当成了找模型、下权重的默认入口,这种工程惯性很难被替代。过去两年,Nvidia和微软靠买技术授权加挖...
推荐理由:Nvidia 史上最大一笔收购,花 129 亿买一个年收入才 1.5 亿的开源模型平台,86 倍年收入,这账怎么算都不是冲着利润去的。真正值钱的是 Hugging Face 上那 1300 万开发者——他们找模型、下权重已经养成肌肉记忆了,这种工程惯性很难用别的东西替代。微软本来也在谈,现在退出,只剩 Nvidia 一家,反垄断审查反而更扎眼。我会先打个折:正文没披露交易谈判的具体阶段,也没说监管那边有没有初步态度,所以别急着断定一定成或一定黄。但这件事的信息量和行业冲击力确实够顶,给 88 分,差一点满分是因为关键细节还缺位。
Google 正在接触多家好莱坞大厂,想用大价钱买下影视版权来训练 AI 模型。对 Google 来说这笔买卖几乎没风险,但对片厂而言,拿短期现金换长期内容筹码,账不一定划算。报道没披露具体报价和谈判进展,所以数字上的吸引力还不好判断。
Kevin Lewis 分享了他用 M4 Pro Mac Mini(48GB 内存)搭建本地 LLM 服务器的方案。主力模型是 Qwen3.6-35B-A3B-OptiQ-4bit,这是一个混合专家模型(MoE),虽然总参数量 350 亿,但每个 token 只激活 30 亿参数,4bit 量化后只占约 20GB 内存。轻量模型 Gemma-4-E4B...
AfterQuery 又融了一轮,估值 32 亿美元。五个月前它的 A 轮估值才 3 亿,涨了十倍不止。YC 合伙人说这是加速器有史以来从创立到独角兽最快的一家。两位创始人现在才 22 和 23 岁,一年半前刚进 YC。今年四月公司说年化收入跑到 1 亿美元,客户里有英伟达。它跟 Mercor、Scale 这类公司不一样的地方在于,不是只让医生、律师等...
推荐理由:YC 最快独角兽、5 个月估值翻十倍、年化收入 1 亿美元,三个硬数字撑起了重要性。扣分点在于:这是 TechCrunch 转述报道,不是公司自己发的公告,正文也没披露这轮融了多少钱、谁投的。我会先打个折。
Weedout 是一个 1.99 美元买断制的 Safari 扩展(macOS 专用),它利用 YouTube 自己的“Made with AI”标签,自动从首页、搜索结果、相关推荐和 Shorts 里移除被标记为 AI 生成的视频。没有追踪、没有订阅,还提供一个“变暗”模式让你先预览再决定是否隐藏。作者没提是否支持 Chrome,也没说 YouTub...
Anthropic 推出了 Fable 5.1 和 Mythos 5.1 两个新模型,主要回应客户对价格、数据保留和过度安全拦截的抱怨。Fable 5.1 性能比 Fable 5 强,但通常便宜约 25%,跑复杂 agent 任务(让模型进业务流程干活)时最多能便宜 45%,省钱的原理是降低了已缓存数据的调用单价。Every 的 CEO Dan Shi...
推荐理由:Anthropic 发 Fable 5.1 和 Mythos 5.1,核心卖点是 agent 场景降价——靠缓存调用单价下调,最多能省 45%。有具体性能对比和定价细节,信号够硬。没给 90 分以上是因为目前只有标题和摘要,缺少实测数据和客户反馈,先打个折。
Allen AI 开源了一套叫 BenchMIRT 的方法,用多维项目反应理论(MIRT)来审查大模型评测基准到底在考什么。他们分析了 100 个模型在 16 个基准、超过 3.4 万道题上的表现,没给任何预设,系统自动分离出两个核心能力维度:安全性和通用推理能力。比如 BBQ 基准里一道关于祖孙俩叫 Uber 的题,表面测年龄偏见,实际上还要求模型理...
推荐理由:Allen AI 开源了一套方法,拿项目反应理论来审计评测基准,背后有 100 个模型和 3.4 万道题撑腰。分数没上 80 是因为它是个方法论工具,不是能直接上线的产品更新,但 H、K、R 三个点都踩实了,信息也够硬。