跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 581–600 条 · 共 1,195 条

6月19日星期五

MIT Technology Review · AI

迈阿密初创公司 Subquadratic 放出第三方跑分,声称解决了让大模型又慢又贵的“注意力瓶颈”

Subquadratic 之前说自己的 SubQ 模型能打破大模型里那个让成本随文本长度平方级暴涨的“密集注意力”瓶颈,当时没给证据,被很多人叫“AI 版 Theranos”。现在他们拿出了 Appen 的独立测试结果,显示 SubQ 一次能处理的文本量是多数模型的 12 倍,速度更快、成本更低,在编程任务上大致追平 DeepMind、OpenAI 和...

推荐理由:Subquadratic 从被群嘲到拿出 Appen 的独立测试数据,这个反转有实质内容:12 倍上下文窗口、更低成本、编程能力追平一线模型。MIT Tech Review 独家报道增加了信源分量。没给更高分是因为目前只有一家第三方测试,样本还少,正文也没披露具体延迟和成本数字,我会先打个折。

Latent Space

GLM-5.2 通过社区实测,Z.ai 预告年底开源 Fable 级模型

智谱的 GLM-5.2 被多个独立来源认为是第一个在日常使用中摸到前沿水平的开源模型。Jeremy Howard 觉得它至少不输 Opus 4.8 和 GPT-5.5,但缺视觉能力。Artificial Analysis 在一个知识工作评测里把它排在 GPT-5.5 之上。架构上新增了 IndexShare,把稀疏注意力的 top-k 索引跨层复用,目...

推荐理由:GLM-5.2 被 Jeremy Howard 和 Artificial Analysis 分别给了正面评价,是少有的开源模型被独立来源推到和 GPT-5.5、Opus 4.8 同一档。扣分是因为原文是付费 newsletter,细节有限,但判断本身有多个信源交叉验证,可信度不低。

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

AI HOT 精选

Steve Yegge:Fable 被美国政府短暂关闭,意味着最聪明的 AI 模型以后会像核武器一样被锁起来

Steve Yegge 认为,Fable 模型被美国政府短暂关停是一个分水岭,说明模型智能已经危险到需要管控了。他预测,最多再过两三代模型,最前沿的 AI 就会像核武器一样被政府严格管制,绝大多数财富 500 强公司都拿不到访问权限。开源模型虽然能追到 Fable 这个级别,但受限于算力壁垒和供应链封锁,很难再往上突破。对大多数人来说,AI 能力曲线会...

推荐理由:Steve Yegge 把 Fable 被短暂关停这件事当成一个分水岭来聊,核心论点是 AI 能力曲线很快会被政府管制压平。判断很锋利,预测也具体,但本质是评论分析,不是一手报道,缺可核实的新事实,所以分数上我会打个折。

AI HOT 精选

Claude Code 现在能把终端里的工作进度直接生成可分享的网页

Claude Code 开始支持 artifacts 了。你在终端里干活时,它可以把你当前的进度——比如代码改动说明、系统架构解释、数据看板——直接生成一个能交互的网页。这个网页带着完整的对话上下文,队友不用装 Claude Code 就能看。官方没说明这个功能是默认开启还是需要手动触发,也没提生成一个 artifact 会吃掉多少 token。

推荐理由:Anthropic 给 Claude Code 加了 artifacts 功能,你在终端里写代码、改架构、看数据时,能直接生成一个可交互的网页,把当前进度和完整对话上下文都打包进去,队友不用装 Claude Code 就能看。这对一直偏单人用的工具来说,是往团队协作迈了一步。不过官方没说明这个功能是默认开启还是需要手动触发,也没提生成一个 artifact 会吃掉多少 token,这点先别太激动。分数维持 78,因为 token 成本没公布,实际用起来可能得先打个折。

AI HOT 精选

Anthropic 官方指南:用 CLAUDE.md、技能、钩子、规则和子智能体调教 Claude Code

Anthropic 这篇博客把调教 Claude Code 的方法拆成了五块:CLAUDE.md 文件用来写项目级的全局指令,告诉模型这个项目的代码风格、架构和约定;技能(skills)是把重复的任务流程模板化,让模型按固定步骤执行;钩子(hooks)能在模型执行操作前后自动触发检查或脚本,比如提交代码前跑一遍测试;规则(rules)直接约束模型的行为...

推荐理由:Anthropic 出了一篇实操指南,把控制 Claude Code 的手段讲得很清楚,五层机制各有侧重,组合起来就是一套让模型在项目里更可控的玩法。它不是产品发布,所以重要性没到 85,但对正在用 Claude Code 的人来说很解渴,值得放进 featured。

6月18日星期四

Hacker News 首页

本地 Qwen 不是缩水版 Opus,它是另一种工具

Alex Ellis 用一块 RTX 6000 Pro 跑本地模型,两三个月就回本了。Qwen 27B 在 SWE-Bench 上只比 Claude Opus 4.8 低 12%,但一到他写的 Go 分布式系统里,量化后的模型就会陷入死循环和幻觉——他仍然不敢让它无人值守干活。正文没披露 token 速度和延迟数据。

推荐理由:Alex Ellis 拿自己公司的代码库做了次真实对比,不是跑分党自嗨。Qwen 27B 在 SWE-Bench 上只比 Opus 4.8 低 12%,看着差距不大,但一进他的 Go 分布式系统就翻车——量化后死循环、幻觉,他仍然不敢让模型无人值守干活。我会先打个折:正文没给 token 速度和延迟数据,结论偏个人经验,不是系统性评测。但“跑分接近不等于干活靠谱”这个判断,对正在选型的人很值钱。

AI HOT 精选

苹果在 Xcode 27 里塞了个 AI 助手,能用聊天的方式修 Bug、搭 App

苹果在 WWDC 2026 的一个讲座里演示了 Xcode 27 的新 AI 功能。这个 AI 助手直接嵌在工具栏里,支持多轮对话,可以跨多个文件改代码,也能根据你的文字描述加上图标等素材,直接生成一个完整的 App。生成之后还能继续用对话让它加背景、特效、动画和翻译。底层方面,苹果推出了新的 Core AI 框架和升级版 MLX,让开发者在 App ...

推荐理由:苹果在 WWDC 讲座里演示了 Xcode 27 内置的 AI 助手,能跨文件修 Bug、按描述生成完整 App,底层还配了新的 Core AI 框架。对开发者工具链来说是一次实打实的升级,但正文没提发布时间和测试范围,所以分数先打个折。

AI HOT 精选

开源模型当程序员助手够格吗?Hugging Face 拿自家代码库做了个摸底测试

Hugging Face 把自家的 transformers 库当成考场,让开源模型驱动的编程助手去写代码、调接口、自己改 bug,看它们到底要绕多少弯路、花掉多少 token 才能把活干完。他们没只看最终答案对不对,而是把整个解题过程拆开看:不同模型、不同版本的库、不同任务下,成功率和成本差了多少。结论是,库的文档写得好不好、接口设计得顺不顺,会直接...

推荐理由:Hugging Face 把自家 transformers 库当成编程助手的考场,让开源模型去写代码、调接口、改 bug,没只看最终答案,而是把整个解题过程拆开算账:不同模型、不同库版本下,成功率和 token 消耗差了多少。结论很实在——库的文档和接口设计顺不顺,直接决定模型要多花多少成本才能把活干完。这不是能力突破,是评测方法上的创新,对实际做 agent 的人选模型很有用,所以给到 78 分。

AI HOT 精选

Claude Design 更新:跨项目记住你的品牌规范,还能和 Claude Code 搭着用

Anthropic 给 Claude Design 加了两个实用能力:一是它能跨项目记住你的设计系统,比如颜色、字体、组件这些,不用每次都重新教它;二是它现在能和 Claude Code 协同,你可以在编辑器里直接改设计稿。正文没提具体上线时间,也没说这是免费功能还是付费功能。

推荐理由:Anthropic 给 Claude Design 加了跨项目设计记忆和 Claude Code 协同,两个能力都算实在,不是画饼。但正文没提上线时间和是否收费,信息密度刚好够上 featured,再高就给不了了。

AI HOT 精选

Claude 出了个设计工具,能跨项目统一品牌风格,还能在画布上直接改

Anthropic 在 Claude 里塞了个叫 Claude Design 的设计功能。它主要干三件事:跨项目自动保持品牌视觉一致,不用来回对色卡和字体;支持在画布上直接编辑,不用导出到别的软件;还能跟 Claude Code 同步,但正文没解释同步具体是怎么实现的、支持哪些第三方工具,也没说什么时候正式上线。如果是真的,对需要频繁出设计稿又不想在工...

推荐理由:Anthropic 把设计功能直接塞进 Claude,跨项目品牌统一和画布编辑这两个点打的是真实工作流里的痛点,不是纯 demo。但正文对 Code 同步的实现方式、第三方工具支持和上线时间只字未提,信息缺口让这条消息停在值得关注但还不能全信的级别。

6月17日星期三

Hacker News 首页

AI 要求更强的工程纪律,而不是更弱

Charity Majors 澄清她没让人跳过代码审查。她回顾了 AI 写代码从 2025 年初的“废料”到年底 Opus 4.5 发布后达到普通工程师水平的过程,代码生产成本几乎降为零。她强调,软件团队真正的产出是共享理解,而不是代码行数。正文没有列出她具体推荐的新纪律,但指出当代码变得像一次性耗材时,靠读代码来理解系统已经不够用了。

推荐理由:Charity Majors 澄清她没让大家跳过代码审查,核心论点是:当代码生产成本趋近于零,过去靠读代码来建立系统理解的老办法会失效。她把 Opus 4.5 作为一个分水岭,让论点有了时间感,但正文没列出她具体推荐的新纪律是什么,这点先别太激动。整体是对‘AI 时代工程实践该怎么变’的一次清醒喊话,不是技术方案。

Hacker News 首页

GLM-5.2 登顶开源模型排行榜,在智能体任务上打平 GPT-5.5

Z.ai 的 GLM-5.2 在 Artificial Analysis 的 Intelligence Index v4.1 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro(都是 44 分),成了目前最强的开源权重模型。模型体量没变,还是 744B 总参数、40B 活跃参数,但科学推理和智能体任务进步明显:HLE 涨了...

推荐理由:GLM-5.2 在 Artificial Analysis 的 Intelligence Index 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro,成了最强开源权重模型。参数没变,分数涨了 11 分,科学推理和智能体任务有实打实的提升。但这是单一评测机构的单榜成绩,没有其他来源交叉验证,所以重要性给到 82 分,先打个折。

Hugging Face 博客

GLM-5.2 发布:第一个真正能用 100 万 token 上下文的开源模型,专啃长周期编程任务

Z.AI 开源了 GLM-5.2,一个为长周期编程任务设计的模型。它把上下文窗口做到了 100 万 token,而且不是光能塞进去,是在 agent 跑一长串操作后质量依然稳得住。架构上用了两个新东西:IndexShare 让每四层稀疏注意力共用一个索引器,在 100 万 token 长度下把每个 token 的计算量砍到了原来的约三分之一;MTP 投...

推荐理由:Z.AI 开源了 GLM-5.2,主打 100 万 token 上下文和长周期 agent 任务。架构上 IndexShare 和 MTP 投机解码都是新东西,不是换皮。不过正文没放完整 benchmark,我会先打个折,卡在 85 以下。

AI 群聊日报

群友实测:Fable 5 活了三天就被收走,但用过的人都说它是“上帝下凡”

Anthropic 的 Fable 5 模型上线大约 72 小时就被撤下,正文没披露具体原因。群友实测下来,它在复杂推理、编程和写作上明显强过 Opus 4.8 和 GPT-5.5:有人卡了两个月的难题它两分钟解决,MindStudio 测出多步编程自纠率 81%,Vellum 直接说这是“代差级跃升”。但它也有短板——代码评审精度不如 Opus 4....

推荐理由:Anthropic 的 Fable 5 短暂露面后被撤,群友实测数据扎实(81% 自纠率、代差级跃升评价),在钩子、干货和情绪共鸣三个维度都踩中了。扣分点在于信源是群聊整理而非官方发布,且下架原因正文没披露,所以重要性没给到顶。

Latent Space

Z.ai 开源 GLM-5.2:744B 参数,前端编程跑分压过 Claude Opus 4.8

Z.ai 周末扔了个 MIT 许可的 GLM-5.2,744B 参数的 MoE 模型,主攻编程和长流程任务。第三方评测显示,它在 Code Arena 前端榜上把 Claude Opus 所有版本都超了,总榜也只比 Opus 4.8 差一点。模型支持 100 万 token 上下文,有 high 和 max 两档推理模式,API 价格和 5.1 一样,...

推荐理由:GLM-5.2 在 Code Arena 前端榜上压过了 Claude Opus 所有版本,总榜也只比 Opus 4.8 差一点。744B 的 MoE 加 MIT 许可,对前端和 agent 开发者来说是个实打实的新选项。没给到 85 分以上,是因为目前只有第三方评测和官方说法,正文没披露技术报告或自家复现结果,这点先别太激动。

AI HOT 精选

Wolfram 语言和 Mathematica 15 版发布:每个笔记本都内置了 AI 助手,还加入了符号音乐

Stephen Wolfram 亲自写了篇长文介绍 15 版更新。最大的变化是每个笔记本里都塞了一个 AI 助手,用的是 Wolfram 自家的大模型,能帮你写代码、解释结果、生成图表。这次还新增了“符号音乐”,你可以用代码写乐谱、做音频分析。新加的 ModelFit 是个超级函数,把回归、分类、时间序列预测这些活统一到一个接口里了。TimeSerie...

推荐理由:15 版是 Wolfram 一次扎实的功能更新,ModelFit 和符号音乐有真东西,AI 助手直接嵌进笔记本也实用。但受众窄,AI 部分更像补齐短板而非领先,所以 H 和 K 都成立,R 不成立,刚好落在 featured 档。

AI HOT 精选

GLM-5.2 开源:Code Arena 盲测登顶,专攻长任务和代码

智谱把 GLM-5.2 用 MIT 协议开源了。它在 Code Arena 前端开发盲测里拿了公开可用模型第一,代码能力卡在 Claude Opus 4.7 和 4.8 之间。模型支持 100 万 token 无损上下文,能跑跨天的长任务。在 FrontierSWE 上只比 Opus 4.8 低 1%,超过了 GPT-5.5 和 Opus 4.7;Te...

推荐理由:智谱把 GLM-5.2 用 MIT 协议开源了,代码能力在 Code Arena 前端盲测里排公开模型第一,夹在 Claude Opus 4.7 和 4.8 之间,FrontierSWE 只比 Opus 4.8 低 1%,还支持 100 万 token 无损上下文跑跨天长任务。这几个数字放在一起,对国内做应用和工具链的人来说是近期最值得上手试的国产模型。没给更高分是因为目前只看到摘要,完整评测和实际落地表现还没出来,先打个折。

AI HOT 精选

Sumi:从头训练的 7B 开源均匀扩散语言模型

Sumi 是第一个从零开始、用 1.5 万亿 token 预训练出来的 7B 参数均匀扩散语言模型。均匀扩散的意思是,模型在生成文本时每一步都可以修改任意位置的词,不像传统模型只能从左往右写,理论上更灵活。团队把模型权重、训练检查点和完整配方全公开了,包括用了哪些公开数据集、怎么混合的。在知识、推理和代码评测上,Sumi 跟同等训练量的自回归模型打得有...

推荐理由:Sumi是第一个从零预训练出来的7B均匀扩散语言模型,用了1.5万亿token,生成时能在任意位置改词,不像自回归模型只能从左往右写。团队把权重、训练检查点和完整配方都公开了,在知识、推理和代码评测上跟同等训练量的自回归模型打得有来有回。这点先别太激动——正文没披露推理速度和实际部署成本,扩散模型在落地时往往比自回归慢不少。不过敢在主流路线之外砸资源从头训一个7B模型,还把家底全亮出来,本身就值得关注。

AI HOT 精选

智谱上线并开源 GLM-5.2,主攻编程和长链条任务,综合跑分进了全球前三

智谱把 GLM-5.2 放出来了,代码开源,MIT 协议,可以商用。这个模型在 Artificial Analysis 综合榜上拿了 51 分,跟 Anthropic、OpenAI 排在前三,是开源模型里目前最好的。前端开发盲测 Code Arena 上拿了全球可用模型第一。这次最大的升级是实打实的 100 万 token 无损上下文,专门用来跑长链条...

推荐理由:智谱把 GLM-5.2 完整开源了,MIT 协议,商用没限制。模型在 Artificial Analysis 综合榜拿 51 分,跟 Anthropic、OpenAI 排在前三,是开源模型里目前最好的成绩;Code Arena 前端开发盲测也拿了全球可用模型第一。这次最大的升级是实打实的 100 万 token 无损上下文,专门跑长链条任务,FrontierSWE 和 SWE-Marathon 两个长程基准上的分数落在 Claude Opus 4.7 和 4.8 之间,还放出了一个 88 万 token 的完整跑通案例。对做 AI 工程的人来说,这...