跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 961–980 条 · 共 1,195 条

5月7日星期四

机器之心 · 公众号

SWE-Bench 作者出新基准 ProgramBench,Claude、GPT、Gemini 全拿零蛋

这个新基准让模型从零复刻完整软件项目,只给可执行文件和说明文档,不给源码和测试。评测不看单函数写得对不对,而是用模糊测试跑行为一致性,看整个系统能不能用。结果 Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro 全部零完成率,一个都没跑通。这说明现在的模型离独立做系统工程还差得远,之前靠刷单函数题拿高分那套在这不管用。

推荐理由:我会先打个折:这只是单个基准测试报告,不是模型或产品发布。但 0% 的完成率太刺眼,而且测试设计很刁——只给可执行文件和说明文档,让模型从零重建项目,再用行为等价和 agent-driven fuzzing 判分。正文没披露样本量和任务难度分布,这点先别太激动。真正值得盯的是它把评测从函数级代码生成拉到了系统级工程能力,这对做 coding agent 的团队是个实打实的压力测试。

机器之心 · 公众号

马斯克宣布 xAI 解散,Grok 并入 SpaceXAI,22 万张 GPU 算力租给 Anthropic

马斯克确认 xAI 解散,Grok 和 X 平台相关业务全部并入新实体 SpaceXAI。同时,SpaceX 和 Anthropic 签了协议,Claude 将接入 Colossus 1 超算——超过 22 万张 Nvidia GPU、300 兆瓦的算力集群。对用户来说最直接的变化是配额:Claude Code 的五小时速率限制翻倍,Pro 和 Max...

推荐理由:我会先打个折:目前只有单一信源,还没看到 Anthropic 或 SpaceX 的官方公告,所以先不拉满。但消息本身冲击力很强——xAI 解散、Grok 并入 SpaceXAI,Colossus 1 那 22 万张 GPU 和 300 兆瓦算力直接租给 Anthropic,等于把自家训练底座送给了对手。对开发者来说,Claude Code 五小时速率翻倍、Pro 和 Max 高峰配额限制移除是马上能感知的变化。正文没披露租约时长和价格,也没说 Grok 后续怎么迭代,这些缺口让消息还差一口气,但已经够格进 p1。

AI HOT 精选

Open Slide 用 React 写 PPT,让 AI 直接生成和修改幻灯片代码

Open Slide 是一个开源项目,把 PPT 当成 React 组件来写,工作流专门为 AI agent 设计。它用 React 组件库做扩展,方便接入各种图表。项目自带可视化编辑器,你可以手动改,AI 也能直接读你的批注来协同修改内容。它还集成了 SVGL 库,里面有 1500 多个品牌 Logo,做技术演示时直接拖就行。整体思路是让 AI 进到...

推荐理由:我会先打个折:正文没给出实际使用数据或上手测试,所以效果到底怎么样还不好说。但“PPT 变成可编程界面”这个思路本身值得关注,它把幻灯片从拖拽排版变成了代码生成,AI 能直接参与修改和迭代。1500+ Logo 库和评论驱动改稿这两个点让产品有了具体抓手,不只是又一个套壳工具。对经常做演示文档的人来说,省掉排版和反复调整的时间是实打实的价值。

r/LocalLLaMA

Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token

Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。

5月6日星期三

r/LocalLLaMA

Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍,48GB 显存可跑 26 万上下文

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者分享了一个 llama.cpp 的 PR,为 Qwen 3.6 27B 模型添加了 MTP(多令牌预测)支持,实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化,这让一...

推荐理由:HKR 三项都站得住:提速和长上下文对本地 agent 是实打实的吸引力,帖子里机制和数字都列清楚了,成本优势也直接。不过只有 Reddit 单源,配置也有点折腾,所以放在 featured 低位。

Latent Space

硅谷开始认真卖服务了:Anthropic 和 OpenAI 各自成立公司,帮企业把模型塞进业务里

Anthropic 和 OpenAI 这周都宣布了新的企业服务公司。Anthropic 跟黑石等几家华尔街机构搞了个合资公司,总共融了 15 亿美元,每家出 3 亿。他们的做法是先派个小团队去客户那,搞清楚 Claude 能在哪发挥最大作用,然后工程师再上手定制系统。OpenAI 那边动作更大,成立了一家叫 The Deployment Company...

推荐理由:两家头部模型公司不约而同从卖模型转向亲自下场做服务,Anthropic 的合资公司拿了 15 亿美元,OpenAI 的部署公司融了约 40 亿、投前估值 100 亿。我会先打个折,正文没披露这些服务公司的具体业务模式、客户是谁、怎么收费,也没说跟现有云厂商的合作关系怎么处理。但光看资金规模和两家同时行动,这个信号够强,值得从业者留意。

机器之心 · 公众号

DeepSeek版Claude Code登顶GitHub热榜,8700星,一个叫鲸鱼哥的开发者用Rust做了个终端工具

这个叫DeepSeek TUI的工具在GitHub上拿了8700多颗星,是开发者Hunter Bown(鲸鱼哥)用Rust写的,让你在本地终端里直接调用DeepSeek V4干活。它能聊天、改文件、跑shell命令、管任务。比较特别的是RLM模式:一次可以派发最多16个V4 Flash子任务,上下文窗口有100万token,操作前还有审批关卡,等于让模...

推荐理由:我会先打个折:这是个人项目,不是 DeepSeek 官方出品,稳定性和后续维护都还是未知数。但 8700 星的热度是实打实的,RLM 的并发和审批设计也给了具体的技术细节,不是空炒概念。对想省钱又想在终端里用 DeepSeek 干活的开发者来说,这东西值得盯一下,但暂时别把它当生产工具。

新智元 · 公众号

12岁写代码,28岁撑起谷歌20亿业务,他却劝年轻人别卷编程了

Alon Chen 12岁开始写代码,28岁在谷歌管着年收20亿美元的业务。但他现在劝年轻人别再把编程当唯一护城河。他给了两个数字:微软新代码里30%是AI写的,谷歌这个比例也超过25%。他的判断是,以后更稀缺的能力是执行、把问题定义清楚、以及沟通协作,纯写代码的壁垒在变薄。不过正文没披露他具体是在什么场合说的这番话,也没给出这些AI生成代码比例对应的...

推荐理由:这篇不是产品发布或模型评测,更像一篇职业判断类的评论。我会先打个折:它没有披露新模型或新方法,但两个 AI 生成代码占比的数字让它比普通鸡汤更有信息量。正文没给出这些数字的统计口径和验证方式,所以别当精确指标用,但它确实说明大厂内部写代码这件事的构成在变。对从业者来说,这比单纯喊“AI 要取代程序员”更有参考价值,因为它指向的是技能重心的转移,而不是岗位消失。

r/LocalLLaMA

DeepSeek V4 便宜 17 倍,我实测了 10 天写代码哪些活能丢给本地模型

Reddit 用户 spencer_kw 把自己 10 天的编程工作流拆成 150 个任务,拿本地 Qwen 3.6 27B 和云端模型重新跑了一遍。结果 65% 的任务本地模型干得一样好,20% 勉强能用,只有 15% 必须上云端。他的 API 账单从每月 85 美元掉到 22 美元左右。这个测试说明省钱的关键不是盯着模型单价,而是按任务类型做分流—...

推荐理由:这篇不是模型发布,而是一个开发者拿自己的编码工作流做的成本实测,有日志、有复测、有分桶比例,信息量够。单一个 Reddit 帖子的样本量有限,普适性要打个折,所以放在 featured 而不是 P1。我会先看他的任务分类和路由逻辑,这点比“便宜 17 倍”本身更有参考价值。

5月5日星期二

r/LocalLLaMA

ProgramBench:让 AI 从零重建大型程序,目前看还不太行

这篇帖子介绍了一个新基准 ProgramBench,包含 200 个任务,专门考 AI 智能体能不能只靠一个可执行文件和一份使用说明,就把整个程序从零重新写出来。测试过程不允许联网、不允许反编译,相当于给 AI 一个黑盒子,让它猜里面是怎么实现的。团队花了大概 5 万美元生成了 600 万行行为测试用例,再筛出质量最好的来用,这些测试只看程序的外部行为...

推荐理由:这篇东西我会先打个折:它来自 Reddit,没有其他独立信源交叉验证,所以别当定论看。但它的信息量够硬——ProgramBench 用 200 个任务、约 5 万美元生成了 600 万行黑盒测试,让 Agent 只看可执行文件和说明文档去重建程序,还不准联网、不准反编译。结果就是 Agent 基本搞不定,这直接质疑了现在编程 Agent 评测(比如 SWE-bench)到底测的是真本事还是背题库。对从业者来说,这提醒我们别被榜单分数带偏,实际让模型进业务流程干活之前,得先看看它在“闭卷、无网、大工程”这种真实约束下会不会翻车。

机器之心 · 公众号

Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成

Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...

推荐理由:我会先打个折:标题里的“自我进化”和“没有人类了”是媒体写法,Clark 原文说的是无人类参与的 AI 研发概率,不是奇点降临。但他作为联创,拿内部模型跑出来的基准分来押 2028 这个时间点,分量不一样。SWE-Bench 93.9% 说明代码修 bug 这类短任务已经很高,CORE-Bench 95.5% 测的是复现论文的工程能力,真正该盯的是 MLE-Bench 和 PostTrainBench——这两个才碰得到长周期、需要自己调参和做后训练的任务,目前正文没给具体分数,这点先别太激动。整体看,他是在用基准曲线推 timeline,不是纯拍脑...

r/LocalLLaMA

MTPLX 让苹果芯片跑大模型快了一倍多,原生 MTP 推理引擎来了

一个叫 MTPLX 的推理引擎在 MacBook Pro M5 Max 上把 Qwen3.6-27B 的生成速度从每秒 28 个 token 提到了 63 个 token,快了 2.24 倍。测试用的是 4-bit MLX 量化,温度 0.6,top_p 0.95,top_k 20,最佳推测深度 D3。关键点是它直接用了模型自带的 MTP 头做推测解码...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,测试范围也限定在 Apple Silicon,验证面还窄。但 2.24 倍的吞吐提升是实打实的数字,而且 MTP heads 内置在模型里,不用额外加载一个 drafter 模型占内存,这点对 Mac 用户确实挺省钱。正文没披露更多模型或硬件的对比数据,所以先放在 featured 低位,等有更广的复现再往上调。

r/LocalLLaMA

本地跑 Qwen 给 Codex 当代码审查员、协作者和挑刺对手的实测

robert896r1 把 Qwen3.6 27B 的 GGUF 量化版放在 Codex 旁边当代码校验器,并放出了一套可复现的评测流程。测试覆盖了 Bartowski 和 Unsloth 两种量化来源、65k 和 128k 上下文窗口,以及 q8 和 f16 的 KV 缓存精度。三个 128k 上下文的配置并列最佳,在这个评测套件里没测出 q8 KV...

推荐理由:我会先打个折:这不是官方发布,是一个个人实测套件,样本量和覆盖面有限。但它的价值不在权威性,而在把 Qwen 塞进一个贴近真实开发的 sidecar eval 里——测的是漏指令、过度实现、UI 判断和长上下文遗漏,不是跑分。三个 128k profile 并列最佳,q8 KV 没翻车,这点对想省显存的人挺实用。正文没披露 Codex 的具体版本和调用方式,也没给错误分布,所以别当严谨 benchmark 用,更适合当一份本地部署的参考起点。

5月4日星期一

Import AI

AI 研究即将全自动:Jack Clark 预测 2028 年底前,AI 自己造自己的概率超过六成

Jack Clark 根据公开数据做了一个判断:到 2028 年底,不需要人类插手的 AI 研发有超过 60% 的概率会出现。他主要拿两个指标说事。一个是 SWE-Bench,这个测试看 AI 能不能解决 GitHub 上的真实代码问题,Claude 2 当初得分大概 2%,现在 Claude Mythos Preview 已经干到 93.9%,基本把...

推荐理由:HKR 三项全中。Jack Clark 用 SWE-Bench 和 METR 的数据撑起一个 2028 年全自动 AI 研发的赌注,属于知名人物对 AI 时间线的判断,放在 85–94 分档合适,比模型发布的分量低一点。

r/LocalLLaMA

用 Hermes Agent 和 qwen3.6-35b 在本地跑深度研究,生成了 21 页报告

一位 Reddit 用户用 Hermes Agent 框架搭配 qwen3.6-35b-a3b 的 Q6_K 量化版,在单张 RTX 4060 上跑了 6 轮循环、超过 5 小时,生成了一份 21 页的研究报告。生成速度约每秒 28 个 token。仓库里放了提示词、脚本、中间产物和最终报告。正文没披露报告具体主题和结论质量,也没说这 5 小时里人工干...

推荐理由:HKR 三项都站得住:这是一个带硬件型号、运行时长、生成速度和完整产物的本地 agent 实验。来源是 Reddit 个人分享,传播面有限,所以分数放在 72–77 的 featured 门槛区间,不往上拔。

量子位 · 公众号

DeepSeek-TUI 开源:一个用 Rust 写的终端版 DeepSeek 编程助手,GitHub 上拿了 2.3k 星

这是一个叫 DeepSeek-TUI 的终端工具,你可以把它理解成“DeepSeek 版的 Claude Code”,专门在命令行里帮你写代码、跑命令。项目用 Rust 开发,MIT 协议开源,目前主要对接 DeepSeek V4 模型,支持 100 万 token 的上下文窗口。它有个叫 RLM 的功能,能把大任务拆成最多 16 个 V4 Flash...

推荐理由:我会先打个折:2.3k 星在 GitHub 不算爆款,但标题蹭 Claude Code 的热度很精准,加上 Rust 实现和 MIT 协议,对在意可控性和成本的开发者有吸引力。正文没披露实际延迟和任务完成率,所以性能先别太激动。真正值得盯的是缓存成本——未命中 token 价格是命中的 10 倍,如果是真的,对高频编码场景挺省钱。影响面集中在开发者群体,所以重要性给到 75 是合理的。

新智元 · 公众号

迪士尼员工9天狂调Claude 46万次,Meta一个月烧掉60万亿token

新智元这篇推文本身被微信环境拦截,正文没披露原始数据表,只能从标题和摘要反推。标题说迪士尼内部有个AI使用看板,一名员工在9个工作日内向Claude发起了约46万次调用,平均每天超5万次,频率高到像在跑自动化任务。另一组数字是Meta 30天消耗60万亿token,按公开API价格算大概值90亿美元,但实际内部成本肯定低得多。我会先打个折:token消...

推荐理由:HKR三项都成立:钩子靠两个夸张的用量数字立住,知识部分有仪表盘截图和token折算,痛点踩在企业最关心的Claude成本控制上。分数维持74,因为数据都是二手转述,正文没给原始数据表,我会先打个折。

最佳拍档

Claude Code 变笨了,Anthropic 复盘出三个 bug

Anthropic 自己复盘了 Claude Code 性能回退的原因,点出三个具体问题:推理强度被改动、缓存优化出了错、系统提示词有长度限制。视频标题只给了这些结论,正文没披露复现步骤、时间线和修复状态。核心看点是 AI 审 AI 代码时,工程约束下容易踩坑——这点先别太激动,信息缺口还很大。

推荐理由:HKR 三项都成立,但正文只给了三个原因分类,没交代复现步骤、时间线或修复状态。Claude Code 相关度高,所以放在 72–77 这个区间。

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

机器之心 · 公众号

百亿公司 CTO 们集体跳去 Anthropic 当一线工程师

机器之心这篇文章本来想盘点 2025 年 1 月到 2026 年 4 月间,至少六位从 Workday、You.com、Box、Super.com、Adept AI 等公司离职加入 Anthropic 做个人贡献者(IC)的前 CTO,但微信页面被环境异常拦截,正文内容完全看不到。从已有的英文摘要看,核心讨论点不是“为了 AGI 理想”,而是职业杠杆—...

推荐理由:这篇不是产品发布或模型更新,是篇评论,但切入点很巧。它没停留在“为了 AGI 理想”这种公关叙事,而是把重点放在职业杠杆上:当 CTO 不如在 Anthropic 当工程师划算,说明顶级 AI 公司里技术执行者的议价权在涨。我会先打个折,因为正文没给出这些 CTO 具体负责什么、薪资怎么变,但 6 个案例摆在那,趋势信号是清晰的。