跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 661–680 条 · 共 1,195 条

6月10日星期三

Hacker News 首页

Claude Fable 5 与 Mythos 5 系统卡:一个模型,两套安全锁

Anthropic 发了份 319 页的系统卡,讲的是同一个新模型拆成了两个版本:Fable 5 给大众用,但加了安全锁,不让它在生物、网安这类高危领域干活;Mythos 5 则把相关限制解开了,只开放给 Project Glasswing 等少数受信合作伙伴。先说能力,Mythos 5 是他们训过最强的模型,在漏洞开发这类网安测试里把 Opus 4....

推荐理由:Anthropic 在同一天发了 Claude 5 的两个版本和配套系统卡,Mythos 5 自称最强、但只给受信伙伴用,Fable 5 则在高危领域加了限制。这种能力分级和透明披露的做法,对关注模型安全与能力边界的从业者来说是个重要信号。放在 85–94 这个区间没问题,因为信息够新、够具体,而且直接关系到 Claude 用户和开发者的实际使用。

AI HOT 精选

GitHub Copilot CLI 现在能建自定义 AI 智能体,把一次性终端指令变成可重复跑的工作流

GitHub Copilot CLI 新增了自定义智能体功能,让模型能读懂你团队的技术栈和常用流程,把以前在终端里零散敲的提示词变成一套可复用的自动化工作流。正文没披露具体的配置方式、推送范围和是否额外收费,所以实际落地成本还不清楚。

推荐理由:GitHub 官方产品更新,HKR 拿到 H 和 R:自定义 Copilot CLI 智能体对开发者工作流有实际影响。K 偏弱,因为配置方式、推送范围和是否额外收费都没披露,所以定在 featured 门槛。

6月9日星期二

AI HOT 精选

Cohere 发布 North Mini Code:一个 30B 参数、每次只用 3B 的开源代码模型

Cohere 在 Hugging Face 上开源了 North Mini Code,采用 Apache 2.0 协议。这是一个 30B 参数的混合专家模型,每次推理只激活 3B 参数,专门为让模型在终端里自主写代码、修 bug 这类任务设计。在 SWE-Bench Verified 上,它的 pass@10 跑到了 80.2%,在 Artificia...

推荐理由:HKR-H 来自一个紧凑的 MoE 编码模型加上一个亮眼的 SWE-Bench 成绩;HKR-K 有参数、协议、上下文和基准数据。Cohere 不是前沿实验室,所以这个发布放在 78-84 分的开源编码模型区间比较合适。

AI HOT 精选

Qwen3.7-Max 靠一份 15 万字文档,4 小时做出能跑的手机和网页应用

实验里 Qwen3.7-Max 不看设计稿、不接后端,只读一份约 15 万字的产品调研文档,在隔离环境里分别生成了安卓 APK 和一个 Web 应用,单端耗时约 4 小时,中间没人插手。模型本身看不懂图,它是通过像素坐标反推布局来还原界面。做法是把任务拆成规划、架构、编码等阶段,每步做完就检查——静态检查、编译自检(0 error)、Web 端 34 ...

推荐理由:我会先打个折:正文没披露失败率、重试次数、人工介入点,也没说这15万字文档本身质量如何。但亮点在于它把模型看不懂图这个短板说清楚了——靠像素坐标反推布局,不是真懂设计。任务拆成规划、架构、编码并逐段自检的做法,让4小时出双端这件事有了可复现的骨架。如果是真的挺省钱,但没给对比基线,先别太激动。

Hacker News 首页

微软开源工具遭入侵,攻击者专门窃取 AI 开发者的密码

TechCrunch 报道,微软旗下部分开源工具被黑,攻击者直接瞄准 AI 开发者的登录凭证。正文没披露具体是哪些工具、攻击怎么发生、持续了多久、有多少人中招。目前只有标题和极简摘要,细节全缺,先别急着下结论。

推荐理由:TechCrunch 的报道加上 Hacker News 首页热度,来源分量够,标题直接命中安全事件和账号风险。但正文几乎没给细节,工具名、攻击手法、受害规模全是空白,所以知识增量打折扣。我会先打个折:事件值得关注,但别急着下结论,等后续披露再说。

Latent Space

Cognition 发布 FrontierCode 基准:代码能跑不算完,得看能不能合进主分支

Cognition 做了一个叫 FrontierCode 的代码评测,不再只看模型生成的代码能不能通过单元测试,而是直接问“这代码你敢合并吗”。题目是找开源项目维护者一起出的,每道题要花 40 多个小时去设计,评分会看会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。目前最强的模型 Opus 4.8 在最难的那档题目...

推荐理由:Cognition 这个 FrontierCode 评测不再看模型生成的代码能不能跑通测试,而是直接问“你敢合并吗”。题目找开源维护者一起出,每道题设计要 40 多小时,评分维度包括会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。目前最强模型 Opus 4.8 在最难那档题目上表现最好,但正文没披露具体分数和对比细节。评测思路确实补了现有基准的盲区,不过刚出来还没被社区复现验证,78 分合理。

AI HOT 精选

Cursor 把欧洲总部放在伦敦,计划招 200 人;SpaceX 手里攥着 600 亿美元收购它的选择权

Cursor 是做 AI 编程助手的,你告诉它想开发什么功能,它能自动生成代码。这次它把欧洲总部定在伦敦,主要是看中当地技术人才多、语言多元,方便服务整个欧洲市场。公司计划年底前把欧洲团队从现在的七八十人扩到 200 人左右,还会在巴黎、慕尼黑等城市设小办事处。一个关键背景是,很多欧洲客户(尤其是金融、医疗这类强监管行业)要求数据必须留在欧洲境内,所以...

推荐理由:Cursor 把欧洲总部放在伦敦,年底前团队要翻倍到 200 人,这本身是常规扩张。但 SpaceX 手里那个 600 亿美元的收购选择权让整件事变味了——一个做代码助手的公司被这种量级的选项挂着,估值想象力直接拉满。正文没披露触发条款和行权条件,这点先别太激动。另外提到 100 亿的合作伙伴数字,也没说清是收入口径还是 GMV,我会先打个折看。整体信息密度高,但信源单一,所以停在 77 分不进 78 那档。

AI HOT 精选

小米 MiMo 1T 模型跑出每秒超 1000 token,靠混合量化和并行解码把速度提了 10 倍

小米 MiMo 和 TileRT 给 1T 参数旗舰模型加了个 UltraSpeed 模式,输出速度首次超过 1000 tokens/s。模型这边用了 FP4 混合量化,只量化 MoE 的 Expert 部分,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下平均一次能接受 6.30 个 token,相当于猜对的命中率不低。系...

推荐理由:我会先打个折:正文没提硬件配置、batch size、并发数,也没说测试用的 prompt 长度和具体环境,所以这个 1000 tokens/s 的绝对值先别太激动。但亮点是技术组合说得清楚——FP4 只量化 MoE 的 Expert 部分,不是全模型瞎压,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下一次能猜对 6.30 个 token,命中率不低,说明这套方案在代码生成这种结构化输出上确实有效。小米给旗舰模型开 UltraSpeed 模式,还定了三倍 Pro 版的价格,摆明了是要在推理速度和 API 商业化上抢个身...

AI HOT 精选

FrontierCode 基准给 AI 编程泼了盆冷水:最强模型代码合并通过率只有 13.4%

Cognition 搞了个叫 FrontierCode 的编程评测,找了 20 多位资深开源维护者手工出了 150 道题,每道题平均花 40 小时以上,还配了 3000 多条审核规则,核心就一个标准:维护者看完代码愿不愿意合入主分支。他们直接点名 SWE-Bench 这类老评测,说里面超半数通过的代码其实是没法维护的垃圾。结果挺惨淡:Claude Op...

推荐理由:HKR 三项都站得住:13.4% 的惨淡通过率是个天然钩子,维护者手工出题和审核的流程给了足够的方法细节,对老评测的批评又正好打在开发者对 AI 代码质量的信任痛点上。不过这是单一团队发布的基准,还没经过社区反复验证,所以分数卡在 78–84 这个区间,不往上拔。

AI HOT 精选

把 GitHub 的自动测试搬到 Hugging Face Jobs 上跑,Trackio 项目 CPU 任务快了约 30%

Hugging Face 发了篇博客,手把手教你怎么用 huggingface/jobs-actions 把 GitHub Actions 的 CI 流程搬到他们的 Jobs 服务上执行。核心思路是让 GitHub 把任务派给一个在 HF Jobs 里临时启动的“自托管运行器”,跑完就销毁。他们拿 Trackio 项目试了水,CPU 任务耗时缩短了约 ...

推荐理由:HKR 三项都站得住。H 靠的是“用 HF Jobs 当自托管运行器跑 CI”这个具体操作,不是空谈概念。K 有明确的产品名、Trackio 实测数据和约 30% 的提速数字,信息量够。R 切中的是 ML 团队常遇到的 CI 贵、GPU 不好找的问题。整体属于工具链层面的实用更新,不是平台级大发布,放在 featured 档位合适。

AI HOT 精选

Anthropic 发了个 Swift 包,三行代码就能在苹果 App 里调用 Claude

Anthropic 给苹果开发者送了个新工具:一个 Swift 包,让 Claude 直接接入苹果的 Foundation Models 框架。开发者写三行代码就能调用,返回的是 Swift 原生类型,不用自己解析 JSON。支持多步推理、代码生成、联网搜索和数据分析,跑在 iOS 27、macOS 27 这些新系统上。说白了,就是苹果在自己的 AI ...

推荐理由:HKR 三项都成立:Anthropic 确实发了一个让 Claude 接入苹果 Foundation Models 框架的 Swift 包,但这是开发者工具层面的集成,不是新模型发布,所以放在 featured 档里偏高的 82 分。正文没提这个包是否开源、有没有延迟或成本数据,我会先打个折,别把它当成 Claude 在苹果端全面铺开的信号。

The Verge · AI

苹果用 AI 让 Safari 用户自己“说”出浏览器扩展

苹果演示了 Safari 结合 Apple Intelligence 的新玩法:你只要用大白话描述需求,比如“把网上的菜谱存下来并加备注”,浏览器就能当场生成一个叫 Recipe Keeper 的扩展。这招是想解决 Safari 扩展数量一直追不上 Chrome 等对手的老问题,因为苹果对扩展开发的要求比较严。不过报道没提这个功能什么时候上线、需要哪个...

推荐理由:苹果演示了用自然语言让 Safari 自己写扩展,比如喊一嗓子“把网上菜谱存下来加备注”,浏览器就当场生成了一个 Recipe Keeper。这招是想解决 Safari 扩展一直比 Chrome 少的老问题,因为苹果对扩展开发卡得比较严。我会先打个折:正文只给了一个演示案例,没提什么时候上线、需要哪个系统版本、对开发者有什么限制,所以目前还只是一张饼。信息缺口明显,先按中等偏上的产品更新处理,给 73 分。

AI HOT 精选

Sam Altman 说 OpenAI 计划到 2028 年让 AI 自己搞大部分研究

Sam Altman 在一篇博客里列出了三个目标:先造出能自动做研究的 AI 研究员,再用它去加速科学和产品开发,最后给每个人配一个个人 AGI,帮你处理工作、学习、写代码、做生意、健康文书和日常决策。时间节点定在 2028 年 3 月,但正文没披露具体怎么验证这些目标是否达成,也没说成本、安全措施或失败预案。

推荐理由:HKR三项都踩中了:OpenAI给AGI研究路线图贴了个2028年3月的标签,还列了三个目标。我会先打个折,因为原文只是一篇博客摘要,不是正式产品发布或带技术细节的长文,所以没给P1。正文没披露怎么验证目标是否达成,也没提成本、安全措施或失败预案,这点先别太激动。

r/LocalLLaMA

Levi:在你的本地 Qwen 30B 上跑类似 AlphaEvolve 的搜索系统

Levi 是一个开源项目,让你能在本地用 Qwen3-30B-A3B 模型跑一套类似 AlphaEvolve 的搜索系统。作者在 ADRS、IFBench 和 HotpotQA 三个基准上做了测试,声称在单模型、相同预算的条件下,整体成本最多能降到原来的 1/35,评估次数最多能减少到 1/12。不过正文被 Reddit 的网络屏蔽页挡住了,具体实现细...

推荐理由:这篇来自 Reddit 的帖子只给了模型名、基准和成本比例,代码成熟度和可复现细节正文被屏蔽了没看到,所以我会先打个折。但能在本地用 Qwen3-30B-A3B 跑 AlphaEvolve 风格搜索这件事本身挺抓人,数字如果属实确实省钱,先给 featured 让社区去验证。

6月8日星期一

AI HOT 精选

Hivemind 给 AI 编程助手加了个“记性”,能把每次干活的经验存下来复用

Hivemind 这个工具现在开放了持续学习功能,专门给 AI 编程智能体用。它会自动收集 Claude Code、Codex、Cursor、Hermes、Pi 这些助手干活时的操作轨迹,把成功的套路提炼成可复用的技能,存到你自己的云盘里,再同步给所有助手。内置的 SkillOpt 负责持续训练这些技能,效果上,Claude Code 准确率涨了 19...

推荐理由:HKR三项都站得住,但这是Hivemind的一次功能更新,不是大厂动作,也没有其他来源交叉验证。52个场景的测试结果让它有干货,够格进低位的featured。

r/LocalLLaMA

RTX 5090 跑 Qwen3.6-27B 实测:DFlash 投机解码加 KV 缓存压缩,速度提到 3.26 倍

作者在单张 RTX 5090 上跑了 Qwen3.6-27B,用 DFlash 做投机解码(让一个小模型先猜答案,大模型再核对,省时间),同时压缩 KV 缓存(把模型记住的上下文瘦身,省显存)。结果最高提速到 3.26 倍。用 q4_0/turbo4 量化时速度是原来的 3.18 倍,WikiText-2 上的困惑度只涨了 0.02%,基本没掉精度。不...

推荐理由:作者在消费级新卡上实测了一套组合拳:用小模型先猜答案再让大模型核对(投机解码),同时把模型记的上下文瘦身(KV 缓存压缩)。结果速度翻了三倍多,精度几乎没掉。这对想在本地跑大模型的人来说是个很实在的参考,数据也够具体。不过来源只有 Reddit 一个帖子,我会先打个折,别当正式论文看。

r/LocalLLaMA

双卡 3090 跑 27B 模型,解码速度几乎翻倍,没插 NVLink 也做到了

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试,对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下,叙事类文本的解码速度从 53 token/秒涨到 94 token/秒,代码类解码从 62 token/秒涨到 1...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次测试,没换模型、没换卡型复现,所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下,qwen3.6-27b 的 int4 量化版用张量并行跑,解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说,这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现,这些缺口让结论只能停在“值得自己试一下”的程度。

AI HOT 精选

ChatGPT 要变成 AgentGPT 了

OpenAI 准备给 ChatGPT 做上线以来最大的一次改版,从聊天机器人转成一个能直接干活的 Agent 平台。它会整合自家的编程工具 Codex、图像生成,还会接入 Canva、Booking 这类第三方应用。高管放话说“聊天已死”,目标是做成跨平台的个人 AI 助手,以后甚至不用你手动输入提示词。改版预计几周内在网页和手机端上线。商业压力不小:...

推荐理由:这条消息把改版讲得挺清楚,但来源只是一条 X 帖子,正文没披露正式上线时间、开放范围和定价,我会先打个折。高管那句“聊天已死”听着唬人,实际产品还没交付,这点先别太激动。整体判断是:方向重要,落地细节还缺,所以放在 84 分这个位置。

6月7日星期日

r/LocalLLaMA

一台笔记本跑通 Qwen3.6 35B-A3B:我的本地模型“从零到一”时刻

一位 Reddit 用户分享了自己在笔记本上跑通 Qwen3.6 35B-A3B 的体验。他的机器是华硕 Zenbook Pro 14,配了 RTX 4060 8GB 显存和 64GB 内存。用 llama.cpp 加载 unsloth 的 IQ3_XXS 量化版模型,在 3.2 万 token 上下文时生成速度约 27 token/秒,拉到 25.6...

推荐理由:这是单个用户的 Reddit 实测,不是官方发布或论文,但硬件、量化方式、上下文长度和速度都给得很具体,对想在自己机器上跑大模型的人有直接参考价值。我会先打个折,因为只有一台机器的数据,不代表普遍表现,但信息密度够上 featured,分数放在 72–77 这个区间合理。

AI HOT 精选

北海道农民雇了个叫 Codex 的工程师,用 AI 干了 8 件农活

北海道农民富安弘毅把 ChatGPT 和 Codex 当工程师用,做了 8 件事:拍照识别西兰花病害、用卫星 NDVI 数据看作物长势、拿 ESP32 加 LINE 机器人远程开关温室卷帘、给农场群聊写了个管温度和排期的机器人、从聊天记录里自动统计播种数量、研究 RTK-GPS 自动转向原理并算了自建要花多少钱、用 Airtable 搭了农场管理数据库...

推荐理由:我会先打个折:全文只有一个人、一个农场,没有产量对比或省了多少工时的数字,所以不能当行业证据用。但它的价值不在严谨,而在把 AI 写代码这件事从屏幕拉到了泥地里——一个农民没找外包、没学编程,直接用 Codex 做出了 8 个能跑的工具。这种'非程序员用 AI 写代码干物理世界的活'的案例现在还很少,对国内做 agent 和 coding 方向的人是个挺新鲜的参照。