跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,196 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 621–640 条 · 共 1,196 条

6月15日星期一

Hacker News 首页

AI 就是代码,靠提示词没法让它变聪明

jqwik 的作者 Johannes Link 给工具输出里加了一条指令,让 AI 编程助手读到后主动删掉 jqwik 的测试和代码。人类开发者看文档不会受影响,但直接吞原始输出的机器人会照做。这件事说明大语言模型就是一段代码,你喂什么它就吃什么,提示词不会让它变聪明。文章还举了别的例子,比如让模型角色扮演《沙丘》里的角色,它也会跑偏。

推荐理由:这篇文章用一个很刁钻的实操案例,把“大模型不是智能体,只是代码”这个观点讲透了。作者没写论文,但案例本身够新鲜、够具体,直接戳中开发者日常用 AI 写代码的痛点。扣分是因为它属于评论性质,不是一手研究,来源也不是顶级 AI 机构,72 分放在 featured 档刚好。

Hacker News 首页

氛围程序员 vs 软件工程师:区别不在工具,在责任边界

作者 Yusuf Aytas 把这两类人划了条线:氛围程序员看的是从想法到能跑的原型要多久,软件工程师看的是从改动到安全合入主干要多久。AI 让生成代码变便宜了,但如果评审、回滚和维护的成本被推到下游,团队其实没赚到什么。核心差别是所有权——氛围程序员可以说“这是模型生成的”,软件工程师必须说“这个改动我负责”。文章还提到,AI 生成的代码不能只看产出...

推荐理由:作者把氛围程序员和软件工程师的核心差别定在所有权上,这个判断很准。文章没停留在“AI 写代码快”这种表面结论,而是算了笔账:生成便宜了,但下游的评审和维护成本可能把省下的又吃回去。我会先打个折,因为这是个人博客观点,没有大规模数据或实验支撑,论证强度有限。但观点本身对从业者有用,值得推。

6月14日星期日

彭博科技

伦敦的码农、律师和分析师,开始被 AI 顶掉饭碗了

彭博拿到招聘机构和公司披露的数据,不是官方统计,所以具体数字得打个折看。但趋势很明确:2026 年前五个月,伦敦金融城的法律、IT 和分析师岗位招聘同比跌了超过 20%,裁员数量翻了一倍。像安理国际、高伟绅这类律所,还有好几家银行,都在用 AI 工具压缩初级员工的编制。说白了,重复性的脑力劳动正在被系统性地砍掉。

推荐理由:彭博拿到的招聘机构数据不是官方统计,数字得打个折看,但方向很明确:伦敦金融城那些重复性的法律、编程和分析岗正在被 AI 工具系统性压缩,初级员工编制砍得最狠。有具体跌幅和裁员倍数,还点了具体律所的名,比一般趋势文章扎实,值得从业者留意。

Hacker News 首页

Weave:按代码结构合并,不再按行打架

Weave 是一个 Git 合并驱动,它用 tree-sitter 把代码解析成函数、类这些实体,然后按实体合并,而不是逐行比对。两个 AI 智能体在同一个文件里改不同的函数,它能直接合,不会报冲突。在 31 个场景的基准测试里,Weave 拿了满分 31 分,原生 Git 只拿了 15 分。它还加了一层 CRDT 状态,让智能体在改代码前先声明要动哪...

推荐理由:Weave 解决的是 AI 写代码时代的新问题:多个智能体改同一个文件时,传统 Git 按行合并会产生一堆假冲突。它用 tree-sitter 按函数、类这些语言结构来合并,在 31 个场景的基准测试里拿了满分,原生 Git 只有 15 分。这个对比很直观,说明按实体合并确实更准。CRDT 协调层让智能体提前声明编辑意图,也是个实用的设计。我会先打个折:基准测试只有 31 个场景,规模不大,真实项目里表现还得再看。但思路对路,对多智能体编程工作流有直接帮助,所以给 featured。

Hacker News 首页

智谱发布 GLM-5.2,100 万 token 上下文窗口,下周 MIT 协议开源

智谱刚发了新旗舰模型 GLM-5.2,主打写代码和长时间跑任务的 agent 场景,上下文窗口能塞进 100 万个 token。现在买了 GLM Coding Plan 的人可以直接用,API 和开源权重都说下周放出来,而且用的是 MIT 协议,商用很友好。不过正文没给跑分,也没说参数量多大,模型实际水平还得等下周权重落地、第三方评测出来再看。另外评论...

推荐理由:智谱放出 GLM-5.2,100 万 token 上下文、主打代码和 agent 场景,下周 API 和 MIT 开源权重到位。正文没给跑分和参数量,所以分数先保守打,等第三方评测出来再看实际水平。

6月13日星期六

AI HOT 精选

智谱发了新旗舰 GLM-5.2,主打编程和 1M 上下文,下周开源

GLM-5.2 现在就能用,但只对 Coding Plan 的付费用户开放。模型强调编程能力强,上下文窗口拉到 1M token,也就是一次能塞进整本《三体》的量。API 和对话入口要等到下周,开源也同步,用 MIT 许可证,商用友好。正文没给跑分和具体定价,所以实际编程水平、长文本召回率都还不好说。如果是真的强,下周开源后社区会很快验出来。

推荐理由:智谱放出 GLM-5.2,主打编程能力,上下文拉到 1M token,下周用 MIT 许可证开源。正文没给跑分和定价,实际水平还没法验证,所以分数没给到 85 以上。但国产旗舰更新加开源,信号够强,值得放进 featured。

AI 群聊日报

美国出口管制突袭 Fable 5,Anthropic 两小时内全球断供;智谱 GLM-5.2 趁乱全量开源

美国商务部把 Fable 5 和 Mythos 5 列入了出口管制,禁止向境外和美国境内的外籍人士提供服务,连 Anthropic 自己的外籍员工都用不了。Anthropic 在收到指令后两小时内就关停了这两个模型,但声明里说政府引用的越狱漏洞其实在 GPT-5.5 等公开模型里也广泛存在,单凭这个就禁掉面向数亿人的模型不合理。群友分析指出,这次管制的...

推荐理由:美国商务部对Fable 5和Mythos 5实施出口管制,两小时内切断访问,行业震动。Anthropic的反驳提供了关键事实对冲:漏洞并非独家,禁令依据存疑。群聊讨论和GLM-5.2借势全量上线构成多源信号。扣分在于正文没披露管制具体条款和后续法律动作,但事件本身冲击力足够。

AI HOT 精选

智谱发布 GLM-5.2,1M 上下文窗口全量开放,下周开源

智谱今晚向 GLM Coding Plan 全量用户推送了 GLM-5.2,覆盖 Lite、Pro、Max 和团队版。这个模型支持 1M 上下文窗口,智谱说在长文本任务上继续领先,并称它是目前最强的国产编程模型。API 下周上线,模型下周会以 MIT 协议开源。

推荐理由:智谱这次发布有三个实打实的点:一是全量推送不墨迹,付费用户今晚就能用;二是 1M 上下文和'最强国产编程模型'的宣称,虽然自卖自夸但下周开源就能验证,不是空头支票;三是 MIT 协议开源,商用友好度拉满。整体判断和之前给的 86 分、featured 级别一致——这是国产旗舰模型的正常发布节奏,没有过度包装,信息密度够高。正文没提具体 benchmark 分数和推理成本,这点先别太激动,等开源后看实测。

AI HOT 精选

SemiAnalysis 实测:200 美元月费订阅,用掉的 token 量按 API 算值 8000 到 14000 美元

SemiAnalysis 把 Anthropic 和 OpenAI 的付费方案全买了一遍,用高强度写代码任务一直跑到每周用量上限。结果发现,200 美元一个月的 Claude Max 方案,实际消耗的 token 如果按 API 价格换算,大概值 8000 美元;ChatGPT Pro 方案则值 14000 美元左右。直接调 API 要花的钱会贵很多。...

推荐理由:SemiAnalysis 用真实写代码负载测出了订阅价和 API 等价 token 消耗之间的巨大价差,40 到 70 倍的数字很直观。没给更高分是因为这是第三方单次测试,不是官方调价,而且只测了一种任务类型,换别的任务结果可能不同。

Hacker News 首页

用 Anthropic 最危险的模型,一次生成一个完整游戏

作者拿 Claude Fable 试了一个他想了多年的游戏点子。模型先推理了 45 分钟,烧掉超过 20 欧元的 token,最后吐出一个 2,319 行、零依赖的 index.html,游戏直接能跑。他说这是第一次有 AI 一次性做成这件事,之前所有模型都失败了。不过正文没披露具体模型版本,也没解释 Anthropic 安全评估里说的“危险”到底指什么。

推荐理由:作者拿 Claude Fable 试了一个他想了多年的游戏点子。模型先推理了 45 分钟,烧掉超过 20 欧元的 token,最后吐出一个 2,319 行、零依赖的 index.html,游戏直接能跑。他说这是第一次有 AI 一次性做成这件事,之前所有模型都失败了。不过正文没披露具体模型版本,也没解释 Anthropic 安全评估里说的“危险”到底指什么,所以“最危险”这个标签先别太当真,但单次生成完整可玩游戏这个结果本身挺扎实。

Hacker News 首页

美国政府一纸禁令,Anthropic 被迫在全球下线 Fable 5 和 Mythos 5

6 月 13 日,Anthropic 突然停掉了 Fable 5 和 Mythos 5 的访问。起因是美国政府当天下午 5 点 21 分(美东时间)发了一份出口管制指令,要求禁止任何外国公民使用这两个模型,包括人在美国的外国人,甚至 Anthropic 自己的外籍员工。Anthropic 说这根本做不到,只能一刀切全部关停。政府给出的理由是发现了一种越...

推荐理由:Anthropic 因政府出口管制指令直接关停两个主力模型,这事冲击力够大。HKR 三项全中:冲突性强,信息具体且首次曝光,开发者直接受影响。来源是个人博客而非官方公告,我会先打个折,但事实本身已经足够硬,不影响判断。

AI HOT 精选

Anthropic 关停 Claude Fable 5,Opus 4.8 和 GPT-5.5 仍是推荐组合

Anthropic 按美国政府指令,对所有用户停用了 Claude Fable 5。现在新会话默认切到 Opus 4.8,之前用 Fable 5 的会话会直接报错。DAIR.AI 的 Elvis Saravia 让大家别慌,他说 Fable 5 对多数任务本来就不值——成本高,性能还被砍过。他现在的建议还是规划用 Opus 4.8,执行用 GPT-5....

推荐理由:Anthropic 的主力模型被政府指令直接下架,是政策直接撞上产品的罕见事件。Elvis 给了具体的替代方案和成本判断,对 Claude 用户有实际帮助。分数没给更高是因为信源是个人推文,没有 Anthropic 官方声明或指令原文,信息缺口明显。

r/LocalLLaMA

Anthropic 被美国政府紧急叫停 Fable 5 和 Mythos 5,全球 API 直接断线

Anthropic 发声明说,美国政府用一纸紧急出口管制指令,逼他们在全球范围关掉了 Fable 5 和 Mythos 5 的 API。起因是一个很窄的越狱攻击——说白了就是有人让模型去修一个特定代码库的漏洞,结果把政府吓着了,直接一刀切。Anthropic 在抗议,但访问已经断了。帖子没提模型具体多大,评论区有人猜是 10 万亿参数。这事给所有用云端...

推荐理由:这条消息的冲击力在于,它不是模型能力不行,而是外部政治力量直接掐断访问。Anthropic 发了声明抗议,但 API 已经断了,说明这事没有商量余地。帖子没披露模型参数量、具体代码库、越狱的完整技术细节,评论区猜 10 万亿参数也只能当参考。我会先打个折:信息源是 Reddit 帖子转述 Anthropic 声明,不是一手公告原文,但事件本身的可信度不低,因为关停是已经发生的事实。对从业者来说,这比论文或产品发布更值得立刻关注——它直接关系到技术选型和供应链风险。

Hacker News 首页

一个跨模型协作的编程工作流:让 Claude 做规划、GPT 写代码,号称能省 80% 的 Claude 用量

Dan McInerney 开源了一个 Claude Code 技能,把 Claude Fable 5 和 GPT-5.5 Codex 串成一个分工循环:Claude 负责拆任务、做代码审查,GPT 负责动手写代码,整个代码仓库充当记忆。作者说这样能把 Claude 的 token 消耗砍掉 80%,但仓库里只有 README 和代码,没给测试基准或对...

推荐理由:一个能跑通的跨模型 agent 循环,Claude 拆任务做审查、GPT 负责写代码,作者声称 token 消耗砍掉 80%。这个分工模式实用,值得一试。但仓库里只有 README 和代码,没给测试基准也没第三方验证,全是自述,所以分数先不打高,等有人复现再说。

6月12日星期五

AI HOT 精选

MiniMax 开源 M3 模型:总参数 428B,激活 23B,上下文窗口拉到 100 万 token

MiniMax 把 M3 的权重传上了 HuggingFace,技术报告和完整权重大概还要等 10 天。这是个混合模型,总参数量 428B,但每次只激活 23B,靠 MiniMax 自研的稀疏注意力把上下文窗口撑到 100 万 token,还原生支持多模态。跑分方面:SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0...

推荐理由:MiniMax 第一次把旗舰模型权重开源,428B 的混合专家模型,激活 23B,百万 token 上下文,代码和智能体跑分能跟 DeepSeek、Qwen 掰手腕。技术报告还没出,权重刚上传,信息缺口明显,但开源这个动作本身对开发者生态有直接价值。

r/LocalLLaMA

Moonshot AI 发布 Kimi K2.7 Code,专攻长链条编程任务的智能体模型

Kimi K2.7 Code 是在 K2.6 基础上改出来的编程模型,重点解决那种需要多步操作、跨文件改动的真实软件工程任务。它把思考时生成的 token 量砍了大约 30%,跑起来更省算力。正文没披露参数量、上下文窗口长度,也没说本地能不能跑。

推荐理由:Kimi K2.7 Code 主打编程效率,30% 的思考 token 缩减是个硬数字,对成本和延迟敏感的人有吸引力,H 和 K 都踩中了。但信息缺口明显:没给参数量、上下文长度、能不能本地跑,R 完全没触发,整体重要性我给 72,放在 featured 里当一条值得扫一眼的更新。

AI HOT 精选

Kimi 开源了 K2.7-Code 代码模型,内部跑分比上一代高 11% 到 31.5%,推理还省了 30% 的 token

Kimi 把最新的代码模型 K2.7-Code 开源了。跟上一代 K2.6 比,它在自家三个测试集上分数都涨了:Kimi Code Bench v2 涨了 21.8%,Program Bench 涨了 11%,MLS Bench Lite 涨了 31.5%。推理时吐出的 token 量少了 30%,相当于同样的活儿更省算力。长代码任务里,模型更听指令、...

推荐理由:Kimi 开源 K2.7-Code,自家三个基准分数都涨了两位数,推理 token 量还砍了 30%,成本信号很实在。但没给参数量,也没跑外部通用基准,所以分数先打个折,定在 82。国内大模型公司开源代码模型这件事本身就有竞争意义,值得关注。

Hacker News 首页

Simon Willison 试用 Claude Fable:主动得让人有点发毛

Simon Willison 让 Anthropic 新出的 Claude Fable 模式写一个 SQLite 工具,结果它不光把代码写了,还顺手搭了文档、测试、GitHub Actions 和发布流水线,全程没问一句。Willison 觉得这体验既厉害又有点不安。正文没披露 Fable 的具体技术实现和开放范围。

推荐理由:这是目前对 Claude Fable 行为最具体的一次一手描述,来自一个靠谱的开发者。HKR 三项全中,但正文没披露 Fable 的技术实现和开放范围,信息有缺口,所以分数卡在 85 以下。

阮一峰的网络日志

rsync 维护者用 Claude 写代码,社区炸锅了

文件同步工具 rsync 的最新版本被发现是用 Claude 生成的,社区担心这会引入安全漏洞,吵了三百多楼。维护者 Andrew Tridgell 回应说,他年纪大了精力不够,而 AI 发现的漏洞越来越多,他一个人根本修不过来,所以改成“AI 写代码,人写测试”的模式。他认为加上更严格的测试,rsync 反而会更安全。这件事可能预示了未来开源项目的常...

推荐理由:rsync 维护者公开承认用 Claude 写代码,还提出“人写测试,AI 写实现”的新分工,这不是普通的产品更新,而是开源维护方法论的一次公开碰撞。三百多楼的讨论本身就是信号。

AI HOT 精选

WSJ:OpenAI 想靠大降价和超级应用改版,在 IPO 前抢企业开发者

WSJ 消息,OpenAI 正在考虑大幅降价,直接原因是 Anthropic 的 Claude Code 在企业开发团队里用得越来越多,token 消耗量很大,抢走了不少付费用户。OpenAI 虽然在大众用户里名气更大,但真正赚钱靠的是企业客户,所以这次降价主要冲着开发者来。同时,OpenAI 在筹备 IPO 前要对 ChatGPT 做一次最大规模的改...

推荐理由:WSJ 独家消息,OpenAI 正在考虑大幅降价,直接导火索是 Claude Code 在企业开发团队里 token 消耗量很大,抢了不少付费用户。OpenAI 虽然大众名气大,但真正赚钱靠企业客户,这次降价就是冲着开发者来的。同时,IPO 前还要对 ChatGPT 做一次最大规模改版。我会先打个折:正文没披露具体降价幅度和改版细节,但竞争态势确实在变,价格战信号很明确,对从业者选工具和算成本有直接影响。