跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 401–420 条 · 共 1,195 条

7月17日星期五

Hacker News 首页

月之暗面发布 2.8 万亿参数 Kimi K3,自称首个开源 3T 级模型,API 定价看齐 Claude Sonnet

月之暗面推出了 Kimi K3,一个 2.8 万亿参数的模型,他们把它四舍五入叫成“首个开源 3T 级模型”。这个模型 API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。它自己公布的跑分大多超过了 Claude Opus 4.8 和...

推荐理由:月之暗面发了 Kimi K3,一个 2.8 万亿参数的模型,他们管它叫“首个开源 3T 级模型”,API 定价输入每百万 token 3 美元、输出 15 美元,跟 Claude Sonnet 一个价,是目前中国 AI 实验室里最贵的。自己公布的跑分大多超过 Claude Opus 4.8 和 GPT-5.5 high,但输给 Claude Fable 5 和 GPT-5.6 Sol。Simon Willison 的测试里 K3 在长周期知识任务上比前代 K2.6 涨了 732 Elo,输出 token 数少了 21%,成本降了 27%,说明模型在...

AI 群聊日报

Kimi K3 登顶前端编程榜,权重将开源,但实测发现它有时会烧光额度原地打转

Kimi K3 在 Frontend Code Arena 拿了 1679 分,压过 Claude Fable 5,七个前端领域赢了六个。模型有 2.8 万亿参数,支持 1M 上下文,定价是每百万 token 3 到 15 美元,完整权重会在 7 月 27 日前放出来。群友上手后评价两极:有人花 199 元月费让它重做了之前搞砸的粒子特效,效果惊艳;也...

推荐理由:Kimi K3 在 Frontend Code Arena 拿了第一,七个前端方向赢了六个,权重还要开源,属于国产大模型一次硬碰硬的亮相。群聊日报给了分数、参数量、价格和真实用户反馈,信息够用。没打更高是因为来源是社区整理,不是一手官方公告,我会先打个折。

AI HOT 精选

OpenAI 给 CFO 们画了张新账本:别盯着每个 token 多少钱,要看“每块钱干成了多少活”

OpenAI 发了一篇面向 CFO 的指南,核心就一句话:算 AI 账不能只看 token 单价,得算完成一件合格任务的综合成本。文章提了个“有用智能每美元”的框架,拆成四个问题:AI 到底干成了多少有用的活、每件成功的活实际花了多少钱、结果靠不靠谱、以及用得越多是不是每块钱买的活也越多。拿刚发的 GPT-5.6 三个档位(Sol、Terra、Luna...

推荐理由:OpenAI 这篇给 CFO 的指南把 AI 成本从 token 单价拉回到“完成一件合格任务花了多少钱”,提了个四维记分卡,还拿自家新模型和 Claude Fable 5 比了一圈。框架和对比数据都有,对企业算账的人挺实在,所以给了 featured。

彭博科技

月之暗面发布新 Kimi 模型,跑分追上 OpenAI o3 和 Claude Sonnet 4.5,英伟达盘前跌超 3%

月之暗面在 7 月 17 日推出了新一代 Kimi 模型,在 MATH、HumanEval 等基准测试里,成绩跟 OpenAI o3 和 Anthropic Claude Sonnet 4.5 打平甚至略高。现在通过 Kimi 聊天机器人就能试,API 也已经上线。市场反应很直接——英伟达盘前跌了超过 3%,大家担心这会压降美国 AI 公司的定价空间。...

推荐理由:月之暗面这次发模型,跑分直接叫板 o3 和 Claude Sonnet 4.5,而且不是论文阶段,是已经能用的产品。我会先打个折——没看到模型大小和实际推理成本,光看跑分容易高估。但市场反应很诚实,英伟达股价先跌为敬,说明大家认真在考虑这会不会压降美国公司的定价空间。对国内从业者来说,这至少是个值得上手测一下的信号。

AI HOT 精选

Kimi K3 前端编码跑分登顶,2.8 万亿参数模型 7 月 27 日开放权重

Kimi K3 在 Frontend Code Arena 拿了 1679 分,7 个前端子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型本身是个 2.8 万亿参数的 MoE 架构,上下文窗口能塞进 100 万 token,大概是一套《三体》三部曲的量。7 月 27 日会开放权重,到时候可以自己部署。API ...

推荐理由:Kimi K3 在 Frontend Code Arena 前端编码榜拿了 1679 分,7 个子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型是 2.8 万亿参数的 MoE 架构,上下文窗口能塞 100 万 token,7 月 27 日开放权重。这是国产旗舰模型在一个具体编码榜单上直接挑战闭源双巨头,而且马上能自己部署,对前端圈和国内开发者来说是个实打实可验证的信号。

Latent Space

月之暗面发布 Kimi K3:2.8 万亿参数开源模型,前端编程能力冲上第一

月之暗面发布了 Kimi K3,一个总参数量 2.8 万亿的模型,这也是目前公开权重里最大的一个。模型权重承诺在 7 月 27 日前放出。它支持 100 万 token 的上下文和原生的多模态输入,已经在 Kimi.com、Kimi Code 和 API 上线。在 Artificial Analysis 的智能指数上,K3 拿了 57 分,跟 Clau...

推荐理由:月之暗面扔出了 Kimi K3,2.8万亿参数,是目前公开权重里最大的模型。我会先打个折:权重还没放出来,承诺是 7 月 27 日前,这点先别太激动。性能上,Artificial Analysis 给了 57 分,说是 Opus 4.8 级别,但定价压到 Sonnet 5 那档,如果是真的挺省钱。支持 100 万 token 上下文和原生多模态输入,已经在 Kimi.com、Kimi Code 和 API 上线,可以直接用。正文没披露训练成本、推理延迟和具体 benchmark 细节,这些缺口让性价比判断还缺几块拼图。

Hacker News 首页

人肉把关员已经累了

Pydantic 的 Laura Summers 聊了用大模型写代码的真实疲惫感:代码生成没问题,但人得不停地审查、纠错、把持方向,精力很快被榨干。她的同事 Douwe 每天醒来面对 30 个 AI 生成的 PR,很想把审查也丢给 AI,但反问自己“那我还在这干嘛”。她管这叫监督疲劳,并指出 AI 让你能同时开很多头,但能认真收尾的事一件没多。文章还引...

推荐理由:Pydantic 的开发者从一线视角讲了大模型写代码的真实困境:代码能生成,但人得不停审查纠错,精力很快被榨干。她管这叫“监督疲劳”,并指出 AI 让你能同时开很多头,但能认真收尾的事一件没多。观点来自真实体验,比纯技术文章更打动人。分数没给更高是因为这是一篇观点文,没有新数据或工具发布,但观点本身足够犀利。

Computing Life · Share · 鸭哥调研

BackendForge 让 AI 编程评测从笔试变面试,同一份代码通过率直接腰斩

BackendForge 先给 56 个后端任务写了 7,250 项测试,再让 Agent 专门找这套题库漏了什么,最后补了 640 项。测试只多了 8.8%,但 GPT-5.5 全部通过的任务从 31 个掉到 16 个,Claude Opus 4.7 从 33 个掉到 10 个。代码没变,变的是评分方式:新题专挑权限、脏数据、连带影响这些第一版没覆盖...

推荐理由:BackendForge 这件事有意思在它不拼模型,拼的是出题方式。先拿 56 个后端任务写了 7,250 项测试,再让 Agent 自己找题库的盲区,补了 640 项。测试量只涨了 8.8%,但 GPT-5.5 和 Claude Opus 4.7 的满分率直接腰斩。代码没变,变的是评分标准——新题专挑权限、脏数据、连带影响这些第一版没覆盖的角落。这对做 AI 编码工具的人是个实在提醒:模型能跑通任务不代表真靠谱,评测得学会追问。数字清晰,结论有冲击力,而且没吹模型,吹的是方法论,值得放 featured。

Hacker News 首页

德国团队发布开源模型 Soofi S,30B 参数跑出 3B 成本,德语英语跑分双杀

Soofi S 是一个 31.6B 参数的混合专家模型,每次生成只激活 3.2B 参数,推理成本压得很低。它用了 Mamba 加 Transformer 的混合架构,处理长文本时速度几乎不掉,这点比很多同尺寸模型强。训练数据故意向德语倾斜,结果在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。模型在德国电信的慕尼黑...

推荐理由:德国 AI 联盟放出的 Soofi S,一个 31.6B 参数的混合专家模型,每次只激活 3.2B 参数,推理成本压得很低。它用 Mamba 加 Transformer 的混合架构,长文本处理不掉速,在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。虽然德语优先的定位会限制它在中文圈的传播,但开源 30B 级别模型做到这个性能和成本,对从业者来说值得看一眼。

AI HOT 精选

Anthropic 公开了用 Claude Code 做大规模代码迁移的实操手册,拿 Bun 的百万行 Zig 转 Rust 当案例,两周搞定

Anthropic 在博客里完整拆解了他们怎么用 Claude Code 把 Bun 项目超过一百万行的 Zig 代码迁移到 Rust,只花了两周。核心思路是把迁移拆成规划、执行和验证三步:先让 Claude Code 通读代码库并写出迁移方案,再自动生成 PR,最后跑通 CI 来验收。文章附了完整的工作流和提示词模板,给想用 AI 做内部重构的团队参...

推荐理由:Anthropic 官方博客拆解了一次真实的大规模迁移,有数字、有流程、有模板,不是公关稿。分数没给更高是因为这本质上是一篇案例分享而非产品更新,而且 Bun 不是 Anthropic 的项目,更像一次对外演示。

7月16日星期四

Hacker News 首页

批评大模型的人说得都对,但我还是在用

作者在柏林 Local-First Conf 上发现一种普遍的矛盾:台上演讲者批评大模型,台下观众一边鼓掌一边开着 Claude Code。他承认所有批评都成立——产出大量信息垃圾、破坏开源社区的信任基础、打乱资深与初级工程师之间的带教循环、存在地缘政治断供风险——但自己依然重度使用。文章没有试图化解这种矛盾,而是把这种集体性的别扭感摊开来讲,并邀请大...

推荐理由:这篇文章没打算讲道理,就是把开发者圈子里那种'边骂边用'的集体拧巴摊开给你看。柏林会议上 Armin Ronacher 的回复是个好钩子,但全文没有数据支撑,也没有解决方案,就是一次诚实的自我暴露。我会给 featured,因为共鸣够强、传播力够好,但别指望从这里学到什么新东西。

Hacker News 首页

Roc 语言的编译器用 Zig 重写后,首次追平了原 Rust 版的功能

Roc 团队花了 487 天,把 30 万行 Rust 编译器用 Zig 重写了一遍,最近刚做到功能追平。一个叫 Rocci Bird 的演示小游戏现在能编译成 31KB 的 wasm 文件,体积不到原来的一半。新编译器在开发时会自动热加载代码,改完不用重启;发布时能交叉编译出可复现的静态二进制文件。团队强调这次是重新设计,不是直接搬运,所以没法拿 R...

推荐理由:Roc 团队花了 487 天把 30 万行 Rust 编译器用 Zig 重写,刚追平功能。31KB wasm(不到原来一半)、热加载、可复现静态二进制都是实打实的改进。和 Bun 从 Zig 切 Rust 的报道天然形成对照,增加了话题性。但正文没给出 Rust 版本的直接性能对比,团队也承认是重新设计而非搬运,所以实际提升幅度要打个折。上限给到 72,因为缺乏严格的 A/B 数据支撑。

Latent Space

Thinky 发布 Inkling:9750 亿参数、410 亿活跃的多模态开源模型,目前美国最强 Apache 2.0 基座

Thinky 推出了 Inkling,一个总参数量 9750 亿、每次推理激活 410 亿参数的混合专家模型。它能直接处理文字、图片、音频和视频,支持最长 100 万 token 的上下文窗口。模型用 45 万亿个多模态 token 训练,采用 Apache 2.0 协议开源,发布当天就得到了 vLLM、Hugging Face 等工具链的支持。团队明...

推荐理由:Thinky 第一个完整模型发布,975B MoE 架构、Apache 2.0 开源,填补了美国开源阵营的空缺。Mira Murati 的团队背景、100 万 token 上下文和原生多模态能力同时打中了热度、硬核度和身份认同三个点。没给到 90 分以上是因为目前只有团队自己公布的跑分数字,正文没披露独立第三方的验证结果,这点先别太激动。

AI HOT 精选

xAI 把编程助手 Grok Build 的完整代码开源了

xAI 在 GitHub 上公开了 Grok Build 的全部源码,包括智能体的工作循环(怎么拼上下文、怎么解析模型回复、怎么调用工具)、终端界面、以及技能、插件、MCP 服务器等扩展系统。你可以直接读源码搞清楚它的内部机制,也可以自己编译后连上本地模型跑起来,完全离线使用。

推荐理由:xAI 开源了 Grok Build 的全部代码,包括智能体循环、终端界面和扩展系统,还支持本地离线运行,在开发者圈子里同时踩中了好奇心、干货和实用价值三个点。目前只有官方公告,还没有第三方评测或实际跑通后的反馈,所以分数先定在 featured 这一档,等有人上手验证了再调整。

7月15日星期三

Hacker News 首页

StyleSeed:给 AI 编程助手装一套设计规范引擎,别让它再生成千篇一律的界面

bitjaru 开源了一个叫 StyleSeed 的项目,专门给 Claude Code、Cursor 这类 AI 编程工具用。它不直接生成代码,而是教模型做设计判断。项目里打包了 74 条设计规则、48 个组件、7 套品牌皮肤(像 Stripe、Linear、Vercel 这些),还有一套命名过的动效系统和 15 个快捷指令。目前 MIT 协议开源,...

推荐理由:给 AI 编程工具加设计约束这事确实戳中刚需,74 条规则加品牌皮肤让项目不止于概念 demo。分数没给更高是因为刚在 Show HN 亮相,没有用户反馈和实际落地效果,目前只能按工具完整度打分。

Hacker News 首页

Martin Fowler 博客:用领域特定语言给大模型套上缰绳,让代码生成更靠谱

Unmesh Joshi 在 Martin Fowler 的博客里说,靠一份详细需求文档就让大模型一把梭出整个系统不现实——需求只是假设,真正的设计是在实现过程中一点点摸出来的。他提出用领域特定语言(DSL,也就是为特定业务定制的“小语言”)和领域抽象给大模型画好边界,这样模型生成的代码才不会跑偏。文章举了 Tickloom 的例子:这是一个给分布式系...

推荐理由:一篇扎实的工程实践文章,发在 Martin Fowler 的博客上,用 DSL 给大模型代码生成画边界,有具体例子支撑。没给更高分是因为它属于观点/模式文章,不是产品发布或模型发布,受众更偏后端架构师。

Computing Life · Share · 鸭哥调研

Codex 仍然开源,但父 agent 给子 agent 派了什么任务,现在被加密了

OpenAI 在 6 月 5 日合并了一个 PR,把 Codex 里主 agent 派给子 agent 的任务指令从明文改成了密文。以前你在本地日志里能看到类似“Review the authentication changes”这样的具体任务,现在只剩一串 <ciphertext>。子 agent 调用了什么工具、跑了什么命令、改了哪些代码,这些执行...

推荐理由:这是一条有具体技术细节的产品变动报道,不是公关稿。PR 号、issue 链接、改动前后对比都给出来了。扣分是因为这属于功能调整而非新能力发布,影响范围也局限在 Codex 用户。我会先打个折:虽然对开发者体验的冲击不小,但本质上是一次安全加固,不是模型能力或架构的突破。

Computing Life · Share · 鸭哥调研

AI 训练 AI:一次公开实验把自我改进的闭环走到了哪一步

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案,内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练,隐藏评分再作为奖励反馈给外层。54 步下来,智能体先学会少交无效作业,然后把 1.7B 模型的使用比例从 42% 拉到了 95%,并开始主动调整温度、优化器等超参数。训练后...

推荐理由:我会先打个折:这只是一个公开实验,不是产品,规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案,内层 Qwen3-0.6B 和 1.7B 真跑训练,隐藏评分当奖励。54 步后,智能体先学会别交无效作业,然后主动把 1.7B 模型的使用比例从 42% 拉到 95%,还开始调温度、优化器这些超参数。这说明在小规模下,AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数,所以别急着说“超越人类调参”,但流程本身对做模型训练自动化的团队很有参考价值。

Latent Space

AIE 世界博览会 2026:AI 工程的重心从造智能体转向造智能体周围的系统

今年的 AIE 世界博览会透露出一个明显转向:工程师们不再只盯着怎么造一个更聪明的智能体,而是开始认真搭建智能体周围的那套系统。Lilian Weng 的新文章把这套东西叫做“缰绳”——管工作流、管上下文、管权限、管评估,还要管持续改进。三年前大家还在热议 AutoGPT,今年现场几乎没人提了,取而代之的是 Claude Code、Codex 和 Cu...

推荐理由:Latent Space 从 AIE 世界博览会抓到的趋势总结有真东西。Lilian Weng 的“缰绳”框架把散落的观察拧成了一根系统级的绳子,对正在落地 agent 工作流的工程师来说,能直接拿来对照自己的架构。扣分是因为这毕竟是一篇会议综述,没有一手实验数据,但作为方向判断,值得一看。

AI HOT 精选

OpenAI Codex 周活破 700 万,两个月塞了 150 多项更新

OpenAI 的编程助手 Codex 现在每周有超过 700 万人在用,过去两个月更新了 150 多项功能。比较能打的有:GPT-5.6 和 Ultra 模型可以并行跑任务;新加的 /goal 指令能把一个目标自动拆成执行步骤;电脑操作速度更快了;AppShots 和内联编辑也上了;还能直接用 Sites 搭网页,支持移动端和 SSH 工作流,以及从代...

推荐理由:Codex 周活冲到700万,两个月塞了150多项更新,产品节奏很猛。GPT-5.6 并行执行、/goal 自动拆任务、AppShots、内联编辑这些功能都有明确的技术指向,不是空泛的“升级”。分数定在78而不是更高,因为这是官方口径,没有第三方验证,实际体验和稳定性还得看用户反馈。