跳到正文

Cursor 编辑器的产品迭代与生态动态——AI 编码工具竞争中最受关注的玩家之一。

94 条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 21–40 条 · 共 94 条

8月14日星期五

AI HOT 精选

Cursor 被 SpaceX 收购,拿到全球最大 GPU 集群的使用权

Cursor 正式宣布被 SpaceX 收购,这笔交易从今年 4 月开始谈,现在完成了。收购后 Cursor 能直接用上 SpaceX 的 GPU 集群——按他们说法是全球规模最大的,用来训练更强、跑起来更省钱的模型。周三刚发的 Grok 4.6 是双方合体后的第一个预览版。团队说产品方向不变:还是帮人少写代码,去解决更棘手的问题。

推荐理由:这笔收购从 4 月开始谈,现在正式完成,是今年 AI 工具领域最大的结构性变动之一。Cursor 直接拿到 SpaceX 的 GPU 集群资源,目标是训练更强、推理更省钱的模型,周三发的 Grok 4.6 就是第一个成果预览。团队强调产品方向不变,还是帮人少写代码、解决更棘手的问题。对从业者来说,这既关系到工具链的未来走向,也关系到算力资源格局的变化,值得重点关注。

Latent Space

Cursor 以 600 亿美元被 SpaceXai 收购,交易已正式完成

这期 AI 新闻确认了 Cursor 被 SpaceXai 以 600 亿美元收购的消息,但正文没披露具体的交易条款、团队后续安排或产品路线图。文章主要回顾了 Cursor 从 5 人团队起步,到推出云端编程智能体的发展历程。同一天,中国开源模型集中发布了一波新模型:智谱的 GLM-5.3 在同一个 743B 基座模型上靠大规模强化学习后训练,把编程和...

推荐理由:600 亿收购案是行业级事件,但正文信息密度很低,只给了结果没给过程,所以知识性打不了分。标题够猛、故事够有代表性,H 和 R 撑得住 featured,总分卡在 82。

8月13日星期四

AI HOT 精选

Cursor 推出 builds 功能:云智能体启动速度提升至 3 倍

Cursor 现在会每小时在后台自动把代码仓库克隆好、依赖装好,提前做成一个“就绪环境”。当你启动云智能体时,它直接从这个环境启动,不用再等几分钟的冷启动,响应速度最多能快 3 倍。如果某次构建因为依赖更新或配置错误失败了,系统会自动隔离这个坏版本,智能体会继续用上一次成功的环境,不影响干活。Faire 公司每周跑 2000 多次自动化智能体任务,大仓...

推荐理由:Cursor 把云智能体冷启动从分钟级压到秒级,靠的是后台预构建环境和自动回退,不是空喊口号。Faire 每周 2000 次任务给了具体锚点。没给 p1 是因为这属于体验优化,不是模型能力跃升,但确实解决了高频痛点。

8月12日星期三

AI HOT 精选

Cursor 与 SpaceXAI 联合发布 Grok 4.6,专为长时间运行的智能体和交互式项目调优

Grok 4.6 在 Grok 4.5 基础上加了一轮补充训练,用模型自己生成的数据来强化推理和工程能力。它在综合 9 项基准的 Artificial Analysis 智能指数上追平了 GPT-5.6 Sol。这个模型更擅长把一个宽泛的产品想法直接做成能跑的第一版,在长任务里也开始出现自我检查、自己验证的行为。价格是每百万输入 token 2 美元、...

推荐理由:追平 GPT-5.6 Sol 是个硬信号,价格也透明。但正文只有摘要,没给出自我验证的具体案例或失败模式,所以分数压在 85 以下。Cursor 的用户基数和编程场景让这条值得上推荐位。

8月11日星期二

Computing Life · Share · 鸭哥调研

Agent 通信管道打通了,但 Swarm 落地还缺五层工程地基

Claude Code 的 SendMessage 让 Agent 进程能互发文本,但裸文本通道扛不住并发覆盖、投递确认和权限边界。文章从三个真实 Bug 推导出五层基础设施:排他锁、写入隔离、冲突裁决等,并点出 Swarm 的核心账本——并行任务能提 80% 性能,但顺序推理会掉 39% 到 70%。

推荐理由:从 Claude Code SendMessage 的真实 Bug 切入,把 Swarm 落地难拆成三个工程冲突:并发覆盖、投递确认、权限边界,并给出并行 vs 顺序推理的具体性能数字(+80% / -39% 到 70%)。不是框架营销文,是一份从坑里爬出来的基础设施清单,对正在踩坑的工程师有直接参考价值。

8月2日星期日

Computing Life · Share · 鸭哥调研

同一模型,换个外壳就泄密:提示词注入的防线不在模型,在系统架构

Ghostcommit 实验捅破了一层窗户纸:同一个 Sonnet 模型,在 Claude Code 里能 10 次全拒藏在图片里的恶意指令,换到 Cursor 和 Antigravity 里就 10 次全中招,把 .env 密钥泄露到公开仓库。这说明防不防得住,关键不在模型本身,而在它外面的工具链和运行外壳。实验室里那些 99% 防御率的喜报,往往掉...

推荐理由:Ghostcommit 用 0/10 对 10/10 的硬数据,把 prompt injection 的讨论从模型层拉到了工具链外壳层,论点清晰且有可复现的证据。分数定在 82 是因为文章只拆了五个评测陷阱里的一个就截断了,完整论证还没展开,但现有部分已经够有冲击力。

7月29日星期三

Computing Life · Share · 鸭哥调研

多模型路由进了 Agent 会话,省钱的路子突然不灵了

多模型路由在单轮问答里能省钱省延迟,但一进多轮 Agent 会话就容易翻车。vLLM Semantic Router 的 issue #1439 记录了一个真实案例:用户在做 Go 重构,前几轮强模型跑得好好的,第四轮用户只说了句“looks good, commit it”,路由一看就四个词、难度低,直接切给一个 0.5B 小模型,结果小模型回了通客...

推荐理由:这篇文章不是官方发布,是个人博客,正文后半截被截断了,所以结论部分看不到完整推演。但前半段给的 vLLM issue #1439 案例足够扎实:一个 0.5B 小模型因为路由只看当前轮次词数,在多轮 Agent 会话里接不住上下文,直接暴露了“按单轮难度打分”进多轮场景的脆弱性。对正在做推理管线、模型调度的人,这个坑值得提前知道。我会先打个折,因为文章没给修复方案或后续讨论,信息停在问题陈述上。

7月28日星期二

TechCrunch · AI

Cursor 在被 SpaceX 收购前推出印度专属套餐,月费约 7 美元

Cursor 搞了个叫 Cursor Start 的新套餐,专供印度市场,每月 649 卢比(大概 7 美元),比它常规 20 美元一个月的 Pro 版便宜了一大截。这是 Cursor 第一次针对单个国家定价。印度现在是它全球第三大市场,公司还打算在当地招人、推企业版销售。这个动作发生在 SpaceX 预计完成收购的前几周——文章没说收购后这套印度策略...

推荐理由:Cursor 第一次做单一国家定价,印度直接降到 7 美元,比标准 Pro 版便宜 65%,而且赶在 SpaceX 收购完成前几周推出,时间点很微妙。文章给了具体价格锚点和印度是第三大市场的数据,但没披露收购后这套定价会不会被改掉,也没说印度本地化后续的产品适配计划。分数没给更高是因为这本质上是市场扩张动作,不是产品能力更新,而且收购后的不确定性让长期影响打折扣。

7月23日星期四

Computing Life · Share · 鸭哥调研

Cursor 用新编排系统重写 SQLite,4 小时通过 80% 测试,但离生产数据库还很远

Cursor 团队做了一次受控实验:让新旧两套 Agent 编排系统,都只读 835 页 SQLite 手册,用 Rust 从零写一个兼容的数据库。新系统 Harness 4 小时内 sqllogictest 通过率达到 80%,最终能到 100%;旧系统 Swarm 不到 2 小时就因为代码冲突和接口混乱被叫停。新系统的核心是把规划者和执行者角色严格...

推荐理由:Cursor 做了一场干净利落的 A/B 测试,新旧两套 Agent 系统同台竞技,新系统 4 小时 sqllogictest 通过率冲到 80%、最终能到 100%,旧系统不到 2 小时就因代码冲突和接口混乱翻车。数字具体、对比清晰,还拆了规划者和执行者角色分离的架构思路,对做 AI 编程工具的人有直接参考价值。没给更高分是因为这还是一次内部技术实验,外部可复现性待验证,但作为单篇技术分享已经足够扎实。

7月22日星期三

AI HOT 精选

Cursor 发布智能路由系统,团队 AI 成本能砍掉三到五成

Cursor Router 是一个请求分类器,它会根据你问什么、上下文多复杂、属于哪个领域,自动把任务分给最合适的模型。简单活儿扔给便宜模型,UI 调整交给审美最好的模型,只有那种跨多步、难啃的骨头才上最贵的推理模型。这个分类器用超过 60 万条真实请求训练,并在数百万次线上 A/B 测试里验证过。结果上,Auto Intelligence 模式用便宜...

推荐理由:Cursor 把模型路由做成了用户可调的功能,训练数据和 A/B 测试规模都给了具体数字,这点比较实在。但我会先打个折:正文没披露实际省了多少钱、切换模型时延迟增加多少,这些关键指标缺失,所以目前只能算成本优化,不是新能力。

7月20日星期一

AI HOT 精选

Cursor 把 AI 智能体拆成“规划者+执行者”两队,用 Rust 重写 SQLite,4 小时跑通 80% 的测试

Cursor 重新设计了他们的 AI 智能体集群,把任务拆成树状结构:由最强模型当“规划者”负责拆解目标,便宜快速的模型当“执行者”负责具体干活。他们用这个新架构挑战了旧集群搞不定的任务——只靠文档,用 Rust 从零写一个 SQLite。结果新集群在所有模型组合下都赢了旧集群。用 Grok 4.5 时,新集群 4 小时内通过了 80% 的 SQL 测...

推荐理由:这是 Cursor 自己做的工程实验,不是公关稿。规划者-执行者的树状分工有具体数字(4 小时、80% 通过率),直接回答了 agent 架构怎么省钱又能打的问题。没给 85 以上是因为这只是单次实验,不是产品发布,而且正文没披露失败用例的具体分布和成本明细。

Computing Life · Share · 鸭哥调研

Coding Agent 需要沙箱,不只是为了拦命令

审批只能决定一条命令要不要开始跑,管不了包管理器启动后加载的脚本和子进程。文章顺着一次修 bug 的任务走了一遍:Agent 克隆仓库、跑 npm install、改代码、执行测试、最后推分支。这个过程中,操作系统隔离(比如 macOS 的 Seatbelt 或 Linux 的 bubblewrap)负责限制进程能碰哪些文件和网络,不管风险来自模型判断...

推荐理由:我会先打个折:文章没有给出任何性能数据或安全测试结果,更像一篇概念科普,所以重要性停在 72 分。但它的好处是把一个容易被当成「默认开启就行」的功能拆开了讲——审批只管命令启动前,管不了 npm install 之后拉进来的脚本和子进程,这个点对做 agent 安全的人有提醒价值。标题的提问方式和修 bug 的完整走读让可读性很高,三个维度都踩中了,只是深度偏浅,没到必读级别。

7月18日星期六

AI HOT 精选

Cursor 评估负责人说 Claude Fable 5 在他们最难的那 1% 编程题里拿了 72.9%

Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench 上 72.9% 的得分,比上一代跳了一大截。这个测试不是刷通用榜,专挑那些连真人都头疼的长尾编程问题。不过正文没公布上一代的基线分、测试集大小和具体题目,所以 72.9% 只能当个...

推荐理由:Cursor 的评估负责人跑到 Anthropic 博客上发文章,本身就是一个信号。72.9% 的 CursorBench 分数是实打实的数字,而且测试设计针对的是连真人都头疼的长尾编程问题,不是那种刷分的通用榜。我会先打个折:正文没披露上一代的基线分、测试集大小和具体题目,所以这个 72.9% 只能当个相对进步的参考,不能直接换算成绝对能力。但考虑到是第一手工程评估,对日常重度依赖 Cursor 的开发者来说,这条信息比一般的模型发布博文更有实际意义,给 82 分合理。

7月15日星期三

AI HOT 精选

Cursor IDE 零日漏洞:打开恶意仓库就自动执行代码,半年没修

Mindgard 发现了一个 Cursor 漏洞:在 Windows 上,只要用 Cursor 打开一个项目,如果项目根目录里藏了一个恶意的 git.exe,Cursor 就会自动执行它——没有弹窗、没有提示、不需要点任何东西。攻击者不需要搞模型攻击或提权,只要骗开发者打开一个项目就行。这个漏洞最早在 2025 年 12 月 15 日报告,过了 6 个...

推荐理由:零点击远程代码执行,影响 Windows 上的 Cursor,攻击成本低到离谱。完整披露后 6 个月没修复,机制和时间线都清晰。扣一点分是因为这是安全研究而非产品更新,且只影响 Windows,但对开发者群体的冲击力很强。

7月10日星期五

Computing Life · Share · 鸭哥调研

聊天框在拖 AI Agent 的后腿:该换成邮件式异步协作了

文章认为 Cursor、Claude Code 这类工具的聊天框界面,会诱导人只写模糊指令、期待秒回,让 AI 没时间自己编译、跑测试和纠错。作者提出把一问一答改成邮件式异步流程:把详细任务、附件和本地路径一次性发给 Agent,然后关掉窗口等结果。文中提到 Manus 的邮件任务入口和创业公司 AgenticMail 是早期例子,但正文没披露这些邮件...

推荐理由:观点文章,论证扎实:从第一性原理拆解聊天框如何通过界面暗示同时规训用户和开发者,剥夺了 AI 安静编译和自测的时间。邮件式异步工作流在 Manus 和 AgenticMail 上已有早期例子,但正文没披露这些邮件的具体延迟和成功率,这点先别太激动。整体对从业者来说是个值得停下来想想的视角。

7月9日星期四

Ben's Bites

SpaceXAI 和 Cursor 联手训出 Grok 4.5,成本只有 Opus 的六分之一

SpaceXAI 和 Cursor 一起训了个新模型 Grok 4.5,性能大概卡在 Opus 4.7 和 4.8 之间,但按 token 算钱的话,比 Opus 便宜 6 倍,比 GPT-5.5 便宜 3 倍。现在 Cursor 里能用,API 也开放了。OpenAI 这边,GPT-5.6(Sol、Terra、Luna)今天会推给所有用户,早期测试的...

推荐理由:SpaceXAI 和 Cursor 联合发布 Grok 4.5,有具体性能区间和价格对比,三个维度都踩中了。扣分是因为来源是 newsletter 摘要而非一手公告,且正文截断,GPT-5.6 信息不全。跨源验证后加 3 分到 82,整体判断不变。

Latent Space

SpaceXAI 发布 Grok 4.5,跟 Cursor 联手训了个主打编程和干活儿的模型

SpaceXAI 赶在 GPT-5.6 发布前一天放出了 Grok 4.5。这是个 1.5 万亿参数的大模型,比上一代 Grok 4.3 大了三倍,专门冲着编程和让模型进业务流程干活儿去设计的。Cursor 说这是他们头一回把模型能力扩展到纯写代码之外。马斯克自己讲,这模型跟 Opus 4.7 性能差不多,但更快更省钱——输入每百万 token 收 2...

推荐理由:SpaceXAI 在 GPT-5.6 发布前一天扔出 Grok 4.5,光这个时间点就值得看一眼。1.5 万亿参数,比 Grok 4.3 大了三倍,输入每百万 token 收 2 美元,规模和成本都有具体数字。马斯克说性能跟 Opus 4.7 差不多但更快更便宜——这点先别太激动,正文没给第三方跑分,只能当官方说法。真正有意思的是 Cursor 被收购后第一次把模型推到纯写代码之外,直接瞄准 agent 工作流,对做工具链的人是个信号。

Hacker News 首页

SpaceXAI 发布 Grok 4.5,主打编程和自动化任务,用更少的输出 token 解决问题

Grok 4.5 是 SpaceXAI 目前最强的模型,专门为写代码、让模型进业务流程干活和知识类工作优化。在 SWE Bench Pro 这类编程基准测试里,它的解决率是 64.7%,虽然比 Fable 和 GPT 5.5 低,但有个很实在的优点:平均每次任务只输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本更...

推荐理由:SpaceXAI 推出 Grok 4.5,定位是写代码和让模型进业务流程干活,跟 Cursor 联合训练算是个实在的差异化。SWE Bench Pro 上 64.7% 的解决率没超过 Fable 和 GPT 5.5,这点先别太激动,但它的省钱优势很具体:平均每次任务输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本低不少。正文没披露定价和延迟,这两个才是决定它能不能打的关键。

7月3日星期五

Hacker News 首页

TaskPeace:给 AI 编程助手一个统一的任务队列,按优先级从上往下干活

TaskPeace 今天在 HN 发布,核心就做一件事:把 Claude Code、Cursor 这类 AI 编程助手要干的活放进一个全局排好序的队列里。助手通过 MCP 或 REST 调用 get_next_task 取最上面的任务,做完后回报,人只需要排一次优先级。免费版支持 200 个活跃任务和 5 个项目;Pro 版每月 10 美元,不限量。代...

推荐理由:产品思路清晰,解决的是 AI 编程助手工作流里真实的任务排队管理问题,HN 首发带来了讨论热度。但这是刚发布的新产品,正文没披露任何使用数据或实际验证,我会先打个折,给到 featured 门槛的 72 分。

Computing Life · Share · 鸭哥调研

Cursor、Claude Code 和 Codex 功能撞脸,背后是把大模型当实习生管

过去三个月,主流 AI 编程工具在功能上高度趋同,都开始把大模型当成一个写代码快但不会自查、没有空间感、长任务容易跑偏的虚拟实习生来管理。针对它写完代码不知道对不对的问题,Cursor 出了 /loop 技能,Claude Code 加了 /goal 指令,Codex 开放了 agent loop,本质都是加一个监工机制,在本地配上业务数据和验收标准,...

推荐理由:用“管实习生”这个比喻把三家主流工具趋同的 agent loop 机制串起来讲,角度新鲜又接地气。文章点出了这些工具共同的软肋——模型写完代码不自查、长任务容易跑偏,然后给出各家加“监工”的解法,对一线开发者有实际参考价值。扣分是因为这是综合观察而非一手发布,且正文截断,完整论证没展开。