跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,229 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1221–1229 条 · 共 1,229 条

2024年9月12日星期四

OpenAI News

OpenAI 发布 o1 系列模型,先想清楚再回答,数学推理从 13% 飙到 83%

OpenAI 在 9 月 12 日推出了 o1-preview 和 o1-mini 两个新模型,主打“先思考再回答”。在数学奥赛预选题上,GPT-4o 正确率只有 13%,o1 推理模型做到了 83%,编程能力也到了 Codeforces 前 11%。

推荐理由:OpenAI 推出 o1-preview 和 o1-mini,主打先思考再回答,数学奥赛预选题正确率从 GPT-4o 的 13% 提升到 83%,编程达到 Codeforces 前 11%。

OpenAI News

OpenAI 发布 o1 预览版,靠增加思考时间把推理能力拉上去了

OpenAI 推出了新模型 o1-preview,主打推理能力。在 AIME 2024 数学竞赛题上,o1 单次答题正确率 74%,GPT-4o 只有 12%;如果让模型对同一道题算 64 次再投票,正确率能到 83%。编程竞赛 Codeforces 上 o1 排到前 11%,GPQA Diamond 博士级科学题正确率超过了人类专家。

推荐理由:OpenAI 发布 o1-preview,在 AIME 2024 数学题上单次正确率 74%,GPT-4o 仅 12%,同一题多次采样投票后可达 83%。

OpenAI News

OpenAI 推出 o1-mini,一个专攻数理和编程、成本比 o1-preview 低 80% 的推理模型

o1-mini 是 OpenAI 在 2024 年 9 月 12 日发布的小号推理模型,先开放给 Tier 5 API 用户和付费 ChatGPT 用户。它最大的卖点是便宜:API 调用成本只有 o1-preview 的两成。

推荐理由:OpenAI 发布推理模型 o1-mini,API 调用成本为 o1-preview 的两成,先向付费 ChatGPT 用户和 Tier 5 API 用户开放,价格与能力的取舍是这条的核心信息。

2024年9月5日星期四

DeepSeek · API 更新日志

deepseek-coder 与 deepseek-chat 合并升级为 DeepSeek V2.5

DeepSeek V2 Chat 与 DeepSeek Coder V2 已合并升级为 DeepSeek V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问新模型。

推荐理由:DeepSeek 将聊天与代码模型合并为 V2.5,并保留两个原有 API 访问名称以兼容既有用户的调用方式。

2024年8月20日星期二

OpenAI News

OpenAI 开放 GPT-4o 微调,训练费每百万 token 25 美元,9 月 23 日前每天送 100 万免费额度

OpenAI 把 GPT-4o 的微调权限开放给所有付费开发者了。训练价格是每百万 token 25 美元,用微调后的模型跑推理,输入每百万 token 3.75 美元,输出每百万 token 15 美元。到 9 月 23 日为止,每个组织每天能免费拿到 100 万训练 token。

推荐理由:OpenAI 向所有付费开发者开放 GPT-4o 微调,训练每百万 token 25 美元,9 月 23 日前每个组织每天可领 100 万免费训练 token。

2024年8月13日星期二

OpenAI News

OpenAI 发布 SWE-bench Verified:人工复核过的代码能力测试集

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集,叫 SWE-bench Verified。他们发现原版测试有坑:单元测试太死板、问题描述含糊、环境搭不起来,导致明明对的代码被判错,会系统性地低估模型写代码的真实水平。

推荐理由:OpenAI 与 SWE-bench 原作者合作推出经人工复核的子集,指出原版测试因单元测试死板、描述含糊和环境问题会系统性低估模型真实代码水平。

2024年7月18日星期四

OpenAI News

OpenAI 发布 GPT-4o mini,比 GPT-3.5 便宜六成,API 里首次用上指令层级防越狱

OpenAI 在 7 月 18 日推出了 GPT-4o mini,直接替换掉 ChatGPT 里的 GPT-3.5。价格是输入每百万 token 0.15 美元、输出 0.6 美元,比 GPT-3.5 Turbo 便宜了超过 60%。

推荐理由:GPT-4o mini 以输入每百万 token 0.15 美元的价格替换 ChatGPT 中的 GPT-3.5,比后者便宜超过六成,同时 API 引入指令层级防越狱。

2024年6月28日星期五

DeepSeek · API 更新日志

deepseek-chat 升级为 DeepSeek-V2-0628,推理与角色扮演能力提升

deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升,角色扮演能力显著增强。HumanEval Pass@1 从 79.88% 提升至 84.76%,MATH ACC@1 从 55.02% 提升至 71.02%,BBH 从 78.56% 提升至 83.40%。

推荐理由:DeepSeek 升级后的数学基准提升幅度高于代码与推理基准,在 Arena-Hard 中对 GPT-4-0314 的胜率也有提升。

2024年6月14日星期五

DeepSeek · API 更新日志

deepseek-coder 升级为 DeepSeek-Coder-V2-0614

deepseek-coder 模型升级为 DeepSeek-Coder-V2-0614,代码能力显著提升。官方称,其代码生成、代码理解、代码修复和代码补全能力达到 GPT-4-Turbo-0409 的水平,并拥有卓越的数学和推理能力,通用能力与 DeepSeek-V2-0517 持平。

推荐理由:DeepSeek 升级代码模型,将代码生成、理解、修复和补全四项能力对标 GPT-4-Turbo-0409。