跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

194 条精选相关主题千问 Qwen开源生态模型发布

最新精选

第 61–80 条 · 共 194 条

8月1日星期六

Computing Life · Share · 鸭哥调研

一张草稿纸,一个 Controller:重新理解大模型推理

推理模型并没有长出会思考的新大脑。Chain of Thought 先给 Transformer 一张只能往后写、不能往回擦的草稿纸,把原本挤在单次前向传播里的隐层心算,平摊到几十上百个自回归时间步上;后训练再练出一个 Controller,决定什么时候在草稿纸上检查、回退、换路或停笔。s1 的 Wait 实验和 pass@k 衰减测试都指向同一个结论...

推荐理由:这篇文章不是新论文或产品发布,而是一篇机制解读,但解读质量很高。它用草稿纸和控制器两个比喻把 Chain of Thought 和后训练的分工讲清楚了,还挂了 s1 的实验数据,不是空对空。H 轴靠比喻和机制拆解拿满,K 轴有具体实验支撑,R 轴因为好懂且有料,转发动力强。整体是评论向的优质内容,不是一手发布,所以分数落在 78 这个区间,不往上拔。

AI HOT 精选

DeepSeek V4 Flash 0731 开源,MIT 协议,284B 总参数量,开源模型里排进前三

DeepSeek 把 V4 Flash 0731 开源了,MIT 协议,可以随便用。模型总参数 2840 亿,但每次推理只激活 130 亿,跑起来大概需要 167GB 显存(FP4/FP8 混合精度)。在 Artificial Analysis 的智能指数上拿了 50 分,开源模型里排前三。架构和定价跟之前的 V4 Flash 一样,官方 API 已经...

推荐理由:DeepSeek 把一个旗舰级模型用 MIT 协议开源,直接挂到开源榜前三。2840 亿/130 亿的稀疏架构给出了一个具体的效率数字,不是宣传稿。国内模型发布按政策给同等权重,开源带来的生态扩散也值得关注。

Hacker News 首页

Manifest 下线了自己的模型路由器,认为省下的钱会在别处花掉

Manifest 今年三月上线了一个模型路由器,把请求按复杂度分成四档,想用便宜模型处理简单任务来省钱。跑了四个月、服务了七千个云用户后,他们在六月把它标记为弃用,九月一日彻底关停。核心问题有三个:第一,光看提示词根本判断不了真实复杂度——比如“评估 $GIT_REPO 的测试并改进”,对静态个人网站很简单,对 Linux 内核就是地狱难度。第二,缓存...

推荐理由:Manifest 这篇四个月的生产复盘,把模型路由器为什么失败讲得很具体,有场景、有数字、有自我打脸,不是泛泛而谈。扣分点在于这只是单家公司的经验,没有对照实验,而且文章正文被截断,完整论证看不到。我会先打个折,但整体信息密度和诚实度都够,值得推给正在纠结路由方案的从业者。

7月31日星期五

Product Hunt · AI

DeepSeek 发布 V4-Flash-0731,主打用 Flash 级价格跑智能体任务

DeepSeek 在 Product Hunt 上线了 V4-Flash 的正式版,代号 0731。官方说它的智能体能力比 V4-Pro 预览版还强,原生支持 Responses API,也适配了 Codex CLI 命令行工具。不过正文没给出具体的跑分数据和 API 定价,只提了一句“用 Flash 的价格拿到前沿智能体能力”。我会先打个折,等第三方...

推荐理由:DeepSeek V4-Flash 正式版声称智能体能力超过 V4-Pro 预览版,并原生支持 Responses API 和 Codex CLI。作为国内头部实验室的产品更新值得关注,但正文没给任何跑分和定价,信息缺口明显,所以分数压在 80 以下。

AI HOT 精选

DeepSeek V4 Flash 0731 发布,智能指数涨了 10 分,还压到了成本前沿线上

Artificial Analysis 的智能指数给这个新模型打了 50 分,比 4 月版高出 10 分,也比自家的 V4 Pro 多了 6 分。它同时踩到了智能和成本的帕累托前沿,意思是同等聪明的模型里它更省钱,同等价位的模型里它更聪明。不过原文没给具体定价和延迟数据,这点先别太激动,等实测跑分出来再看。

推荐理由:10分的智能指数跳升和反超V4 Pro的对比很有冲击力,帕累托前沿的说法也给了明确的性价比预期,值得推。扣分是因为原文没放定价和延迟数据,实际省钱程度没法验证,所以先不拉满。

AI HOT 精选

DeepSeek-V4-Flash API 公测,官方称 Agent 跑分远超 V4-Pro-Preview

DeepSeek 放出了 V4-Flash 的 API 公测,主打 Agent 能力升级。官方贴了一张性能对比图,说基准测试分数已经大幅超过 V4-Pro-Preview,但具体分数、成本和延迟都没给。这次原生支持了 Responses API 格式,也完全适配了 Codex,意味着你可以直接把它接进 Claude Code 这类编程工具里干活。我会先...

推荐理由:DeepSeek V4-Flash 开放公测,官方说 Agent 能力大幅提升,还贴了张对比图显示基准测试分数超过 V4-Pro-Preview。但具体分数、成本和延迟都没给,只放了一张图。我会先打个折:没数字的对比图看看就好,别太激动。不过原生支持 Responses API 和 Codex 是实打实的,接进 Claude Code 就能用,这点挺省钱。综合来看,发布动作本身和 Agent 定位足够让开发者关注,所以给到 featured 级别。

AI HOT 精选

国家发改委:上半年 AI 行业增速超 30%,全国智能算力同比翻 2.8 倍

国家发改委在 7 月 31 日的发布会上给了几个数:上半年 AI 相关行业增速保持在 30% 以上;到 6 月底,全国智能算力规模是去年同期的 2.8 倍,第一个全国产 10 万卡 AI 集群已经投用。模型这边,DeepSeek 和月之暗面发了万亿参数的开源大模型,国产大模型全球总下载量超过 100 亿次。数据层面,建成高质量数据集超过 12 万个。另...

推荐理由:国家发改委发布会给了上半年 AI 行业几个硬数:相关行业增速 30% 以上,全国智能算力规模是去年同期的 2.8 倍,第一个全国产 10 万卡 AI 集群已经投用。模型侧提到 DeepSeek 和月之暗面发了万亿参数开源大模型,国产大模型全球总下载量超 100 亿次,高质量数据集建成超 12 万个。信息来自官方渠道,数字具体、可引用,对从业者判断算力基建节奏和国产模型生态规模有直接帮助,三条 HKR 都踩实了。

Hacker News 首页

DeepSeek V4 Flash 公测:Agent 跑分大幅超过 V4 Pro 预览版

DeepSeek 把 V4 Flash 模型开放公测了,API 调用方式不变,模型名改成 deepseek-v4-flash 就行。这次只更新了 Flash,V4 Pro 和 App/Web 端都没动。Flash 的模型结构和尺寸跟之前的预览版一样,只是重新做了一遍后训练。最大的变化是 Agent 能力,官方给的跑分比 V4 Pro 预览版高出一大截:...

推荐理由:DeepSeek V4 Flash 开放公测,Agent 跑分压过自家 V4 Pro 预览版,这在国产大模型里算一个值得标记的能力更新。只动后训练不动结构,技术信号很明确。没给 90 分以上是因为它毕竟还是 Flash 这一档,不是满血旗舰,实际业务表现还得等用户反馈。

AI HOT 精选

DeepSeek V4 Flash 正式版 API 开始公测,只改了后训练,让模型干活的能力分涨了不少

DeepSeek 今天下午把 V4 Flash 正式版的 API 放出来公测了。模型结构和尺寸跟预览版一样,只是重新做了一遍后训练,但让模型进业务流程干活(Agent)的分数明显上去了。比如 Terminal Bench 2.1 跑到 82.7,DeepSWE 54.4,官方说远超 V4 Pro 预览版。Flash 现在原生支持 Responses A...

推荐理由:DeepSeek V4 Flash 正式版公测,Agent 跑分压过 V4 Pro 预览版,属于国产主力模型的一次实打实更新。两个具体分数(Terminal Bench 2.1、DeepSWE)让信号更实在。分数没给更高是因为它毕竟是 Flash 不是 Pro,而且正文没披露后训练具体改了什么、成本多少,这些缺口让判断得先打个折。

Latent Space

GPT-5.6 全线降价 20%-80%:四个月前旗舰模型的智力,现在只要十三分之一的价格

OpenAI 把 GPT-5.6 Luna 的价格砍到了每百万 token 输入 0.2 美元、输出 1.2 美元,降幅 80%。Terra 降了 20%,Sol 则多了一个 2.5 倍速模式,价格翻倍但智力不变。最狠的是,Luna 在 AA 基准测试上拿了 51 分,跟今年三月 GPT-5.4 开满推理强度时的分数一样,但 token 成本只有当时的...

推荐理由:四个月把同等智力成本压到十三分之一,这个信号比单纯降价狠得多。AA 基准 51 分直接对标 GPT-5.4 满血推理,让降价有了硬参照,不是拿弱化版糊弄人。文章没展开“递归自优化”具体怎么做的,这点先别太激动,但光看价格和分数,已经够让所有调 API 的人重新打算盘了。

AI HOT 精选

国家发改委放话,要加快《人工智能法》的立法了

国家发改委新闻发言人蒋毅在7月31日的发布会上说,上半年国产大模型全球下载量破了100亿次,像DeepSeek和月之暗面都发了万亿参数的开源模型。接下来除了继续搞基础研究和建应用试点基地,重点是会加快《人工智能法》的立法,想拿出一套能平衡发展和安全的治理方案。不过正文没披露具体的立法时间表和监管细则,这点先别太激动。

推荐理由:发改委首次明确承诺要加快《人工智能法》立法,还带了上半年100亿次下载量、万亿参数开源模型这些新数据,对国内AI从业者是个直接的政策信号。分数没给更高,因为正文没披露立法时间表和具体监管细节,现在激动还太早。

Computing Life · Share · 鸭哥调研

Kimi K3 技术报告:把模型做大,先得搞定显存、带宽、通信和延迟这四堵墙

Moonshot AI 放出了 Kimi K3 的技术报告,模型总参数 2.78 万亿,每次推理激活 1042 亿参数,总共 93 层,原生支持 100 万 token 上下文。但报告真正的看点不是参数大,而是他们怎么在真实硬件限制下做工程取舍。在序列处理上,他们用 69 层 KDA 以固定成本传递历史信息,再用 24 层 Gated MLA 做全局纠...

推荐理由:Moonshot AI 放出 Kimi K3 技术报告后,这篇解读绕开了“2.78 万亿参数”的标题党写法,直接拆他们怎么在真实硬件限制下做序列架构的取舍:69 层 KDA 控制成本,24 层 Gated MLA 做全局修正,整篇文章都在讲显存、带宽、延迟这些硬约束下的工程选择。对从业者来说,这比参数数字有用得多。

7月29日星期三

FT · 科技

扎克伯格反对美国封禁中国 AI,认为竞争比脱钩更管用

扎克伯格对《金融时报》说,美国不该封禁中国的 AI 模型。他点名 DeepSeek 和字节跳动,说这两家动作很快,但 Meta 的 Llama 系列在开源模型里还是领先的。他的核心逻辑是:如果美国公司被挡在中国市场外面,那中国公司就会拿下全球其他市场。文章没提他具体想要什么政策,也没说时间表。

推荐理由:扎克伯格在《金融时报》的独家表态有新闻性,直接点名中国公司让话题更具体。但整篇就是站队发言,没给政策建议也没时间表,信息增量有限,所以分数打78,别指望太高。

7月27日星期一

纽约时报中文网

中国开源模型追上来了,硅谷为“该不该封”吵成一团

智谱AI和月之暗面最近发了新模型,性能已经能跟美国顶级实验室的产品掰手腕。这直接点燃了硅谷的路线之争:OpenAI和Anthropic跑去华盛顿游说,说中国公司用“蒸馏”偷师他们的闭源系统,有国家安全风险,得管;另一边,英伟达、微软、Meta等一票大佬和近200家初创公司公开站队开源,认为封杀会阻碍创新、让巨头垄断。财政部长贝森特和科技顾问克拉齐奥斯放...

推荐理由:纽约时报的原创报道,细节扎实,把中国开源模型进步怎么撕裂硅谷、谁在游说谁在反对都写清楚了。热度、知识、共鸣三项全中,但本质是行业趋势分析,不是产品发布,按规则打到 82 分这一档。

7月26日星期日

Hacker News 首页

DeepSeek 暂停融资,梁文锋交流会文字稿被传到 GitHub

一份标注日期为 2026 年 7 月 22 日的 DeepSeek 投资者交流会文字稿 PDF 被上传到 GitHub。梁文锋在会上承认与美国在算力上的差距在拉大,并透露公司已暂停最新一轮融资。目前公开的只有 PDF 标题,正文是扫描件,具体发言内容和融资规模都没披露。

推荐理由:一份标注为2026年7月22日的DeepSeek投资者交流会文字稿PDF被传到GitHub。梁文锋在里头承认和美国在算力上的差距在拉大,还说公司已经暂停了最新一轮融资。目前公开的只有PDF标题,正文是扫描件,具体发言内容和融资规模都没披露。信息缺口太大,没法判断这件事对行业或公司到底有多大影响,所以重要性给0。

7月24日星期五

FT · 科技

英伟达和 Palantir 游说白宫别禁开源模型,说禁令会先伤到美国自己

白宫正在考虑限制开源权重大模型出口,起因是有报道说 DeepSeek 用美国的开源模型训练了军用 AI。英伟达和 Palantir 跳出来反对一刀切禁掉,他们的理由是:开源生态是美国 AI 领先地位的核心,全面禁止等于自断手脚,本土公司会先遭殃。他们提的替代方案是收紧最终用户管控,而不是封模型本身。文章没给出立法时间表,也没说白宫目前倾向哪边。

推荐理由:FT 独家,信源扎实。英伟达和 Palantir 联手反对开源模型出口禁令,提出的替代方案是收紧最终用户管控,而不是封模型。政策张力真实存在,对开源 AI 圈子直接相关。没给 85 是因为文章没披露白宫目前倾向哪边,也没立法时间表,判断先打个折。

纽约时报中文网

中国把开源、低成本 AI 当成新软实力,跟美国闭源模型抢全球市场

习近平上周公开站台开源 AI,说这是把技术红利扩散到全球的“历史机遇”,并承诺五年内给发展中国家 5000 个培训名额。中国公司(深度求索、月之暗面、智谱 AI、阿里等)主推开源模型,部分任务成本比美国方案低 50% 到 90%。美国那边反击很猛:Anthropic 指控阿里用 2.4 万个假账号爬取其技术,财长贝森特威胁制裁。安全争议两边都有——开源...

推荐理由:NYT 把中国开源 AI 当成地缘软实力故事来讲,习近平的背书、具体的成本数据和 Anthropic 的爬取指控让文章有了实感。但这是宏观叙事,不是一手产品发布,缺乏可复现的评测细节,所以分数没给到 85 以上。

7月23日星期四

r/LocalLLaMA

DeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用

梁文锋花了四个小时反复说“不”:不做消费级或企业级产品,不碰视频生成和世界模型,不追用户增长,不闭源,也不想成为下一个字节或腾讯。他把产品、多模态和幻觉问题都归为支线任务,主线只有两个:编程智能体和通用智能体。在他看来,中美 AI 的差距本质是资源差距,他相信规模定律——模型做这么大不是因为够用,而是因为目前只有这么多资源。开源策略是主动放弃一部分价值...

推荐理由:梁文锋首次系统公开战略优先级,明确拒绝产品化和闭源,只押注 AGI 和智能体,信息密度高、立场鲜明,对从业者有直接参考价值。扣分点:来源是投资人会议转述,非一手官方公告,但内容具体程度足以支撑判断。

7月21日星期二

Sinocism · 比尔·毕晓普

月之暗面发布 Kimi K3,美国对开源 AI 的态度显得自相矛盾

这期付费播客主要聊了两件事:一是月之暗面推出了新模型 Kimi K3,在美国投资人和政策圈引发了类似“DeepSeek 2.0”的担忧。Andrew 和 Bill 认为,美国对开源 AI 生态的政策很拧巴——明明有手段可以拖慢中国进步,但特朗普政府可能不太愿意用。二是习近平在世界人工智能大会上的主旨演讲,以及中国对全球南方基础设施的叙事。节目最后还提到...

推荐理由:我会先打个折:这是付费播客的摘要,不是一手报道,细节和论证厚度肯定不如原文。但它的价值在于把 Kimi K3 引发的美国政策圈焦虑、开源政策的内在矛盾、以及特朗普政府可能的选择,几条线捏在一起讲。对关注中美 AI 博弈的人来说,这期节目提供了一个现成的讨论框架,哪怕只是当个引子也值得一看。

7月20日星期一

Hacker News 首页

让大模型学会省力思考:低、中、高三档推理模式怎么训出来

Sebastian Raschka 在这篇文章里讲了一种训练方法,让同一个推理模型能按需切换思考强度,而不是每次都全力运转。他先用 GPT-5.6 的五档推理设置引出话题,然后明确推理模型的定义:会输出中间步骤、一步步推演的模型。核心做法分两步:训练时用强化学习加可验证奖励(RLVR),推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推...

推荐理由:Raschka 讲了一种训练方法,让同一个推理模型能按需切换思考强度。文章先把 GPT-5.6 的五档推理设置当引子,然后给出推理模型的定义——会输出中间步骤、一步步推演的模型。核心做法分两步:训练时用强化学习加可验证奖励,推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推理链混在一起训,让模型学会根据预算指令调整输出。我会先打个折:正文没披露具体实验数据和效果对比,这点先别太激动。但思路本身对想省推理成本又有灵活需求的团队有参考价值。