跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

194 条精选相关主题千问 Qwen开源生态模型发布

最新精选

第 41–60 条 · 共 194 条

8月16日星期日

Hacker News 首页

一份追踪30张模型卡片的排行榜,看前沿实验室到底报告了哪些基准

这个项目扫了11家机构的30张模型卡片,统计了79个基准被提及的次数,衡量的是厂商的关注度,不是基准本身好不好。MATH-500和Arena-Hard的分数快摸到天花板了,区分力在下降。DeepSeek自家的模型在26天内,AIME涨了40.6分,LiveCodeBench涨了25.4分。有6个基准(包括BrowseComp和SWE-bench Pro...

推荐理由:这篇不是评测基准好坏,而是统计厂商关注度,视角本身就有信息量。给出了MATH-500和Arena-Hard接近饱和的具体证据,以及DeepSeek短期内大幅刷分的数字,能引发对基准有效性的讨论。扣分是因为这是个人项目,统计口径和覆盖范围有限,但作为从业者参考够用了。

8月15日星期六

AI 群聊日报

DeepSeek开源DSH智能体框架,V4 Pro发布翻车,Gemini 3.7 Flash低调上线

DeepSeek正式开源了DSH(DeepSeek Harness)智能体框架,核心理念是“一切都是插件”,连智能体的主循环都能在运行时替换。有深度分析指出,这是它相比Codex等声明式框架唯一的结构性优势,相当于为了“让智能体自我进化”这盘醋包了一整盘饺子。不过,群友对通用框架的未来吵翻了天,有人觉得自然语言就是新编程语言,通用框架注定要死;也有人认...

推荐理由:DeepSeek 正式开源 DSH,结构上跟 Codex 拉开差异,还带了实测数字,当天就有社区跟进,HKR 三项都踩中了。分数卡在 78,因为消息源是群聊日报,不是官方公告,信息细节还得等一手确认。

Computing Life · Share · 鸭哥调研

给 DeepSeek V4 接一个 3B 的视觉前端,今天就能跑

DeepSeek V4 的 API 不收图片,但 Liquid AI 新出的 LFM2.5-VL-3B 可以当它的眼睛。作者在自家车库摄像头上零样本测了一把,判断门开没开准确率 94.3%,本地跑完只要 1.5 秒。图片不出设备,只有“门开了”这类文字结果上云做推理。这套感知和推理分开的架构,在延迟、隐私和成本上的优势,就算 DeepSeek 以后自己...

推荐理由:作者用 Liquid 的 LFM2.5-VL-3B 给 DeepSeek V4 搭了一个感知前端,在真实车库摄像头上测出 94.3% 准确率和 1.5 秒延迟,数据具体、架构清晰。文章还顺带梳理了 DeepSeek 在视觉上的研究脉络(VL2、被撤回的 Thinking with Vision 等),把“为什么现在需要外挂眼睛”这件事讲透了。我会先打个折:测试场景只有一个车库门,泛化到什么程度正文没展开,这点先别太激动。但整体上,这套感知和推理分离的做法在成本、隐私和延迟上的优势是实打实的,对正在找 DeepSeek 视觉替代方案的开发者来说,是一...

Computing Life · Share · 鸭哥调研

同一个模型差 20 分:DeepSeek 的 harness 依赖性和合成数据的隐藏天花板

DeepSeek V4 Flash 在自家极简测试环境里能拿 82.7 分,换到第三方脚手架直接掉到 46.7% 通过率,同一个模型差了 20 个百分点。Stanford 和 UC Berkeley 等团队 8 月 12 日的论文解释了原因:用单个大模型当用户模拟器训练 Agent,模型会专门钻模拟器回应模式的空子,策略多样性从 1.9 nats 暴跌...

推荐理由:我会先打个折,这篇不是模型发布或产品上线,是评测方法论和合成数据陷阱的扒皮文,所以重要性压在 78 不过 85。但三个轴都踩实了:20 分的落差够猎奇,官方脚注到第三方复现的证据链够硬,agent 开发者看完会想立刻检查自己的评测管线,转发和讨论动力强。正文没披露 DeepSeek 对这篇论文的官方回应,这点先别太激动。

8月14日星期五

Hacker News 首页

DeepSeek V4 Pro 正式上线,API 开始分高峰和低谷时段计价

DeepSeek 把 V4 Pro 模型从预览版转成了正式版。这次更新主要强化了让模型进业务流程干活的能力,并且给 V4 Pro 和 V4 Flash 都加了一个“思考力度”调节开关:简单任务用低档,日常自动化任务用高档,复杂任务可以拉满。模型现在也原生支持 OpenAI 的 Responses API,能一键接入 Codex。API 价格从 8 月 ...

推荐理由:V4 Pro 转正、加 agent 加固和思考力度调节,是实打实的功能更新,对在 DeepSeek 上搭自动化的开发者有意义。没给到 85 分以上,是因为正文没披露 GA 后的基准对比,也没说清楚峰谷价差到底是多少——信息密度差了口气,所以我会先打个折。

AI HOT 精选

DeepSeek V4 Pro 上线硅基流动,支持 100 万 token 上下文,给了三档推理强度可选

硅基流动现在可以直接用 DeepSeek V4 Pro 了,首发当天就接入了。模型上下文窗口拉到 100 万 token,差不多能一次吞下三本《三体》的量。它把推理强度分成低、高、最大三档,你可以按任务复杂度自己选,主要面向写代码、调工具和让模型进业务流程干活的场景。模型还是 MIT 协议开源的。价格方面,输入每百万 token 1.32 美元,输出 ...

推荐理由:DeepSeek V4 Pro 首发当天硅基流动就接入了,100 万 token 上下文、三档推理强度、MIT 开源、输入每百万 token 1.32 美元,信息密度够高。没给 85 分以上是因为这只是平台上线公告,还没有实测跑分或用户反馈,先别太激动。

FT · 科技

OpenAI 和 Anthropic 被中国对手逼着打价格战

FT 报道,OpenAI 和 Anthropic 正在大幅降价抢企业客户,压力来自 DeepSeek 这类成本更低的中国模型。两家公司都在推更便宜的小模型,同时靠高价订阅和 IPO 预期撑估值。文章没给出具体降了多少、什么时候生效,更像一篇趋势分析。

推荐理由:FT 这篇是趋势分析,不是硬消息稿。它点出了 OpenAI 和 Anthropic 被中国低价模型逼着降价的大背景,但正文没披露具体降了多少、什么时候开始,信息密度不够硬。我会先打个折:格局判断有参考价值,但缺可执行的数据,所以 H 和 R 都成立,K 不成立,刚好够 featured 门槛。

8月13日星期四

Computing Life · Share · 鸭哥调研

编程 Agent 换形态,抢的都是同一件东西:执行数据

DeepSeek 开始招 Agent Harness 产品经理,说明它正在补一个空位:没有自己的编程工具运行环境。之前它只卖模型接口,把工具端交给第三方,但这样拿不到用户在真实编程场景里的行为数据——模型输出了代码,但用户怎么改、哪里报错、改了几轮才跑通,这些细节都留在第三方工具里。LangChain 的测试显示,同一个模型有没有针对性的运行环境配置,...

推荐理由:一篇用招聘动作和测试数据把产业逻辑讲清楚的分析。DeepSeek 招 Agent Harness 产品经理这件事本身不大,但作者把它和 LangChain 的 10-20 个百分点性能差距、Codex 做桌面端串起来,点出模型厂抢的不是工具市场,是用户改代码、修 bug 的行为数据。判断都挂在事实和数据上,没有吹概念,对从业者来说信息密度够、可读性强。按政策,观点分析类文章打 78-84 分段的低区,78 分合理。

Computing Life · Share · 鸭哥调研

DeepSeek 开源 DSH:把 agent 的控制循环做成了可热插拔的插件,为 AI 自进化铺路

DeepSeek 在 8 月 13 日开源了它的第一个 agent harness,叫 DSH。它跟 Codex、Claude Code 这些现有工具最大的不同,是把 agent 的核心控制循环(agent loop)本身做成了一个可以在运行中随时替换的插件。这意味着,AI 在干活时不仅能调用新工具,理论上还能给自己换一套全新的思考或协作流程。为了支撑...

推荐理由:DSH 把 agent 的控制循环做成了运行时可替换的插件,这确实是个架构层面的新想法,不是营销话术。但这篇文章是第三方分析,不是官方发布,DSH 目前也没有任何生产环境的验证记录,所以按规则先打个折,归到较低一档。

Hacker News 首页

DeepSeek V4 Pro 0813 上架 OpenRouter,输入每百万 token 0.435 美元

DeepSeek 把 V4 Pro 的正式版(GA)挂上了 OpenRouter。这是个超大规模的混合专家模型,上下文窗口能塞进 100 万 token,差不多是一整套三体三部曲的量。价格定在输入 $0.435/1M、输出 $0.87/1M,在目前的大模型里算便宜的那档。不过现在只有一个供应商在跑,OpenRouter 收到请求直接转发,没得选路。页面...

推荐理由:DeepSeek V4 Pro 正式版悄悄上了 OpenRouter,100 万 token 上下文和 $0.435/1M 输入价是这次能确认的新信息,对从业者有直接参考价值。没给到 85 分是因为信息源只有 OpenRouter 页面,缺少官方公告和独立评测,验证链条还差一环,所以稍微压了一点分。

8月10日星期一

AI HOT 精选

宇树科技今天开始打新,A股有了第一只人形机器人股票

宇树科技8月10日开放申购,发行价150.80元/股,对应市值约610亿元,计划募资约61亿元。市盈率219倍,是行业平均的5倍多,定价不便宜。战略配售方里有社保基金、DeepSeek和中石油。公司2025年营收16.99亿元,净利润2.78亿元,是全球少数能靠通用机器人赚钱的公司。募资近一半(20.22亿元)会砸进智能机器人模型研发。今年一季度收入涨...

推荐理由:宇树这次IPO给人形机器人赛道定了个实打实的估值锚——610亿市值、219倍市盈率,定价不便宜,但公司确实有盈利,不是纯烧钱。我会先打个折,因为这是财务事件,不是技术突破,不过募资用途里近一半投向智能机器人模型研发,加上DeepSeek参与配售,对AI硬件和具身智能圈子的参考价值不小。

8月9日星期日

Hacker News 首页

DeepSeek-V4 把“思考”藏进潜空间,打包成一个能直接部署的完整模型

Nicholai Mitchko 把之前那个需要外挂的 CoLaR 潜空间推理头,做成了一个开箱即用的完整模型。模型本体是 DeepSeek-V4-Flash-0731,用 NVFP4 量化后,两张 GPU 就能跑起来。那个负责“思考”的推理头只有 3570 万参数,现在和模型权重打包在一起了。在 BBH 基准测试里,它零样本总得分 0.94,多步骤状...

推荐理由:把CoLaR的潜空间推理从外挂改成内置,工程上有价值,BBH零样本0.94分也拿得出手。但这篇是个人研究博客,没有其他信源交叉验证,受众也窄,所以刚好卡在featured门槛上。

8月8日星期六

Hacker News 首页

DeepSeek V4 Flash 0731 在 ARC-AGI-2 上跑出 61.4%,单任务成本 0.04 美元

DeepSeek 把 V4 Flash 0731 提交到了 ARC Prize 的官方排行榜,用了三种推理强度来跑分。最猛的那一档在 ARC-AGI-1 半私有集上拿了 89.0%,单任务成本 0.02 美元;在更难的 ARC-AGI-2 上拿了 61.4%,成本翻倍到 0.04 美元。推理强度一降,分数掉得很明显,低强度版本在 ARC-AGI-2 上...

推荐理由:DeepSeek 把 V4 Flash 0731 提交到 ARC Prize 排行榜,用三档推理预算跑分,高预算在 ARC-AGI-2 上拿到 61.4%,是目前公开最高分,单任务成本 0.04 美元。文章给了具体数字和成本对比,信息密度高。没给更高分是因为这还只是排行榜提交,没有论文或技术细节,验证强度有限。

Dwarkesh Patel 播客

持续学习时代:AI 不再训完就上线,而是边用边学

Dwarkesh Patel 认为,一旦模型能在部署后持续更新权重,整个 AI 格局就会变。他打了个比方:就像学萨克斯,光靠看前人的笔记永远学不会,模型也不能只靠会话间传小纸条来真正干活。这会直接冲击现在的监管思路——不能再指望上线前做一次安全检查就万事大吉,按月或按季度做风险巡检才更合理。对齐研究也得转向,从盯着冻结的权重,变成防止模型在持续更新中被...

推荐理由:Dwarkesh 在 AI 播客圈本身可信度就高,这篇是他自己的预测文章,不是访谈转述,观点浓度够。如果持续学习真的落地,确实会动摇现在的安全框架,K 和 R 都站得住。我会先打个折:持续学习还没成现实,但推演逻辑是通的,所以重要性给 78 不算虚高。

8月6日星期四

AI HOT 精选

宇树科技科创板 IPO 定价 150.8 元/股,市盈率是行业平均的近 6 倍

宇树科技把发行价定在 150.8 元/股,对应市值约 610 亿元。这个价格对应的市盈率是 219.23 倍,而行业平均只有 38.56 倍,贵了将近 6 倍。公司 2025 年营收 16.99 亿元,净利润 2.78 亿元,是全球少数能靠通用机器人赚钱的公司。战略配售名单里有社保基金和 DeepSeek。网上申购 8 月 10 日开始,12 日缴款。...

推荐理由:宇树科创板上市定价 150.8 元/股,市盈率 219 倍,比行业平均 38.56 倍贵了快 6 倍,这个溢价本身就够扎眼。但公司 2025 年有 16.99 亿营收和 2.78 亿净利润,是少数真靠通用机器人挣到钱的,不是纯烧钱讲故事。战略配售名单里除了社保基金,还出现了 DeepSeek,这个组合不常见,给定价争议加了点想象空间。我会先打个折:正文没披露 DeepSeek 具体认购金额和合作细节,这点先别太激动。整体看,这条消息既有硬数据又有话题性,对关注机器人商业化和国内科技 IPO 的人值得一读。

纽约时报中文网

非洲开发者用脚投票,中国开源模型靠便宜和能定制抢走硅谷客户

乌干达开发者用阿里巴巴的模型做了个叫Sunflower的多语言种田工具,处理本地话比Meta和谷歌的产品都好,还更省钱。在OpenRouter上,中国开源模型的使用量已经占到一半,一年前还不到四分之一;Hugging Face下载量前25的模型里有19个是中国货。肯尼亚、尼日利亚、加纳的开发者也在拿它们做法律、教育和聊天机器人应用。主要吸引力就三点:免...

推荐理由:纽约时报实地采访,有具体开发者和硬数据,不是观点评论。非洲开发者用阿里模型做多语言农耕工具,处理本地话比 Meta 和谷歌产品好,成本还低,这个信号比多数行业叙事超前。OpenRouter 和 Hugging Face 的用量数字让趋势可量化。扣分是因为文章没展开讲这些模型在非洲部署的具体延迟、硬件限制和长期维护成本,但作为趋势信号已经足够清晰。

8月4日星期二

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

8月1日星期六

AI 群聊日报

DeepSeek V4 Flash 深夜上线,agent 跑分逼近 Opus 4.8,成本不到一半

DeepSeek 在深夜悄悄把 V4 Flash 的 API 接口原地升级了。Terminal Bench 2.1 分数从预览版的 61.8 直接拉到 82.7,超过了 GLM-5.2 的 81.0,离 Opus 4.8 的 85.0 很近了。第三方横评里,它中位分 58.80,单题测试成本 4.19 元,不到 GPT-5.6 Luna xhigh 的...

推荐理由:DeepSeek V4 Flash 正式版半夜原地升级,Agent 跑分逼近 Opus 4.8 但成本只有几分之一,是实打实的国产旗舰模型更新,触发正面信号加分。群聊日报给出了具体的 benchmark 数字和第三方横评成本对比,信息量够硬。我会先打个折——正文没提推理延迟和实际业务场景的稳定性验证,这点先别太激动,但就凭「接口不变、性能白送、价格屠夫」这三板斧,放在 featured 档没问题。

Latent Space

DeepSeek V4-Flash 0731 发布:不改模型结构,纯靠训练后优化,把智能体能力拉到接近 GPT-5.6,成本还低了六成

DeepSeek 放出了 V4-Flash 0731 版本,模型大小和结构没变,还是 284B 总参数、13B 活跃参数、100 万上下文窗口。这次更新全靠训练后优化,没有动预训练。最直观的变化是 Terminal-Bench 分数从 56.9 跳到 82.7,其他智能体相关的跑分也全面上涨。API 定价是输入每百万 token 0.14 美元、输出 ...

推荐理由:这条消息的核心看点很集中:DeepSeek V4-Flash 0731 没动预训练、没改结构,纯靠后训练把 Terminal-Bench 拉高 25.8 分,其他智能体跑分也全面上涨。对从业者来说,这说明后训练在提升模型实际干活能力上的空间比很多人想的大。定价和开源权重让它在 GPT-5.6 降价后依然有竞争力。不过原文是付费 newsletter 的汇总,不是一手发布公告,标题自己也说'今天没啥大事',所以分数没给到 85 以上。

Computing Life · Share · 鸭哥调研

DeepSeek V4 Flash 0731:用轻量级价格买到中端性能,但落地干活还有三个坑

DeepSeek 在 7 月 31 日更新了 V4 Flash API,模型结构没变(284B 总参数,每次只激活 13B),只是重新做了一遍后训练。独立评测显示它的综合能力得分 50 分,比预览版涨了 10 分,和 Gemini 3.6 Flash、GPT-5.6 Luna 这些轻量级模型差不多。价格确实便宜:没命中缓存时输入每百万 token 0....

推荐理由:DeepSeek V4 Flash 更新是本周热点,但“斩杀线”说法太简化了。这篇用独立评测和 Agent 真实开销把讨论拉回事实层面,有数据支撑的判断比纯 hype 有用。没给更高分是因为它本质是评论而非一手爆料,但对从业者做决策很实在。