跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

194 条精选相关主题千问 Qwen开源生态模型发布

最新精选

第 1–20 条 · 共 194 条

昨天 · 9月29日星期二

纽约时报中文网

中国真的在窃取美国公司的AI技术吗?

美国AI公司指责中国企业用“蒸馏”技术偷师,就是把大模型当老师,用它的回答来训练自家更小的模型。但专家说这指控夸大了,因为蒸馏只能拿到表面的文字输出,拿不到底层的代码和训练细节,中国公司还是得先自己搭出一个足够强的基座模型。另外,Anthropic刚因非法用版权书训练模型赔了15亿美元,OpenAI也正被纽约时报起诉,美国法院还没判蒸馏到底算不算偷商业机密。

推荐理由:文章用'蒸馏'这个技术点做引子,把中美AI技术争议从情绪拉回到事实层面。我会先打个折:这是篇综合梳理而非一手爆料,蒸馏的技术解释部分还是有点浅。但两个信息锚点很扎实——Anthropic的15亿赔偿和蒸馏只能拿表面输出的技术限制,让'偷技术'的指控显得站不住脚。正文没披露中国公司具体怎么搭基座模型,这点信息缺口得说清楚。整体对从业者来说是一篇能拿来反驳外行质疑的趁手文章。

9月27日星期日

Hacker News 首页

DeepSeek 开源 DSec:一个能弹性扩缩、让模型在隔离环境里练工具调用的沙箱系统

DeepSeek 发了一篇论文,把他们内部用来大规模训练 agent 的沙箱系统 DSec 公开了。核心思路是让模型在隔离的沙箱里反复练习使用真实工具,而不是靠模拟数据。系统能同时跑 10 万个沙箱,启动一个沙箱只要 11 秒,单个成本大概 3 美元。论文里讲了怎么用快照、缓存和按需分配把延迟和开销压下来,也给了训练 agent 时的效果数据。目前只放...

推荐理由:DeepSeek 开源了内部训 agent 用的沙箱系统,不是模型发布所以重要性没给到 85 以上,但作为一份带硬工程数据的 agent 训练基础设施参考,对从业者来说很实用。

9月24日星期四

纽约时报中文网

习近平押注AI重振中国经济:用国家资本和产业政策追赶美国

这篇《纽约时报》长文梳理了中国AI战略的来龙去脉。习近平在2014年就提出中国不能只当买家,必须成为顶尖AI制造者,2017年首个国家级AI规划随即出台,目标2030年全球领先。钱给得很足,2000到2023年间国家主导的基金向AI企业砸了超过1840亿美元,去年政府和国有银行又承诺追加数千亿。跟美国盯着通用人工智能(AGI)不同,中国更急着把AI直接...

推荐理由:《纽约时报》这篇长文把中国 AI 战略的来龙去脉理得很清楚,有具体金额和清晰的中美对比框架。它属于背景梳理型内容,不是今天必须行动的消息,所以给 82 分——值得花时间读,但不用立刻跳起来。

9月18日星期五

纽约时报中文网

中美担心的根本不是同一种 AI 风险

Kyle Chan 在纽时发文指出,美国 AI 圈怕的是模型自我迭代失控、变成生存威胁;中国决策者觉得那个起飞点还很远,眼下更怕深度伪造、政治敏感内容和社会不稳。最近几件事——OpenClaw 数据泄露警告、Mythos 模型网络攻击能力、以及一个能快速破解微信账号的 AI 工具——让北京也开始认真对待网络安全和模型失控这两类风险。Chan 建议,与其...

推荐理由:纽时观点文章,不是一手报道,但信息密度够。用三个具体事件把中美风险认知的分岔讲透了,不是泛泛而谈。我会先打个折:原文是评论性质,且摘录较短,但角度新鲜、信息有料,值得推给从业者看。

Hacker News 首页

Cactus 开源 Needle 3:8-29MB 的自动化模型,在手机工具调用上跑赢 DeepSeek V4 Flash

Cactus 开源了一个叫 Needle 3 的微型模型,专门给手机、手表、机器人这类小设备做自动化。整个模型压缩后只有 8 到 29 MB,用的是他们自家的“简单注意力网络”。它有个特别的设计叫“智能阶梯”:从 2 层到 20 层,每一层都是一个能独立干活的子网络。开发者可以按需选择,比如只取 4 层微调一下,在手机工具调用的跑分上就能超过 Deep...

推荐理由:一个 8-29 MB 的微型模型声称在手机工具调用上打平 DeepSeek V4 Flash,体积性能比很吸引人,智能阶梯的架构也给了开发者按需裁剪的灵活性。我会先打个折,因为目前只有项目页面的自报数据,没有第三方跑分或实际产品里的验证,这点先别太激动。

9月16日星期三

Hacker News 首页

DeepSeek V4.1 Flash 在 Enclave 黑客基准测试中拿下 11/11 满分,总花费不到 5 美元

安全公司 Enclave 把 DeepSeek V4.1 Flash 扔进他们的黑客测试环境,让它攻击 11 个有漏洞的目标和 4 个已修复的对照目标。结果模型在所有 11 个目标上都拿到了代码执行权限,4 个对照目标则全部守住了。跑完这轮测试只花了 4.65 美元,算上失败重试的总成本也才 5.14 美元。模型总共执行了 2349 条 Bash 命令...

推荐理由:安全公司 Enclave 把 DeepSeek V4.1 Flash 扔进自己的渗透测试环境,让它攻击 11 个有漏洞的目标和 4 个已修复的对照目标。结果模型在所有漏洞目标上都拿到了代码执行权限,对照目标全部守住,攻防两端表现干净。总成本 4.65 美元,算上重试也才 5.14 美元,模型跑了 2349 条 Bash 命令。这个结果对安全从业者和 agent 开发者都有参考价值,但测试来自厂商自家环境而非第三方,所以重要性给了 82 分、放在 featured 位置,不往更高推。

9月15日星期二

r/LocalLLaMA

DeepSeek V4.1 Flash 量化版在 M3 Ultra 上跑到 40 token/秒,靠的是把苹果芯片的调度开销砍到骨头里

一个开发者把 DeepSeek V4.1 Flash 的 Q4 量化版塞进了 512GB 内存的 M3 Ultra,通过魔改推理引擎 ds4,把生成速度从每秒 16.6 个 token 提到了 31.3 个,开启模型自带的 DSpark 投机解码后能到 40.5 个。速度提升不是靠改模型,而是把 Metal 图形接口的调度指令大幅合并:原来 384 个...

推荐理由:一篇扎实的本地推理优化记录:把 DeepSeek V4.1 Flash Q4 塞进 M3 Ultra,靠合并 Metal 指令缓冲和开启原生 DSpark 投机解码,速度从 16tps 拉到 40tps。技术细节具体,对本地 LLM 玩家直接有用。分数维持 72,因为受众面窄,但在这个圈子里确实是个能让人立刻动手试的帖子。

AI 群聊日报

空仓库让 Astra 写代码翻车,喂了 code review 经验后质量飞升

今天最直观的教训来自 @搞仁义毛义仁:给 Astra 一个空白 C++ 仓库,代码写得一塌糊涂;把积累了大量 code review 经验的 GacUI 上下文导进去,质量立刻飙升。这说明模型不是不会写,是得用具体规则去“规训”。@今天群内信息量极大 实测了 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐是官方 API ...

推荐理由:今天群聊里两条实操经验比大多数论文都实在。第一条来自 @搞仁义毛义仁:用 Astra 写 C++,给个空仓库代码质量很差,但把积累了多年 code review 规则的 GacUI 上下文喂进去,质量立刻上来了。这说明模型不是不会写,是得用具体、有约束的规则去“规训”,光靠模型自己发挥不行。第二条是 @今天群内信息量极大 实测 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐比官方 API 高出一截,但正文没披露具体延迟和成本数字,所以这个“快”到底在什么条件下成立、性价比如何,还得自己测了才知道。两条都指向同一个方向...

AI HOT 精选

Fireworks 实测 DeepSeek-V4.1-Flash:写代码能力看齐 GPT-6 Astra,单次成本只要 1/15

Fireworks 跑了一遍 DeepSeek-V4.1-Flash 的完整测试。在衡量自动修 bug、写代码能力的 DeepSWE 基准上,它的 pass@1 得分是 74.34%,跟 GPT-6 Astra 的 74.12% 在同一档,但每次任务成本只要 0.43 美元,比 Astra 便宜 15 倍,比 Claude Opus 5 便宜 28 倍...

推荐理由:DeepSeek V4.1-Flash 在 DeepSWE 上跟 GPT-6 Astra 平起平坐,成本却砍了一个数量级,是本周最强的性价比信号。扣分是因为数据来自 Fireworks 自己的评测,不是独立第三方,而且原文被 cookie 墙截断,看不到完整方法和误差范围,所以结论先打个折。

9月13日星期日

Computing Life · Share · 鸭哥调研

DeepSeek Engram:把静态知识搬出 GPU 显存,用查表给推理腾出算力

DeepSeek 在 V4.1 Flash 模型里塞了一个叫 Engram 的模块,有 196B 参数,但它不做计算,只躺在主机内存的查找表里等模型来取。它的查找键直接用前几个 token 拼出来,地址提前就能算准,所以可以靠 RDMA 预取把传输延迟藏进计算过程里,不用占 GPU 显存。论文自报的数据里,推理能力涨得比知识问答更猛:BBH 涨了 5....

推荐理由:DeepSeek 在 V4.1 Flash 里塞了个 196B 参数的 Engram 模块,不做矩阵乘法,不占 GPU 显存,就躺在主机内存里当查找表用。它的查找键用前几个 token 直接拼出来,地址提前算好,靠 RDMA 预取把传输延迟藏进计算里。论文自报的数据里,推理能力涨得比知识问答更猛,BBH 涨了 5 个点,这说明模块主要补的是推理而不是死记硬背。我会先打个折,这些数字是自报的,没看到第三方复现,但思路本身——把知识外挂、用哈希键做确定性预取——对做推理系统的人很有参考价值。

9月12日星期六

Latent Space

DeepSeek V4.1-Flash:763B 参数,用编码器-解码器新架构把预填充和解码拆开跑,还自带视觉

DeepSeek 在 9 月 10 号发了 V4.1-Flash,虽然叫 4.1,Sebastian Raschka 直接说这该叫 V5。模型总参数 763B,用了混合专家(MoE)和因果编码器-解码器架构,把处理输入和生成输出拆成了两个阶段:预填充时激活 8B 参数,解码时激活 16B 参数,稀疏度只有 1% 到 2%。这么一拆,KV 缓存占用最多能...

推荐理由:DeepSeek 发了 V4.1-Flash,763B 的因果编码器-解码器 MoE,预填充 8B 激活、解码 16B 激活,稀疏度 1%-2%,还带了视觉。Sebastian Raschka 说这该叫 V5,说明架构改动不小。国内旗舰模型架构更新,加上外部技术圈同步讨论,HKR 三条都踩中。没给 90 以上是因为刚发,还没看到实际跑分和落地反馈,先打个折。

Computing Life · Share · 鸭哥调研

Anthropic 指控 30 万次请求被静默转发,被带走的是真实生产数据

Anthropic 九月发了一份技术调查,说一个团队在十天内用 5380 个假账号,把约 30 万次用户请求偷偷转给了 Claude。被带走的不是闲聊,是真实生产数据:有跨国药企的四国基建预算表、生效中的 Telegram 和飞书密钥,还有公安局的身份证核查记录。独立研究者 Shou 声称买到了 6TB 数据包,里面有 SSH 密钥和云平台令牌,但这是...

推荐理由:Anthropic 单方面出的技术调查,但列出的泄露样本太具体了,药企预算表、公安核查记录这些没法编。三个维度都打中了,安全事件天然有传播力。扣分点在于目前只有一方说法,被点名的公司还没回应,而且独立研究者声称买到的 6TB 数据包和这次事件的关系正文没完全说清,先别急着下结论。

AI HOT 精选

DeepSeek 开源 V4.1-Flash:用不对称算力给编程 Agent 省 prefill 成本

DeepSeek 放出了 V4.1-Flash 的开放权重,一个 552B 参数的 MoE 模型,用了 Causal Encoder-Decoder 架构,专门为编程 Agent 调过。它把算力拆成两块:prefill 阶段激活 8B 参数,decode 阶段激活 16B,外加 KV 缓存效率也做了优化。跑分上,Terminal Bench 2.1 拿...

推荐理由:DeepSeek 开源了 V4.1-Flash,一个 552B 的 MoE,用 CED 架构把 prefill 和 decode 拆开,专门降编程 agent 的延迟。Terminal Bench 2.1 的分数是实打实的,Baseten 的分析也补了部署视角。没给到 85 分以上是因为这是第三方解读,不是官方技术报告,部分细节还得等一手资料验证。

9月11日星期五

AI 群聊日报

Anthropic 报告实锤 DeepSeek 和 Kimi 偷偷把用户请求转给 Claude;Pro 20x 当天停售

Anthropic 九月威胁报告扔出了一颗炸弹:DeepSeek 和月之暗面(Kimi)在用户完全不知情的情况下,把发给自家模型的请求静默转发给了 Claude,用户的代码和登录凭证就这么暴露给了第三方。同时,一个 6TB 的中转站数据泄露包里,装着 SSH 密钥、云服务凭证和 GitLab 令牌,足以拿下 7 个政府实体和 19 家企业的内网。报告还...

推荐理由:Anthropic 官方威胁报告 + 6TB 泄露证据 + 七家中国实验室被点名做蒸馏,三条线撞在一起,不是孤立事件,是一个安全事件群。三个维度都打中了,信息密度和行业冲击力够上 featured。没给更高分是因为这是日报精选,不是独家调查,我会先打个折。

Computing Life · Share · 鸭哥调研

DeepSeek V4.1 Flash:长上下文成本的主战场,从算力转向内存

DeepSeek 发了 V4.1 Flash,把全局 KV 缓存压到上一代的约四分之一,持久化缓存压到约八分之一,缓存命中的输入价格也跟着砍了六成。技术报告的核心判断是:稀疏注意力已经把计算成本打下来了,现在拖慢长时程 agent 任务的是显存塞满、数据往 SSD 搬进搬出和总线传输的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存、...

推荐理由:DeepSeek V4.1 Flash 不是例行降价。报告把 KV 缓存压到上一代的 1/4 到 1/8,缓存命中的输入价格跟着砍了六成。核心判断很明确:稀疏注意力已经把计算成本打下来了,现在卡住长时程 agent 任务的是显存塞满、数据在 SSD 和总线之间搬来搬去的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存,思路清晰,数字也够硬。对正在跑 agent 工作流的人来说,这比单纯降 token 单价更有参考价值——省的是显存和传输延迟,不是只省 API 账单。

Sinocism · 比尔·毕晓普

Anthropic 指控 DeepSeek、小米、月之暗面用 Claude 输出来蒸馏模型

Anthropic 在 9 月的威胁情报报告里点名了三家中国公司:DeepSeek、小米和月之暗面。报告说,这几家把自家模型跟用户的对话记录喂给 Claude,再用 Claude 生成的回答当训练数据,去“蒸馏”Claude 的能力——也就是用大模型的输出教小模型模仿回答风格。这些对话里还夹带了个人用户、大型跨国公司和政府相关方的敏感信息。Anthro...

推荐理由:Anthropic 的官方威胁情报报告点名三家中国大模型公司,指控它们用带敏感信息的用户对话去蒸馏 Claude,这本身就是一个行业级安全事件,热度、知识和传播三个维度都打满了。稍微扣一点分,是因为目前我们只看到 Sinocism 的二手转述,还没拿到 Anthropic 报告原文,细节可能有出入,但整体判断不变。

AI HOT 精选

DeepSeek V4.1 Flash 在 Intelligence Index 拿到 40 分,把自家 V4 Pro 0813 挤下旗舰位

Artificial Analysis 的评测里,DeepSeek V4.1 Flash 综合智力评分 40,比之前的旗舰 V4 Pro 0813 还高一点,成了 DeepSeek 目前得分最高的模型。它干活时输入只激活 80 亿参数、输出激活 160 亿参数,能一口气处理 100 万 token 的上下文,代码直接 MIT 开源。不过正文没提推理速度...

推荐理由:新旗舰把自家旧旗舰超了,还 MIT 开源,对开发者吸引力很强。没给 85 分是因为正文没提推理速度,实际用起来快不快还是个问号,这点先别太激动。

9月10日星期四

AI HOT 精选

DeepSeek-V4.1-Flash 在硅基流动上线,552B 参数、1M 上下文,KV 缓存砍到 V4 Flash 的四分之一

硅基流动当天就接入了 DeepSeek-V4.1-Flash。这是个 552B 参数的混合专家模型,实际干活时预填充阶段激活约 80 亿参数,解码阶段约 160 亿参数,自带视觉能力,一次能处理 100 万 token 的上下文。最实在的一点是 KV 缓存占用只有 V4 Flash 的四分之一,部署成本会低不少。MIT 许可证,商用也方便。

推荐理由:硅基流动当天上线 DeepSeek-V4.1-Flash,KV 缓存降到 V4 Flash 的四分之一,这是个很直接的省钱信号。552B MoE、8B/16B 激活参数、1M 上下文、MIT 许可证这些关键信息都给了,但正文没放基准测试或实际跑分数据,所以分数没往上调,维持在 78。

AI HOT 精选

DeepSeek 发布 V4.1-Flash,把 AI 智能体的内存开销砍到前代的四分之一

DeepSeek 新模型 V4.1-Flash 主要解决长文本处理太烧钱的问题。它把 GPU 高速内存里的 KV 缓存(模型处理过的上下文暂存区)压到了前代 V4-Flash 的四分之一,卸载到硬盘或主机内存的部分更是缩到约八分之一。具体做法是把模型拆成编码器和解码器:读入信息时每 token 只激活 80 亿参数,生成文字时才用到 160 亿,输入端...

推荐理由:DeepSeek 发了 V4.1-Flash,专打 agent 场景的内存成本——KV 缓存压到前代的四分之一。给了具体架构数字,不是画饼。先放在 featured 而不是 p1,因为目前只有单一信源,还没形成交叉报道集群,而且正文没披露实际延迟和吞吐量,我会先打个折。

AI HOT 精选

DeepSeek 发布 V4.1-Flash:新架构让模型自带看图能力,不再外挂视觉模块

DeepSeek 推出了 V4.1-Flash,换了一套叫“因果编码器-解码器”的新架构,直接把视觉理解做进了模型里,不用再单独接一个看图组件。模型总规模 552B 参数,是个混合专家模型,处理你输入的内容时只激活 8B 参数,生成回答时激活 16B。官方说价格降了不少,但正文没给出具体降幅和跑分数据,我会先打个折,等第三方实测出来再看。

推荐理由:DeepSeek 发了 V4.1-Flash,换了一套因果编码器-解码器架构,把视觉理解原生集成进去,不用再外接看图模块。552B 总参数,推理时只激活 8B/16B,部署压力不大。官方说价格降了不少,但正文没给具体降幅和跑分,我会先打个折,等第三方实测出来再看。