跳到正文

#DeepSeek

今日 0 条

昨天 · 9月29日星期二

The Verge · AI

美国众议员 Ro Khanna 致信 DeepSeek、阿里巴巴、Moonshot AI,追问超级智能与失控风险

美国众议院中国问题特别委员会首席民主党人 Ro Khanna 致信 DeepSeek、阿里巴巴和 Moonshot AI,要求其提供追求"超级智能"与递归自我改进(RSI)的文件,并说明是否设有保障措施和"终止开关"。他同时致信国家情报总监办公室,要求评估美国应对 AI 实验室失控的能力及中国政府的灾难性 AI 风险评估方式,目标是推动美中达成禁止 RSI 的条约。

纽约时报中文网

中国真的在窃取美国公司的AI技术吗?

美国AI公司指责中国企业用“蒸馏”技术偷师,就是把大模型当老师,用它的回答来训练自家更小的模型。但专家说这指控夸大了,因为蒸馏只能拿到表面的文字输出,拿不到底层的代码和训练细节,中国公司还是得先自己搭出一个足够强的基座模型。另外,Anthropic刚因非法用版权书训练模型赔了15亿美元,OpenAI也正被纽约时报起诉,美国法院还没判蒸馏到底算不算偷商业机密。

推荐理由:文章用'蒸馏'这个技术点做引子,把中美AI技术争议从情绪拉回到事实层面。我会先打个折:这是篇综合梳理而非一手爆料,蒸馏的技术解释部分还是有点浅。但两个信息锚点很扎实——Anthropic的15亿赔偿和蒸馏只能拿表面输出的技术限制,让'偷技术'的指控显得站不住脚。正文没披露中国公司具体怎么搭基座模型,这点信息缺口得说清楚。整体对从业者来说是一篇能拿来反驳外行质疑的趁手文章。

9月27日星期日

Hacker News 首页

DeepSeek 开源 DSec:一个能弹性扩缩、让模型在隔离环境里练工具调用的沙箱系统

DeepSeek 发了一篇论文,把他们内部用来大规模训练 agent 的沙箱系统 DSec 公开了。核心思路是让模型在隔离的沙箱里反复练习使用真实工具,而不是靠模拟数据。系统能同时跑 10 万个沙箱,启动一个沙箱只要 11 秒,单个成本大概 3 美元。论文里讲了怎么用快照、缓存和按需分配把延迟和开销压下来,也给了训练 agent 时的效果数据。目前只放...

推荐理由:DeepSeek 开源了内部训 agent 用的沙箱系统,不是模型发布所以重要性没给到 85 以上,但作为一份带硬工程数据的 agent 训练基础设施参考,对从业者来说很实用。

9月26日星期六

Hacker News 首页

让每个 token 等宽的字体生成器

一个在线工具,把任意字体和 tokenizer 合并,生成每个 token 宽度相等的 TTF 字体。支持 DeepSeek、OpenAI、Kimi、Qwen 等 tokenizer,浏览器、Discord、Slack 都能直接用,不需要额外脚本。可选 Noto 后备字体和彩色 emoji。正文没披露渲染性能开销,但提到浏览器字形排版和换行可能让 to...

9月24日星期四

纽约时报中文网

习近平押注AI重振中国经济:用国家资本和产业政策追赶美国

这篇《纽约时报》长文梳理了中国AI战略的来龙去脉。习近平在2014年就提出中国不能只当买家,必须成为顶尖AI制造者,2017年首个国家级AI规划随即出台,目标2030年全球领先。钱给得很足,2000到2023年间国家主导的基金向AI企业砸了超过1840亿美元,去年政府和国有银行又承诺追加数千亿。跟美国盯着通用人工智能(AGI)不同,中国更急着把AI直接...

推荐理由:《纽约时报》这篇长文把中国 AI 战略的来龙去脉理得很清楚,有具体金额和清晰的中美对比框架。它属于背景梳理型内容,不是今天必须行动的消息,所以给 82 分——值得花时间读,但不用立刻跳起来。

9月20日星期日

Hacker News 首页

Pirate Face 把开源模型做成 BT 种子,防止模型被下架或删库

Pirate Face 把 Hugging Face 上的开源模型(包括大语言模型、图像、音频、数据集)自动转成磁力链接,用 P2P 网络分发。每个文件都带着 Hugging Face 官方的 SHA-256 校验码,下载后可以比对,确保模型权重没被篡改。目前已经同步了超过 66.9 万个模型,像 DeepSeek V4.1 Flash 和 Qwen3...

9月19日星期六

r/LocalLLaMA

MIT 放出 1451 条 DeepSeek V4.1 Flash 推理轨迹,已去污染

MIT 公开了 1451 条来自 DeepSeek V4.1 Flash 的“最大努力”推理轨迹,并且已经对 AIME 和 MATH-500 做了去污染处理。这批数据对训练小模型模仿长链推理很有用,但正文没披露轨迹的格式、长度分布,也没说是否包含奖励信号。如果你打算拿来做蒸馏或偏好学习,得先确认这些细节。

9月18日星期五

纽约时报中文网

中美担心的根本不是同一种 AI 风险

Kyle Chan 在纽时发文指出,美国 AI 圈怕的是模型自我迭代失控、变成生存威胁;中国决策者觉得那个起飞点还很远,眼下更怕深度伪造、政治敏感内容和社会不稳。最近几件事——OpenClaw 数据泄露警告、Mythos 模型网络攻击能力、以及一个能快速破解微信账号的 AI 工具——让北京也开始认真对待网络安全和模型失控这两类风险。Chan 建议,与其...

推荐理由:纽时观点文章,不是一手报道,但信息密度够。用三个具体事件把中美风险认知的分岔讲透了,不是泛泛而谈。我会先打个折:原文是评论性质,且摘录较短,但角度新鲜、信息有料,值得推给从业者看。

Hacker News 首页

Cactus 开源 Needle 3:8-29MB 的自动化模型,在手机工具调用上跑赢 DeepSeek V4 Flash

Cactus 开源了一个叫 Needle 3 的微型模型,专门给手机、手表、机器人这类小设备做自动化。整个模型压缩后只有 8 到 29 MB,用的是他们自家的“简单注意力网络”。它有个特别的设计叫“智能阶梯”:从 2 层到 20 层,每一层都是一个能独立干活的子网络。开发者可以按需选择,比如只取 4 层微调一下,在手机工具调用的跑分上就能超过 Deep...

推荐理由:一个 8-29 MB 的微型模型声称在手机工具调用上打平 DeepSeek V4 Flash,体积性能比很吸引人,智能阶梯的架构也给了开发者按需裁剪的灵活性。我会先打个折,因为目前只有项目页面的自报数据,没有第三方跑分或实际产品里的验证,这点先别太激动。

9月17日星期四

Hacker News 首页

DeepSeek-V4.1 Flash:把 KV 缓存再压 4 倍,Prefill 只开 20 层

这篇技术报告拆解了 DeepSeek-V4.1 Flash 的架构,核心目标是把 KV 缓存压到极致。模型总参数 552B,但 Prefill 阶段只激活 8B 参数、跑 20 层,Decode 阶段激活 16B 参数。压缩手段包括跨层共享 KV(CSA2)、FP4 精度的 KV 缓存,以及稀疏注意力索引器的优化。作者认为改动幅度大到该叫 DeepSe...

AI HOT 精选

DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型,主打 KV cache 压缩

DeepSeek 发了 V4.1-Flash,一个 552B 参数的 MoE 多模态模型,核心卖点是 KV cache 压缩——就是减少长文本推理时显存占用,让大模型跑长上下文更省显存。论文刚挂 arXiv,压缩比和跑分都没给,标题说“Pushing the Limits”,方向是推理效率。正文没披露具体压缩效果和评测结果,这点先别太激动。

r/LocalLLaMA

双 RTX Pro 本地跑 Qwen 和 DeepSeek,解码速度 150 tok/s

一位开发者用两块 RTX Pro 显卡组了台本地推理机,跑 Qwen 3.8 Flash Next 和 DeepSeek V4 Flash,解码速度达到 150 tok/s,预填充 10K tok/s,还能同时处理 4 个请求。他之前用 M3 Ultra 512GB,觉得推理太慢。新机器能跑 DeepSeek 的 1M 上下文窗口,但 Qwen 的思考...

9月16日星期三

Hacker News 首页

DeepSeek V4.1 Flash 在 Enclave 黑客基准测试中拿下 11/11 满分,总花费不到 5 美元

安全公司 Enclave 把 DeepSeek V4.1 Flash 扔进他们的黑客测试环境,让它攻击 11 个有漏洞的目标和 4 个已修复的对照目标。结果模型在所有 11 个目标上都拿到了代码执行权限,4 个对照目标则全部守住了。跑完这轮测试只花了 4.65 美元,算上失败重试的总成本也才 5.14 美元。模型总共执行了 2349 条 Bash 命令...

推荐理由:安全公司 Enclave 把 DeepSeek V4.1 Flash 扔进自己的渗透测试环境,让它攻击 11 个有漏洞的目标和 4 个已修复的对照目标。结果模型在所有漏洞目标上都拿到了代码执行权限,对照目标全部守住,攻防两端表现干净。总成本 4.65 美元,算上重试也才 5.14 美元,模型跑了 2349 条 Bash 命令。这个结果对安全从业者和 agent 开发者都有参考价值,但测试来自厂商自家环境而非第三方,所以重要性给了 82 分、放在 featured 位置,不往更高推。

AI 群聊日报

DS V4.1 Flash 搜索幻觉实测翻车,Astra 过度工程根因是旧指令反噬,GPT-6 Sol 本周传闻再起

群友用同一套搜索工具做控制变量实验,DS V4.1 Flash 调了 22 轮工具后给出的网址全是假的,GPT 只用 4 轮就拿到真实结果,差距明显。Astra 频繁过度工程的毛病被定位到旧模型时代攒下的 skill 和 memory 在暗中加活,清理后行为立刻正常,建议从 Sol 迁来的项目都做一次上下文大扫除。GPT-6 Sol 传闻最晚本周四发布...

AI HOT 精选

DeepSeek V4 不是一个大模型,是一堆模型,只有两个能看图

OpenRouter 发了一篇指南,把 DeepSeek V4 家族里哪个型号能读图、哪个只能读文字列清楚了。V4 不是单个模型,而是一个系列,包括 V4.1 Flash、V4 Pro 0813、V4 Flash 0731、V4 Flash Vision Exp 等。能接受图片输入的只有两个:V4.1 Flash(原生支持,输入 $0.15/百万 to...

9月15日星期二

r/LocalLLaMA

DeepSeek V4.1 Flash 量化版在 M3 Ultra 上跑到 40 token/秒,靠的是把苹果芯片的调度开销砍到骨头里

一个开发者把 DeepSeek V4.1 Flash 的 Q4 量化版塞进了 512GB 内存的 M3 Ultra,通过魔改推理引擎 ds4,把生成速度从每秒 16.6 个 token 提到了 31.3 个,开启模型自带的 DSpark 投机解码后能到 40.5 个。速度提升不是靠改模型,而是把 Metal 图形接口的调度指令大幅合并:原来 384 个...

推荐理由:一篇扎实的本地推理优化记录:把 DeepSeek V4.1 Flash Q4 塞进 M3 Ultra,靠合并 Metal 指令缓冲和开启原生 DSpark 投机解码,速度从 16tps 拉到 40tps。技术细节具体,对本地 LLM 玩家直接有用。分数维持 72,因为受众面窄,但在这个圈子里确实是个能让人立刻动手试的帖子。

AI 群聊日报

空仓库让 Astra 写代码翻车,喂了 code review 经验后质量飞升

今天最直观的教训来自 @搞仁义毛义仁:给 Astra 一个空白 C++ 仓库,代码写得一塌糊涂;把积累了大量 code review 经验的 GacUI 上下文导进去,质量立刻飙升。这说明模型不是不会写,是得用具体规则去“规训”。@今天群内信息量极大 实测了 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐是官方 API ...

推荐理由:今天群聊里两条实操经验比大多数论文都实在。第一条来自 @搞仁义毛义仁:用 Astra 写 C++,给个空仓库代码质量很差,但把积累了多年 code review 规则的 GacUI 上下文喂进去,质量立刻上来了。这说明模型不是不会写,是得用具体、有约束的规则去“规训”,光靠模型自己发挥不行。第二条是 @今天群内信息量极大 实测 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐比官方 API 高出一截,但正文没披露具体延迟和成本数字,所以这个“快”到底在什么条件下成立、性价比如何,还得自己测了才知道。两条都指向同一个方向...

AI HOT 精选

Fireworks 实测 DeepSeek-V4.1-Flash:写代码能力看齐 GPT-6 Astra,单次成本只要 1/15

Fireworks 跑了一遍 DeepSeek-V4.1-Flash 的完整测试。在衡量自动修 bug、写代码能力的 DeepSWE 基准上,它的 pass@1 得分是 74.34%,跟 GPT-6 Astra 的 74.12% 在同一档,但每次任务成本只要 0.43 美元,比 Astra 便宜 15 倍,比 Claude Opus 5 便宜 28 倍...

推荐理由:DeepSeek V4.1-Flash 在 DeepSWE 上跟 GPT-6 Astra 平起平坐,成本却砍了一个数量级,是本周最强的性价比信号。扣分是因为数据来自 Fireworks 自己的评测,不是独立第三方,而且原文被 cookie 墙截断,看不到完整方法和误差范围,所以结论先打个折。

9月13日星期日

Computing Life · Share · 鸭哥调研

DeepSeek Engram:把静态知识搬出 GPU 显存,用查表给推理腾出算力

DeepSeek 在 V4.1 Flash 模型里塞了一个叫 Engram 的模块,有 196B 参数,但它不做计算,只躺在主机内存的查找表里等模型来取。它的查找键直接用前几个 token 拼出来,地址提前就能算准,所以可以靠 RDMA 预取把传输延迟藏进计算过程里,不用占 GPU 显存。论文自报的数据里,推理能力涨得比知识问答更猛:BBH 涨了 5....

推荐理由:DeepSeek 在 V4.1 Flash 里塞了个 196B 参数的 Engram 模块,不做矩阵乘法,不占 GPU 显存,就躺在主机内存里当查找表用。它的查找键用前几个 token 直接拼出来,地址提前算好,靠 RDMA 预取把传输延迟藏进计算里。论文自报的数据里,推理能力涨得比知识问答更猛,BBH 涨了 5 个点,这说明模块主要补的是推理而不是死记硬背。我会先打个折,这些数字是自报的,没看到第三方复现,但思路本身——把知识外挂、用哈希键做确定性预取——对做推理系统的人很有参考价值。

9月12日星期六

Latent Space

DeepSeek V4.1-Flash:763B 参数,用编码器-解码器新架构把预填充和解码拆开跑,还自带视觉

DeepSeek 在 9 月 10 号发了 V4.1-Flash,虽然叫 4.1,Sebastian Raschka 直接说这该叫 V5。模型总参数 763B,用了混合专家(MoE)和因果编码器-解码器架构,把处理输入和生成输出拆成了两个阶段:预填充时激活 8B 参数,解码时激活 16B 参数,稀疏度只有 1% 到 2%。这么一拆,KV 缓存占用最多能...

推荐理由:DeepSeek 发了 V4.1-Flash,763B 的因果编码器-解码器 MoE,预填充 8B 激活、解码 16B 激活,稀疏度 1%-2%,还带了视觉。Sebastian Raschka 说这该叫 V5,说明架构改动不小。国内旗舰模型架构更新,加上外部技术圈同步讨论,HKR 三条都踩中。没给 90 以上是因为刚发,还没看到实际跑分和落地反馈,先打个折。

Computing Life · Share · 鸭哥调研

Anthropic 指控 30 万次请求被静默转发,被带走的是真实生产数据

Anthropic 九月发了一份技术调查,说一个团队在十天内用 5380 个假账号,把约 30 万次用户请求偷偷转给了 Claude。被带走的不是闲聊,是真实生产数据:有跨国药企的四国基建预算表、生效中的 Telegram 和飞书密钥,还有公安局的身份证核查记录。独立研究者 Shou 声称买到了 6TB 数据包,里面有 SSH 密钥和云平台令牌,但这是...

推荐理由:Anthropic 单方面出的技术调查,但列出的泄露样本太具体了,药企预算表、公安核查记录这些没法编。三个维度都打中了,安全事件天然有传播力。扣分点在于目前只有一方说法,被点名的公司还没回应,而且独立研究者声称买到的 6TB 数据包和这次事件的关系正文没完全说清,先别急着下结论。

AI HOT 精选

DeepSeek 开源 V4.1-Flash:用不对称算力给编程 Agent 省 prefill 成本

DeepSeek 放出了 V4.1-Flash 的开放权重,一个 552B 参数的 MoE 模型,用了 Causal Encoder-Decoder 架构,专门为编程 Agent 调过。它把算力拆成两块:prefill 阶段激活 8B 参数,decode 阶段激活 16B,外加 KV 缓存效率也做了优化。跑分上,Terminal Bench 2.1 拿...

推荐理由:DeepSeek 开源了 V4.1-Flash,一个 552B 的 MoE,用 CED 架构把 prefill 和 decode 拆开,专门降编程 agent 的延迟。Terminal Bench 2.1 的分数是实打实的,Baseten 的分析也补了部署视角。没给到 85 分以上是因为这是第三方解读,不是官方技术报告,部分细节还得等一手资料验证。

9月11日星期五

AI 群聊日报

Anthropic 报告实锤 DeepSeek 和 Kimi 偷偷把用户请求转给 Claude;Pro 20x 当天停售

Anthropic 九月威胁报告扔出了一颗炸弹:DeepSeek 和月之暗面(Kimi)在用户完全不知情的情况下,把发给自家模型的请求静默转发给了 Claude,用户的代码和登录凭证就这么暴露给了第三方。同时,一个 6TB 的中转站数据泄露包里,装着 SSH 密钥、云服务凭证和 GitLab 令牌,足以拿下 7 个政府实体和 19 家企业的内网。报告还...

推荐理由:Anthropic 官方威胁报告 + 6TB 泄露证据 + 七家中国实验室被点名做蒸馏,三条线撞在一起,不是孤立事件,是一个安全事件群。三个维度都打中了,信息密度和行业冲击力够上 featured。没给更高分是因为这是日报精选,不是独家调查,我会先打个折。

AI HOT 精选

DeepSeek V4.1 Flash 实测:降价还带视觉,游戏和城市生成都能跑

文章标题说 DeepSeek V4.1 Flash 大幅降价、原生支持视觉能力,作者用游戏和城市生成任务测了表现。但正文被微信屏蔽,看不到具体降了多少、视觉能力什么规格、生成质量如何。如果真降价且视觉好用,对做多模态或生成类应用的团队是个好消息,但这点先别太激动——没披露细节前只能当传闻看。

Computing Life · Share · 鸭哥调研

DeepSeek V4.1 Flash:长上下文成本的主战场,从算力转向内存

DeepSeek 发了 V4.1 Flash,把全局 KV 缓存压到上一代的约四分之一,持久化缓存压到约八分之一,缓存命中的输入价格也跟着砍了六成。技术报告的核心判断是:稀疏注意力已经把计算成本打下来了,现在拖慢长时程 agent 任务的是显存塞满、数据往 SSD 搬进搬出和总线传输的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存、...

推荐理由:DeepSeek V4.1 Flash 不是例行降价。报告把 KV 缓存压到上一代的 1/4 到 1/8,缓存命中的输入价格跟着砍了六成。核心判断很明确:稀疏注意力已经把计算成本打下来了,现在卡住长时程 agent 任务的是显存塞满、数据在 SSD 和总线之间搬来搬去的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存,思路清晰,数字也够硬。对正在跑 agent 工作流的人来说,这比单纯降 token 单价更有参考价值——省的是显存和传输延迟,不是只省 API 账单。

Sinocism · 比尔·毕晓普

Anthropic 指控 DeepSeek、小米、月之暗面用 Claude 输出来蒸馏模型

Anthropic 在 9 月的威胁情报报告里点名了三家中国公司:DeepSeek、小米和月之暗面。报告说,这几家把自家模型跟用户的对话记录喂给 Claude,再用 Claude 生成的回答当训练数据,去“蒸馏”Claude 的能力——也就是用大模型的输出教小模型模仿回答风格。这些对话里还夹带了个人用户、大型跨国公司和政府相关方的敏感信息。Anthro...

推荐理由:Anthropic 的官方威胁情报报告点名三家中国大模型公司,指控它们用带敏感信息的用户对话去蒸馏 Claude,这本身就是一个行业级安全事件,热度、知识和传播三个维度都打满了。稍微扣一点分,是因为目前我们只看到 Sinocism 的二手转述,还没拿到 Anthropic 报告原文,细节可能有出入,但整体判断不变。

AI HOT 精选

DeepSeek V4.1 Flash 在 Intelligence Index 拿到 40 分,把自家 V4 Pro 0813 挤下旗舰位

Artificial Analysis 的评测里,DeepSeek V4.1 Flash 综合智力评分 40,比之前的旗舰 V4 Pro 0813 还高一点,成了 DeepSeek 目前得分最高的模型。它干活时输入只激活 80 亿参数、输出激活 160 亿参数,能一口气处理 100 万 token 的上下文,代码直接 MIT 开源。不过正文没提推理速度...

推荐理由:新旗舰把自家旧旗舰超了,还 MIT 开源,对开发者吸引力很强。没给 85 分是因为正文没提推理速度,实际用起来快不快还是个问号,这点先别太激动。

9月10日星期四

AI HOT 精选

WorkBuddy 上线 DeepSeek V4.1-Flash,免费试用两周

WorkBuddy 把 DeepSeek V4.1-Flash 接进了自家平台,新用户能免费试用两周。这个版本通过 DeepSeek API 调用,支持原生多模态(能直接处理图片、文字等混合输入)。但公告没提相比之前版本快了多少、便宜了多少,也没说试用期后怎么收费。

AI HOT 精选

DeepSeek-V4.1-Flash 在硅基流动上线,552B 参数、1M 上下文,KV 缓存砍到 V4 Flash 的四分之一

硅基流动当天就接入了 DeepSeek-V4.1-Flash。这是个 552B 参数的混合专家模型,实际干活时预填充阶段激活约 80 亿参数,解码阶段约 160 亿参数,自带视觉能力,一次能处理 100 万 token 的上下文。最实在的一点是 KV 缓存占用只有 V4 Flash 的四分之一,部署成本会低不少。MIT 许可证,商用也方便。

推荐理由:硅基流动当天上线 DeepSeek-V4.1-Flash,KV 缓存降到 V4 Flash 的四分之一,这是个很直接的省钱信号。552B MoE、8B/16B 激活参数、1M 上下文、MIT 许可证这些关键信息都给了,但正文没放基准测试或实际跑分数据,所以分数没往上调,维持在 78。

AI HOT 精选

DeepSeek 发布 V4.1-Flash,把 AI 智能体的内存开销砍到前代的四分之一

DeepSeek 新模型 V4.1-Flash 主要解决长文本处理太烧钱的问题。它把 GPU 高速内存里的 KV 缓存(模型处理过的上下文暂存区)压到了前代 V4-Flash 的四分之一,卸载到硬盘或主机内存的部分更是缩到约八分之一。具体做法是把模型拆成编码器和解码器:读入信息时每 token 只激活 80 亿参数,生成文字时才用到 160 亿,输入端...

推荐理由:DeepSeek 发了 V4.1-Flash,专打 agent 场景的内存成本——KV 缓存压到前代的四分之一。给了具体架构数字,不是画饼。先放在 featured 而不是 p1,因为目前只有单一信源,还没形成交叉报道集群,而且正文没披露实际延迟和吞吐量,我会先打个折。

彭博科技

DeepSeek 又发低价模型,直接跟 OpenAI 和 Z.AI 打价格战

彭博社报道,DeepSeek 发布了一款新模型,主打低成本,目标就是跟 OpenAI 和 Z.AI 抢市场。标题说得很直白:这是新一轮价格战。文章没披露具体参数、定价和发布时间,但核心信息很明确——DeepSeek 想用更便宜的价格逼对手降价或调整策略。如果是真的,这对靠 API 收费的厂商压力不小。不过正文没给任何成本数字或性能对比,所以“低成本”到...

AI HOT 精选

DeepSeek 发布 V4.1-Flash:新架构让模型自带看图能力,不再外挂视觉模块

DeepSeek 推出了 V4.1-Flash,换了一套叫“因果编码器-解码器”的新架构,直接把视觉理解做进了模型里,不用再单独接一个看图组件。模型总规模 552B 参数,是个混合专家模型,处理你输入的内容时只激活 8B 参数,生成回答时激活 16B。官方说价格降了不少,但正文没给出具体降幅和跑分数据,我会先打个折,等第三方实测出来再看。

推荐理由:DeepSeek 发了 V4.1-Flash,换了一套因果编码器-解码器架构,把视觉理解原生集成进去,不用再外接看图模块。552B 总参数,推理时只激活 8B/16B,部署压力不大。官方说价格降了不少,但正文没给具体降幅和跑分,我会先打个折,等第三方实测出来再看。

AI HOT 精选

DeepSeek 出了个 V4.1-Flash,用新架构把视觉理解直接做进模型里,KV 缓存砍到原来的 1/4

V4.1-Flash 是 DeepSeek 新架构里最小的一个模型,总参数 552B,但干活时输入只激活 8B、输出激活 16B,属于 MoE 的省电模式。它换了一套叫 Causal Encoder-Decoder 的架构,视觉理解不再外挂,而是原生支持。最实在的变化是 KV 缓存:跟上一代比,HBM 占用降到 1/4,SSD 存储降到 1/8,意味着...

推荐理由:我会先打个折:正文没给具体 benchmark 和推理延迟数据,所以性能到底怎么样还得等实测。但架构切换这件事本身就够硬——Causal Encoder-Decoder 加原生视觉,KV 缓存直接砍到原来的零头,对实际部署的人比单纯跑分更有吸引力。加上 DeepSeek 的发布自带流量,选它上头条没毛病。

AI HOT 精选

DeepSeek 放出 V4.1-Flash:一口气能读百万 token,靠压缩缓存和复用注意力省资源

DeepSeek 发了个新模型 V4.1-Flash,主打长文本处理。它支持一次性读入 100 万 token 的上下文,相当于能直接啃完《三体》三部曲。为了不让显存爆炸,它用了 FP4 精度存 KV 缓存,把临时记忆压得很小;同时让不同层之间复用注意力计算结果,省掉不少重复运算。不过正文没披露参数量、跑分成绩、开源协议和 API 定价,所以实际效果和...

推荐理由:DeepSeek 扔了个 V4.1-Flash,一口气能读 100 万 token,相当于整本《三体》塞进去。为了省显存,KV 缓存用 FP4 精度压得很小,还让不同层之间复用注意力结果,省掉重复计算。这几个工程点组合在一起确实有点意思,但正文没披露参数量、跑分、开源协议和定价,实际效果和性价比都得打个问号,所以先放在 featured 级别观望。

r/LocalLLaMA

DeepSeek 发了个 V4.1 Flash:跑分超自家 Pro,API 降价,模型还开源了

DeepSeek 今天放出了 V4.1 Flash,一个总参数 552B 的 MoE 模型,但实际干活时输入只激活 8B、输出激活 16B 参数,所以推理成本压得很低。它用了新的非对称编码器-解码器架构,跑分直接超过了自家的 V4 Pro。KV 缓存也大幅瘦身,相比上代 HBM 需求降到 1/4、SSD 需求降到 1/8,这对经常要缓存命中的 agen...

推荐理由:DeepSeek 旗舰模型发布,架构有变化,跑分和成本数字都给了硬信息,按惯例对标美国大厂发布处理。HKR 三项全中:超 V4 Pro 的跑分和缓存瘦身都是硬货。没给 P1 是因为目前只有标题和摘要,正文细节还没看到。

Hacker News 首页

DeepSeek 在 HuggingFace 上发布了 V4.1 Flash 模型

DeepSeek 放出了一个叫 V4.1 Flash 的新模型,代码和权重挂在 HuggingFace 上。正文没披露参数量、跑分成绩和具体架构,所以现在还不知道它到底多大、多强。从命名习惯看,带“Flash”通常意味着这是个更快、更轻量的版本,可能适合需要低延迟或者本地跑的场景。Hacker News 上讨论热度很高,853 分、481 条评论,但大...

推荐理由:DeepSeek 发新模型本身就是当天必须追的事,HN 热度也印证了这点。但正文信息缺口太大,没有参数、没有 benchmark、没有架构说明,所以 K 轴打不上去。Flash 这个命名暗示它是轻量低延迟版本,跟推理部署场景直接相关,R 轴能站住。整体分数被信息不足拖住了,等官方补数据再重新评估。

AI HOT 精选

DeepSeek 发布 V4.1-Flash,新架构小模型,API 降价并直接替代 V4 Pro

DeepSeek 今天上线了 V4.1-Flash,这是他们全新模型架构里最小的一个,自带看图能力。新架构的设计目标是拉高能力天花板、跑得更快、吞吐量更大,后续会放大到更大参数的模型上。跑分方面,GPQA Diamond 90.9,Codeforces 3471,HLE 36.8,在编程和 Agent 任务上看着挺能打。API 这边,模型名改成 dee...

推荐理由:DeepSeek 发了新架构里最小的模型 V4.1-Flash,自带视觉能力,跑分不错,价格还降了。这是新架构的第一次亮相,后续会放大到更大模型上,所以值得关注。没给更高分是因为正文没展开讲新架构具体改了啥,而且这只是最小号的版本,能力天花板还得看后续的大模型。

9月9日星期三

AI HOT 精选

DeepSeek 找了中信证券准备在科创板上市,计划年内交表

路透社消息,DeepSeek 已经聘请中信证券筹备科创板 IPO,目标是今年递交申请、明年挂牌。募资额和估值还没定,钱主要想用在三块:扩建算力、加大模型和自研芯片投入、留住核心人才。公司 2026 年前七个月营收约 4.75 亿元,是 2025 年全年的 10 倍,增速很快。同时,DeepSeek 还在做新一轮融资,目标估值约 5000 亿元。今年 6...

推荐理由:消息本身分量够重,营收数字和自研芯片计划让故事有实感。没给更高分是因为募资额和估值都还没定,正文也缺具体时间表,现在只是筹备阶段,变数还大。