跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

194 条精选相关主题千问 Qwen开源生态模型发布

最新精选

第 81–100 条 · 共 194 条

7月19日星期日

TechCrunch · AI

月之暗面开源 Kimi K3,性能逼近 GPT-5.6 和 Claude Fable 5,但关键细节没公布

月之暗面这周把 Kimi K3 开源了。公司自己承认模型还打不过最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但 Arena.ai 和 Vals AI 的第三方评测显示,K3 已经能跟这些旗舰模型掰手腕了。发布正好赶上习近平在上海世界人工智能大会讲话,纳斯达克周五跌了约 1%,芯片股像英伟达被抛售。这波讨论很像 2025 年...

推荐理由:月之暗面把 Kimi K3 开源,第三方评测显示它能跟 GPT-5.6 Sol 和 Claude Fable 5 掰手腕,这是中国模型生态一个挺硬的信号。不过这篇是 TechCrunch 的评论稿,不是官方发布原文,所以重要性我打了 78 分,没再往上拉。

7月17日星期五

Hacker News 首页

Mozilla 发布首份开源 AI 报告:开放权重模型已吃掉大部分 token 流量,但落地工具链还是跟不上

Mozilla 的第一份《开源 AI 现状》报告给出了几个硬数字。开放权重模型现在占了 OpenRouter 上大部分 token 流量,排第一的是 DeepSeek V4 Flash。GPT-4 级别的推理成本在 36 个月内跌了 50 倍,现在每百万 token 只要 0.4 美元。能力差距还有 3.3%,主要卡在推理和多模态上,编程能力已经打平。...

推荐理由:这份报告不是公关稿,给的是可引用的流量占比、成本曲线和能力差距数字。我会先打个折:它是快照而非产品发布,所以没给更高分,但对开源生态的判断有实际参考价值。正文没披露样本覆盖时段和统计口径,这点先别太激动。

7月16日星期四

FT · 科技

Mira Murati 的 Thinking Machines 发布首款模型,训练方法借鉴了 DeepSeek 等中国团队

前 OpenAI 技术负责人 Mira Murati 创立的 Thinking Machines 推出了第一个模型。FT 报道说,这个模型用了和中国公司 DeepSeek 类似的训练技巧,用更少的算力做到了接近前沿的水平。不过正文没披露模型叫什么、参数量多大、具体跑分是多少,也没说是不是开源权重。

推荐理由:Mira Murati 创业首秀加上 FT 独家,故事分量够上 featured。但正文没给模型名、参数量、跑分和是否开源,信息缺口不小,所以分数先打 78,等更多细节出来再调。

7月14日星期二

FT · 科技

DeepSeek 刚融完第一轮钱,一个月后又开始谈新一轮融资

FT 的消息说,DeepSeek 在 6 月刚完成公司史上第一轮外部融资,现在已经在跟投资人聊新一轮了。第一轮到底融了多少钱、估值多少、谁投的,正文都没披露。新一轮的规模和用途也还没定。创始人梁文锋之前一直靠自有资金撑着,连着两轮融资说明公司正快速切到扩张模式。

推荐理由:FT独家消息,DeepSeek 6月刚完成史上第一轮外部融资,现在已经在谈第二轮了。梁文锋从自掏腰包到连续融资,是个重要的战略信号。不过第一轮到底融了多少、估值多少、谁投的,正文都没说,所以重要性没给满。我会先打个折,等具体数字出来再重新评估。

7月8日星期三

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

7月7日星期二

纽约时报中文网

美国AI公司指责中国对手非法蒸馏技术,但这事没那么简单

Anthropic 6月致信美国参议员,指控阿里巴巴用数万个未经授权的账户,以工业级规模蒸馏其 Claude 模型。蒸馏本身不是什么新技术,谷歌十年前就发明了它,本质是让大模型当老师,教小模型学回答风格,省算力。马斯克4月也在法庭上承认 xAI 蒸馏过 OpenAI 的技术。目前法律上是否违法还不明确,法院没判过,版权法也管不着模仿行为。正文没披露阿里...

推荐理由:Anthropic 正式指控阿里巴巴用数万个账户大规模蒸馏 Claude,马斯克的案子是现成的平行案例。核心钩子是法律真空:模仿行为本身不违法,法院没判过,版权法也管不着。文章没披露阿里的回应和具体证据,所以分数没给到 85 以上。

7月6日星期一

Computing Life · Share · 鸭哥调研

SEO 服务正在变成模型蒸馏的访问基础设施

这篇文章把 AI 答案抓取从 SEO 工具重新定义为模型访问市场。NetNut 被 FBI 查封之所以值得关注,不是因为它做网页爬虫,而是它的爬虫目录里公开卖 ChatGPT、Perplexity 和 Google AI Mode 的访问接口。Anthropic 今年 2 月的报告指出,有 24,000 个欺诈账号对 Claude 发起了超 1,600...

推荐理由:这篇把一个看似常规的网络犯罪查封案,重新解释成模型蒸馏基础设施的曝光,视角新鲜。H、K、R 三条都踩中了。正文有硬证据:NetNut 的爬虫目录里直接列着模型访问接口,不是推测。Anthropic 的数据也给了攻击规模一个量级。我会先打个折——文章没展开讲这些被抓取的输出具体怎么喂进蒸馏流程,但把‘谁在卖、卖给谁、规模多大’这条线理得很清楚,对从业者来说信息密度够高。

7月4日星期六

AI HOT 精选

2.6万名学生追踪30个月:用AI写作业,平时分涨18%,大考分却跌了24%,这个坑两年才完全暴露

这项研究跟踪了华中某县2.6万多名中学生两年半,发现用AI写作业的学生平时成绩涨了18%,完成时间从64分钟缩到45分钟,但闭卷月考成绩直接掉了20%。更麻烦的是,中考、高考这类关键考试的成绩下滑了18%到24%,而且这个跌幅要差不多两年才会完全显现,短期研究根本看不出来。约81%的长期用户出现了典型的“外包模式”——作业做得又快又好,考试却一塌糊涂。...

推荐理由:这篇研究用大规模纵向数据(2.6万人、2.5年)挖出了AI辅助学习的一个隐藏成本:效果恶化有两年延迟期。HKR三项都打中了,但只覆盖一个县、原文付费墙,信息细节有限,所以分数没再往上拉。

7月2日星期四

Hacker News 首页

11 个模型比赛重构一个 1500 行的 LangGraph 巨型节点,Fable 的方案拿了第一

作者把一个 1500 行的 LangGraph 巨型节点(god node,所有逻辑塞在一个函数里)扔给 11 个模型,让它们各自出重构方案和完整代码,然后让模型互相打分。Fable-5 的方案在同行评审里排第一,GPT-5.5 和 DeepSeek-4-pro 紧随其后,GPT-5.4 和 Opus-4.7 垫底。每个模型都产出了架构文档和代码,评审...

推荐理由:一篇 11 模型重构实战,有完整代码和同行互评排名,不是纸上谈兵。Fable-5 拿第一本身就值得讨论。扣分是因为这只是个人单次实验,不是受控基准测试,所以停在 feature 级别。

6月30日星期二

Hacker News 首页

美团开源 LongCat-2.0:1.6 万亿参数 MoE 模型,48B 激活,全程用自研 AI ASIC 训练

美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...

推荐理由:美团开源了一个总参数 1.6 万亿、每次激活约 480 亿参数的 MoE 模型,全程用自研 AI ASIC 训练,5 万多张卡零回滚跑完,预训练数据量超过 35 万亿 token。模型专门为长上下文和智能体场景做了优化,引入了 LongCat 稀疏注意力来加速百万 token 级处理。我会先打个折:目前只有官方博客,没有第三方评测或真实业务反馈,所以分数停在 82 而不是更高。如果是真的,这套非 GPU 训练方案挺省钱,但稳定性和性能还需要更多证据。

6月29日星期一

Hacker News 首页

DeepSeek V4 七月中旬上线,API 开始分峰谷时段计价

DeepSeek 宣布 V4 模型会在七月中旬正式发布,同时上线峰谷计价:北京时间每天 9:00–12:00 和 14:00–18:00 算高峰,API 价格翻倍。高性能版 deepseek-v4-pro 输出从每百万 token 6 元涨到 12 元,轻量版 deepseek-v4-flash 从 2 元涨到 4 元。用户会在调价前 24 小时收到邮...

推荐理由:V4 发布加上峰谷计价,是国内大模型 API 头一回把电力市场的逻辑搬过来。高峰时段价格翻倍对重度用户是实打实的成本信号,所以给 featured。没打更高是因为正文只放了价格和时段,模型能力、性能提升这些关键信息都还没披露,先别太激动。

6月27日星期六

AI HOT 精选

AI账单比员工工资还高,部分美国公司已把全部流量切给DeepSeek

旧金山一家25人的公司Lindy,CEO说每月AI费用已经超过所有员工的工资总和,这个月他们把100%的调用从Anthropic的Claude切到了DeepSeek,预计未来几个月能省下数百万美元。他之前在Uber的同事也说,Uber现在给部分AI工具设了每月1500美元的开支上限。咨询公司Highspring的人提到,有些客户干脆暂停AI投入,等能证...

推荐理由:有公司名和具体数字,不是空谈趋势。Lindy 的 100% 切换和 Uber 的 1500 美元上限是可验证的决策信号。没给更高分是因为目前只有标题和摘要,正文还没披露切换后的实际效果和确切节省金额。

6月26日星期五

FT · 科技

DeepSeek 要大规模招人,中国 AI 圈抢人大战升级

DeepSeek 正在从字节、阿里等大厂高薪挖人,部分 offer 能给到候选人当前薪资的 2 到 3 倍。团队会从现在的几百人快速扩张,但正文没披露具体要招到多少人。我会先打个折——能不能持续这个节奏,还得看下一轮融资和收入能不能跟上。

推荐理由:FT 独家报道了 DeepSeek 用 2-3 倍薪资高调挖人的动作,有硬数字、有明确的大厂对手,信息冲击力够。缺点是正文没披露具体要招到多少人,且 FT 有付费墙,部分读者看不到全文。

AI HOT 精选

华盛顿邮报实测:主流AI聊天机器人政治立场仍偏左,连标榜“反觉醒”的模型也未能幸免

华盛顿邮报拿六个主流AI模型做了次政治立场测试,结果发现它们整体还是偏左。OpenAI的GPT-5.5回答里80%只给左派论点,DeepSeek V4 Pro也有70%,两者都反对死刑,尽管美国多数民众几十年来一直支持。Anthropic的Claude Opus 4.8有43%的回答纯左派。xAI的Grok 4.3虽然右派回答比其他模型多,但纯左派回答...

推荐理由:华盛顿邮报这次测试给了具名模型和百分比,不是那种“AI可能有偏见”的模糊喊话。三个HKR维度都踩中了,但这是媒体做的基准测试,不是产品发布或技术突破,所以放在72分上下的featured档位。信息源是媒体,正文没披露测试方法和样本量,这点先别太激动。

6月25日星期四

Hacker News 首页

开源模型便宜到让闭源厂商没法打价格战

作者在试用 DeepSeek V4 时发现,它的 API 价格只要 0.09 美元,而 Anthropic 的同类模型要 5 美元,差了将近 50 倍。文章认为,Anthropic 和 OpenAI 被自己的高成本结构卡住了脖子,很难把价格砍掉一两个数量级去跟 DeepSeek 或小米的 Mimo 竞争。作者猜测,这两家可能会走奢侈品路线,靠制造稀缺感...

推荐理由:作者用一个真实的定价对比,把开源权重模型和闭源厂商之间的结构性成本矛盾摆到了台面上。50 倍价差是硬数据,不是修辞。正文被截断了,完整论证看不到,所以评分停在 featured 档,不加码。

6月20日星期六

AI HOT 精选

微软在测试 DeepSeek-R1 和 V4,打算把中国模型卖给西方客户,同时也在把 ChatGPT 卖给中国企业

彭博社说微软正在测试 DeepSeek-R1 和 DeepSeek-V4,准备把这些中国模型提供给西方客户。另一边,微软也在把 ChatGPT 卖给中国企业,相当于在中美之间做 AI 模型的中间商。正文没披露定价、分成比例和具体上线时间,所以这个双向贸易网络到底能跑多大,现在还不清楚。

推荐理由:彭博社的信源让这事有可信度,微软在中美之间双向倒卖 AI 模型这个定位以前没被挑明过,所以信息增量是实的。我会先打个折:正文没披露定价、分成比例和具体上线时间,所以这个双向贸易网络到底能跑多大、赚多少,现在全是问号。但光是微软同时卖 GPT 给中国、卖 DeepSeek 给西方这个事实,就足够让从业者重新盘算自己的采购和合规策略了。

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

6月18日星期四

AI HOT 精选

DeepSeek 识图模式在 App 和网页端上线,App 端仍标注“内测中”

DeepSeek 多模态研究员 Xiaokang Chen 宣布,识图模式今天在网页和 App 端正式上线。这个模式跟“快速模式”“专家模式”并列,打开后可以上传图片让模型理解画面内容,不只是提取文字。IT之家实测发现,App 端还挂着“图片理解功能内测中”的提示,网页端没有。今年 4 月 DeepSeek 公开过背后的多模态框架“Thinking w...

推荐理由:DeepSeek 把图片理解做成一个正式模式,产品上算是一个节点,补上了多模态输入的缺口,而且有公开框架背书。IT之家实测提到 App 端还挂着内测提示,说明全量放开可能还要等一等,所以重要性没给满。整体上,这件事对用 DeepSeek 做开发的团队来说是个直接可用的更新,值得提一下。

6月17日星期三

Computing Life · Share · 鸭哥调研

推理模型四年史:你以为的石破天惊,其实早有暗线

推理模型不是2024年突然蹦出来的。让模型写解题步骤的思维链、用自己生成的正确推理训练自己的STaR、给中间步骤打分的过程奖励模型,这些技术从2022年起就陆续成熟了。o1真正改变的是产品化:把推理变成一种可以计费、可以调度的资源,在API里引入reasoning tokens和可调节的思考强度参数,相当于给scaling law开了第二个轴。Deep...

推荐理由:这是一篇有信息量的长文综述,用具体论文和时间线追溯推理模型的技术源头,核心判断是o1的分水岭在于把推理产品化成可计费算力,而非发明了推理本身。HKR三项都踩中,但属于梳理整合型内容而非独家爆料,放在78分、featured层级合理。