跳到正文

#DeepSeek

今日 0 条

9月9日星期三

FT · 科技

DeepSeek 融资太抢手,催生了一个收高额中介费的影子市场

DeepSeek 正在融新一轮资,想投进去很难。FT 报道说,一些基金和家族办公室正通过中间人买份额,条件是 2% 的管理费加 20% 的业绩提成,比行业标准贵一大截。有个投资人为了拿到 500 万到 1000 万美元的额度,还得承诺未来给中间人更多好处。DeepSeek 说没授权任何人卖老股,但报道没披露这轮融资的总规模和估值。这些场外报价水分可能不...

推荐理由:FT 独家挖出了 DeepSeek 融资的场外灰色市场,有具体的费率数字和投资人案例,信号很强。但报道没披露这轮融资的总规模和估值,DeepSeek 也只是否认了授权卖老股,没给更多细节,所以分数没再往上调。H、K、R 三项都打中了,信息缺口主要在交易本身的完整轮廓上。

AI HOT 精选

OpenRouter 上线美国区域路由:请求解密和模型推理都锁在美国境内

OpenRouter 给企业版和商业版用户加了一个美国区域路由端点(us.openrouter.ai),跟去年 10 月上线的欧盟路由配套。发到这个端点的请求只会在美国境内解密,也只交给部署在美国的模型供应商跑;如果某个模型没有美国供应商,请求直接返回 404,不会偷偷绕到其他地区。DeepSeek V4 Pro、Kimi K3、GLM 5.2 这些国...

9月6日星期日

9月5日星期六

r/LocalLLaMA

Qwen 3.8 27B 在新版评测中依然能打

Artificial Analysis 发布了 v4.2 版智能指数,Qwen 3.8 27B 排名没掉。这次更新加了两个新测试:AA-Briefcase(让模型模拟知识工作者的任务流程)和 Surge's GDP.pdf(一篇 4592 页的 PDF,测长文档推理能力),同时去掉了 GPQA Diamond,因为大家分数都刷满了,没区分度了。有用户说...

9月4日星期五

r/LocalLLaMA

Qwen3.8-27b 被用户称为首个能“闭眼信任”的本地模型

Reddit 上有用户说,Qwen3.8-27b 在连续 8 个多小时的 agent 任务里一次都没出错,是他用过的第一个能像顶尖闭源模型那样放心把活丢给它的本地模型。另一位用户也证实,自己跑过 20 小时的会话,让模型用子代理和提交检查点干活,INT8 量化版甚至解决了一个 DeepSeek V4 Flash 没搞定的代码问题。帖子没说明具体任务类型...

推荐理由:两个独立用户都说Qwen3.8-27b在几小时到二十小时的agent任务里表现稳定,其中一个还直接跟DeepSeek V4 Flash做了对比,量化版反而解决了问题。我会先打个折:帖子没说明具体任务类型、失败标准,也没给出可复现的测试方法,这本质上是社区口碑,不是严谨评测。但考虑到本地模型长时间跑agent不出错这件事本身就稀缺,这条信息对从业者选型有参考价值,所以给72分,放在featured位置。

9月3日星期四

Hacker News 首页

陈大年带着 27B 本地模型杀回来了,在信通院 MCP 评测里只比 DeepSeek-V4-Pro 低 1.3 分

陈大年复出创办了 StartLux,第一款模型 StartLux-V1.0-27B-Preview 只有 270 亿参数,能直接在消费级电脑上跑,不用联网。在信通院 MCP 专项评测里,它综合得分 39.25%,排第二,比 1.6 万亿参数的 DeepSeek-V4-Pro 只差 1.3 个百分点,还在位置导航、金融分析和浏览器自动化三个单项拿了第一。...

推荐理由:陈大年带着 StartLux 重回牌桌,第一个模型就在信通院 MCP 评测里拿了第二,27B 参数跑在消费级硬件上,三个单项第一,跟 DeepSeek 的 1.6T 旗舰只差 1.3 分——这个性价比信号对 agent 方向的人很有参考价值。不过目前只有 benchmark 成绩,模型没公开,实际可用性还看不清,所以分数先打 82,等有更多落地信息再往上调。

9月2日星期三

AI 群聊日报

DeepSeek V4 Flash 实战体感碾压 Sol,Anthropic 发布 Fable 5.1 但被指挤牙膏

群友用 DSH 加 DeepSeek V4 Flash 跑了两个月对比和一周 51 亿 token 的活,结论是实际干活比 GPT-5.6 Sol 舒服。Sol 想太多、输出假大空,V4 Flash 首 token 平均 2.3 秒,总花费才 ¥362.84。有人提出“订阅制健身房悖论”,认为卖月费的 harness 会悄悄限制使用强度,按量付费的才不...

推荐理由:群聊实测数据够扎实——51 亿 token 跑下来才花三百多块,首 token 2.3 秒,成功率接近百分百,对比 Sol 的啰嗦和假大空,结论很明确。但来源是匿名群聊记录,不是官方发布或可复现的基准测试,权威性要打个折。H、K、R 全中,放 featured 没问题。

9月1日星期二

Hacker News 首页

AI 能让你更快地把事情搞砸

作者算了笔账:如果 AI 真能让开发速度提升 10 倍,按时间推算我们现在应该多出好几个 Airbnb、Stripe 级别的公司,但一个都没有。他自己花 10 美元买了 DeepSeek 额度做项目,代码能跑,但像一辆用胶带粘着轮子的小丑车。文章指出,写代码从来不是软件开发最耗时的瓶颈,但很多老板真信了“让 Claude 搞定就行”。他还引了一组数据:...

8月31日星期一

AI HOT 精选

DeepSeek 开源首个视觉模型 V4-Flash-Vision-Exp,多模态 Agent 能力接近 Opus-4.8

DeepSeek 在 Hugging Face 上放出了 V4 系列第一个能看图的模型,用 MIT 协议开源。它支持 JPEG、PNG、GIF、WebP 图片输入,能做图片描述、截图识字、读图表这些事。仓库里给了模型文件、分词器和一个极简的 PyTorch 推理代码,覆盖了视觉编码器、MoE(混合专家)、DFlash 注意力等核心模块。官方说这是个实验...

推荐理由:DeepSeek 放出了 V4 系列第一个多模态实验模型,MIT 协议,能看图、识字、读图表。官方说 Agent 能力接近 Opus-4.8,但正文没给出具体 benchmark 数字和对比细节,所以分数先打个折。即使这样,一个中国大模型直接对标 Claude 旗舰款,还给了可跑的推理代码,重要性依然很高。

8月30日星期日

Product Hunt · AI

AppGacha:一句话生成桌面小工具

AppGacha 让你用大白话描述一个需求,就能生成一个真正的桌面应用——工具、小组件、小游戏、个人助手都行。应用跑在本地,可以随身带走,还能整理到自己的桌面工作区里。免费,这周刚在 Product Hunt 上线,底层用了 DeepSeek 和 OpenAI。正文没交代支持哪些操作系统、生成速度多快、具体用了哪个模型版本,所以实际体验得自己试。

8月27日星期四

AI 群聊日报

GLM-5.3-Flash 和 Qwen 3.8-Flash-Next 同日发布,都砍掉了全局注意力

今天两个新 Flash 模型撞车发布。GLM-5.3-Flash 在六项基准上追平 Claude Opus 4.8,每任务成本折后 0.045 美元,但实测速度慢、幻觉多。Qwen 3.8-Flash-Next 开源权重,在 DGX Spark 上单流解码跑到 64.7 tok/s,全面超过 DeepSeek V4 Flash。两者都用了 MoE 加稀...

推荐理由:两条 Flash 模型撞车发布,信息密度高。GLM-5.3-Flash 基准分好看但实测翻车,Qwen 3.8-Flash-Next 开源权重且推理速度有实测数据压过 DeepSeek V4 Flash。有具体数字、有社区真实反馈、有架构对比,对从业者选型参考价值大,但正文没展开幻觉具体表现和更多实测细节,所以重要性给 78 分。

8月26日星期三

Hacker News 首页

Z.ai 认领匿名模型 Ox Alpha,确认是 GLM 系列新作并将开源权重

之前以匿名身份在评测榜上冒出来的 Ox Alpha,现在被 Z.ai 认领了。公司确认它属于 GLM 系列,并计划把模型权重放出来给大家用。跑分成绩和 DeepSeek 很接近,但参数量、训练数据、具体开源时间这些关键信息都没说。我会先打个折——没看到技术细节和许可证之前,这更像一次预热,离真正能用还有距离。

推荐理由:Z.ai 认领了之前匿名刷榜的 Ox Alpha,确认是 GLM 系列并承诺开放权重,Bloomberg 独家报道增加了可信度。但参数量、训练数据、具体发布时间都没说,目前更像一次预热,离真正能用还有距离。

8月25日星期二

Computing Life · Share · 鸭哥调研

近处保真、远处有损:三种长上下文方法背后的同一个直觉

YaRN、DeepSeek V4 和 DeepSeek-OCR 这三套方案来自不同团队,分别在位置编码、注意力通路和输入表示三个层面解决了长上下文的瓶颈,但底层逻辑完全一致:把最高精度留给近处或焦点,对远处信息做有损压缩。YaRN 对 RoPE 做分频处理,高频不动、低频压缩,让 Llama 2 7B 用约 384 个 A100 GPU 小时就扩展到 ...

推荐理由:文章把三个不同层面的长上下文方案统一到一个直觉下——近处保真、远处有损,而且给了训练成本和显存占用的硬数字,对做推理优化的工程师来说很实用。不是一手研究发布,正文在论证中途截断,信息完整度打了折扣,所以分数没给更高。

8月19日星期三

Hacker News 首页

粘贴一个 HuggingFace 模型 ID,就能看到它的交互式结构图,不用下载权重

modelmap.cc 这个工具把任何 HuggingFace 模型变成一张可交互的架构图。它先在 meta 设备上实例化模型拿到结构,再跑一次假的 traced 前向传播来推断张量形状,全程不下载实际权重。首页展示了 Qwen3.8-27B、DeepSeek-V4-Pro-0813、Kimi-K3 等热门模型,也放了 GPT-2、BERT、DeepS...

推荐理由:一个实用的 Show HN 工具,不下载权重就能画出模型架构图,首页还挂了 DeepSeek-V4-Pro 和 Kimi-K3。H 和 K 都踩中了,但 R 缺了点传播性——更像工具书签而不是话题引子。分数 72,刚好卡在 featured 线上。

8月18日星期二

彭博科技

DeepSeek、Qwen 和 Moonshot 让美国同行紧张,不是因为技术领先,而是便宜太多

Bloomberg 这篇趋势分析认为,中国 AI 公司真正的杀伤力不是模型能力反超,而是成本。DeepSeek、阿里 Qwen 和 Moonshot 用更高效的训练方法和硬件利用率,做到了性能差不多、价格却只要对手一个零头,逼得美国公司开始重新算经济账。文章没给出具体定价对比和最新跑分,所以“便宜多少”这点先别太激动,把它当行业风向看就好。

推荐理由:Bloomberg 这篇趋势分析把中国 AI 的威胁从“能不能追上”换成了“能不能用得起”,角度挺刁。DeepSeek、Qwen 和 Moonshot 用更高效的训练和硬件利用率,把成本压到对手一个零头,逼得美国公司开始重新算账。但文章没给具体数字,所以“便宜多少”先打个折,当行业风向看就好。

8月17日星期一

AI HOT 精选

宇树科技 8 月 19 日科创板上市,A 股迎来第一只人形机器人股票

宇树科技确定发行价 150.80 元/股,对应市值约 610 亿元,市盈率 219 倍,是行业平均的 5 倍多,估值不便宜。这次上市募资约 61 亿,近一半(20.22 亿)砸在机器人模型研发上。公司 2025 年营收 16.99 亿,净利润 2.78 亿,是全球少数能靠通用机器人赚钱的公司。不过今年一季度虽然收入同比涨了 68% 到 4.23 亿,但...

推荐理由:宇树科创板上市是个节点性事件,全球能靠通用人形机器人赚钱的公司没几家,它算一个。219倍市盈率比行业平均高出5倍多,说明市场给的情绪溢价很高,但正文没披露一季度利润变化和全年盈利指引,估值到底撑不撑得住还得看后续交付和成本控制。我会先打个折,保持82分,因为目前只有发行信息,缺上市后的实际表现验证。

纽约时报中文网

中国正用“符合主流价值观”的数据集,争夺全球AI训练语料的话语权

中国国家数据局发了份蓝图,要在2028年底前在20多个领域做出“高质量”数据集,并打算开放给全球用。上海人工智能实验室已经在GitHub和Hugging Face上发布了“万卷”这类多语种数据集,覆盖历史、法律、医学,但要求内容对齐“中国主流价值观”。分析人士说这有两个目的:一是把发展中国家拉进中国的AI生态,二是补上中文训练数据的缺口——国内数据散落...

推荐理由:这篇NYT的深度稿把中国国家数据局的AI数据蓝图讲得很清楚,有具体项目、有时间表,不是通稿。它踩中了话语权、数据开放和价值观对齐这几个敏感点,对从业者判断合规风险和数据生态走向有直接参考价值。不过它偏政策和生态叙事,不是产品发布或技术突破,所以分数卡在78分这个区间。

FT · 科技

FT 评论:中国开源 AI 会像当年制造业一样,把大模型做成白菜价

这篇《金融时报》评论文章认为,中国正在用开源大模型复制当年制造业冲击全球的剧本——把技术变成超低价的商品,削弱西方公司的定价权。文章点名了 DeepSeek 和阿里通义千问(Qwen)系列,说它们的开源策略能快速拉拢开发者、建起生态,而美国公司还在闭源、烧钱堆算力。不过正文没给出具体的市场份额或企业采用数据,所以这更像一个方向性的判断,先别急着把它当成...

推荐理由:FT 这篇评论把中国开源模型(点名 DeepSeek 和 Qwen)说成是制造业冲击的 AI 版本——靠开源把技术打成白菜价,让西方公司没法靠闭源和堆算力维持高定价。角度抓得挺巧,但全文没给具体数字,更像一个提前发出的警告。我会先打个折,把它当方向判断看,别急着当成已经发生的事实。

8月16日星期日

Hacker News 首页

一份追踪30张模型卡片的排行榜,看前沿实验室到底报告了哪些基准

这个项目扫了11家机构的30张模型卡片,统计了79个基准被提及的次数,衡量的是厂商的关注度,不是基准本身好不好。MATH-500和Arena-Hard的分数快摸到天花板了,区分力在下降。DeepSeek自家的模型在26天内,AIME涨了40.6分,LiveCodeBench涨了25.4分。有6个基准(包括BrowseComp和SWE-bench Pro...

推荐理由:这篇不是评测基准好坏,而是统计厂商关注度,视角本身就有信息量。给出了MATH-500和Arena-Hard接近饱和的具体证据,以及DeepSeek短期内大幅刷分的数字,能引发对基准有效性的讨论。扣分是因为这是个人项目,统计口径和覆盖范围有限,但作为从业者参考够用了。

8月15日星期六

AI 群聊日报

DeepSeek开源DSH智能体框架,V4 Pro发布翻车,Gemini 3.7 Flash低调上线

DeepSeek正式开源了DSH(DeepSeek Harness)智能体框架,核心理念是“一切都是插件”,连智能体的主循环都能在运行时替换。有深度分析指出,这是它相比Codex等声明式框架唯一的结构性优势,相当于为了“让智能体自我进化”这盘醋包了一整盘饺子。不过,群友对通用框架的未来吵翻了天,有人觉得自然语言就是新编程语言,通用框架注定要死;也有人认...

推荐理由:DeepSeek 正式开源 DSH,结构上跟 Codex 拉开差异,还带了实测数字,当天就有社区跟进,HKR 三项都踩中了。分数卡在 78,因为消息源是群聊日报,不是官方公告,信息细节还得等一手确认。

Computing Life · Share · 鸭哥调研

给 DeepSeek V4 接一个 3B 的视觉前端,今天就能跑

DeepSeek V4 的 API 不收图片,但 Liquid AI 新出的 LFM2.5-VL-3B 可以当它的眼睛。作者在自家车库摄像头上零样本测了一把,判断门开没开准确率 94.3%,本地跑完只要 1.5 秒。图片不出设备,只有“门开了”这类文字结果上云做推理。这套感知和推理分开的架构,在延迟、隐私和成本上的优势,就算 DeepSeek 以后自己...

推荐理由:作者用 Liquid 的 LFM2.5-VL-3B 给 DeepSeek V4 搭了一个感知前端,在真实车库摄像头上测出 94.3% 准确率和 1.5 秒延迟,数据具体、架构清晰。文章还顺带梳理了 DeepSeek 在视觉上的研究脉络(VL2、被撤回的 Thinking with Vision 等),把“为什么现在需要外挂眼睛”这件事讲透了。我会先打个折:测试场景只有一个车库门,泛化到什么程度正文没展开,这点先别太激动。但整体上,这套感知和推理分离的做法在成本、隐私和延迟上的优势是实打实的,对正在找 DeepSeek 视觉替代方案的开发者来说,是一...

Computing Life · Share · 鸭哥调研

同一个模型差 20 分:DeepSeek 的 harness 依赖性和合成数据的隐藏天花板

DeepSeek V4 Flash 在自家极简测试环境里能拿 82.7 分,换到第三方脚手架直接掉到 46.7% 通过率,同一个模型差了 20 个百分点。Stanford 和 UC Berkeley 等团队 8 月 12 日的论文解释了原因:用单个大模型当用户模拟器训练 Agent,模型会专门钻模拟器回应模式的空子,策略多样性从 1.9 nats 暴跌...

推荐理由:我会先打个折,这篇不是模型发布或产品上线,是评测方法论和合成数据陷阱的扒皮文,所以重要性压在 78 不过 85。但三个轴都踩实了:20 分的落差够猎奇,官方脚注到第三方复现的证据链够硬,agent 开发者看完会想立刻检查自己的评测管线,转发和讨论动力强。正文没披露 DeepSeek 对这篇论文的官方回应,这点先别太激动。

8月14日星期五

Hacker News 首页

DeepSeek V4 Pro 正式上线,API 开始分高峰和低谷时段计价

DeepSeek 把 V4 Pro 模型从预览版转成了正式版。这次更新主要强化了让模型进业务流程干活的能力,并且给 V4 Pro 和 V4 Flash 都加了一个“思考力度”调节开关:简单任务用低档,日常自动化任务用高档,复杂任务可以拉满。模型现在也原生支持 OpenAI 的 Responses API,能一键接入 Codex。API 价格从 8 月 ...

推荐理由:V4 Pro 转正、加 agent 加固和思考力度调节,是实打实的功能更新,对在 DeepSeek 上搭自动化的开发者有意义。没给到 85 分以上,是因为正文没披露 GA 后的基准对比,也没说清楚峰谷价差到底是多少——信息密度差了口气,所以我会先打个折。

AI HOT 精选

DeepSeek V4 Pro 上线硅基流动,支持 100 万 token 上下文,给了三档推理强度可选

硅基流动现在可以直接用 DeepSeek V4 Pro 了,首发当天就接入了。模型上下文窗口拉到 100 万 token,差不多能一次吞下三本《三体》的量。它把推理强度分成低、高、最大三档,你可以按任务复杂度自己选,主要面向写代码、调工具和让模型进业务流程干活的场景。模型还是 MIT 协议开源的。价格方面,输入每百万 token 1.32 美元,输出 ...

推荐理由:DeepSeek V4 Pro 首发当天硅基流动就接入了,100 万 token 上下文、三档推理强度、MIT 开源、输入每百万 token 1.32 美元,信息密度够高。没给 85 分以上是因为这只是平台上线公告,还没有实测跑分或用户反馈,先别太激动。

FT · 科技

OpenAI 和 Anthropic 被中国对手逼着打价格战

FT 报道,OpenAI 和 Anthropic 正在大幅降价抢企业客户,压力来自 DeepSeek 这类成本更低的中国模型。两家公司都在推更便宜的小模型,同时靠高价订阅和 IPO 预期撑估值。文章没给出具体降了多少、什么时候生效,更像一篇趋势分析。

推荐理由:FT 这篇是趋势分析,不是硬消息稿。它点出了 OpenAI 和 Anthropic 被中国低价模型逼着降价的大背景,但正文没披露具体降了多少、什么时候开始,信息密度不够硬。我会先打个折:格局判断有参考价值,但缺可执行的数据,所以 H 和 R 都成立,K 不成立,刚好够 featured 门槛。

8月13日星期四

Computing Life · Share · 鸭哥调研

编程 Agent 换形态,抢的都是同一件东西:执行数据

DeepSeek 开始招 Agent Harness 产品经理,说明它正在补一个空位:没有自己的编程工具运行环境。之前它只卖模型接口,把工具端交给第三方,但这样拿不到用户在真实编程场景里的行为数据——模型输出了代码,但用户怎么改、哪里报错、改了几轮才跑通,这些细节都留在第三方工具里。LangChain 的测试显示,同一个模型有没有针对性的运行环境配置,...

推荐理由:一篇用招聘动作和测试数据把产业逻辑讲清楚的分析。DeepSeek 招 Agent Harness 产品经理这件事本身不大,但作者把它和 LangChain 的 10-20 个百分点性能差距、Codex 做桌面端串起来,点出模型厂抢的不是工具市场,是用户改代码、修 bug 的行为数据。判断都挂在事实和数据上,没有吹概念,对从业者来说信息密度够、可读性强。按政策,观点分析类文章打 78-84 分段的低区,78 分合理。

Computing Life · Share · 鸭哥调研

DeepSeek 开源 DSH:把 agent 的控制循环做成了可热插拔的插件,为 AI 自进化铺路

DeepSeek 在 8 月 13 日开源了它的第一个 agent harness,叫 DSH。它跟 Codex、Claude Code 这些现有工具最大的不同,是把 agent 的核心控制循环(agent loop)本身做成了一个可以在运行中随时替换的插件。这意味着,AI 在干活时不仅能调用新工具,理论上还能给自己换一套全新的思考或协作流程。为了支撑...

推荐理由:DSH 把 agent 的控制循环做成了运行时可替换的插件,这确实是个架构层面的新想法,不是营销话术。但这篇文章是第三方分析,不是官方发布,DSH 目前也没有任何生产环境的验证记录,所以按规则先打个折,归到较低一档。

Hacker News 首页

DeepSeek V4 Pro 0813 上架 OpenRouter,输入每百万 token 0.435 美元

DeepSeek 把 V4 Pro 的正式版(GA)挂上了 OpenRouter。这是个超大规模的混合专家模型,上下文窗口能塞进 100 万 token,差不多是一整套三体三部曲的量。价格定在输入 $0.435/1M、输出 $0.87/1M,在目前的大模型里算便宜的那档。不过现在只有一个供应商在跑,OpenRouter 收到请求直接转发,没得选路。页面...

推荐理由:DeepSeek V4 Pro 正式版悄悄上了 OpenRouter,100 万 token 上下文和 $0.435/1M 输入价是这次能确认的新信息,对从业者有直接参考价值。没给到 85 分是因为信息源只有 OpenRouter 页面,缺少官方公告和独立评测,验证链条还差一环,所以稍微压了一点分。

8月9日星期日

Hacker News 首页

DeepSeek-V4 把“思考”藏进潜空间,打包成一个能直接部署的完整模型

Nicholai Mitchko 把之前那个需要外挂的 CoLaR 潜空间推理头,做成了一个开箱即用的完整模型。模型本体是 DeepSeek-V4-Flash-0731,用 NVFP4 量化后,两张 GPU 就能跑起来。那个负责“思考”的推理头只有 3570 万参数,现在和模型权重打包在一起了。在 BBH 基准测试里,它零样本总得分 0.94,多步骤状...

推荐理由:把CoLaR的潜空间推理从外挂改成内置,工程上有价值,BBH零样本0.94分也拿得出手。但这篇是个人研究博客,没有其他信源交叉验证,受众也窄,所以刚好卡在featured门槛上。

8月8日星期六

Hacker News 首页

DeepSeek V4 Flash 0731 在 ARC-AGI-2 上跑出 61.4%,单任务成本 0.04 美元

DeepSeek 把 V4 Flash 0731 提交到了 ARC Prize 的官方排行榜,用了三种推理强度来跑分。最猛的那一档在 ARC-AGI-1 半私有集上拿了 89.0%,单任务成本 0.02 美元;在更难的 ARC-AGI-2 上拿了 61.4%,成本翻倍到 0.04 美元。推理强度一降,分数掉得很明显,低强度版本在 ARC-AGI-2 上...

推荐理由:DeepSeek 把 V4 Flash 0731 提交到 ARC Prize 排行榜,用三档推理预算跑分,高预算在 ARC-AGI-2 上拿到 61.4%,是目前公开最高分,单任务成本 0.04 美元。文章给了具体数字和成本对比,信息密度高。没给更高分是因为这还只是排行榜提交,没有论文或技术细节,验证强度有限。

Dwarkesh Patel 播客

持续学习时代:AI 不再训完就上线,而是边用边学

Dwarkesh Patel 认为,一旦模型能在部署后持续更新权重,整个 AI 格局就会变。他打了个比方:就像学萨克斯,光靠看前人的笔记永远学不会,模型也不能只靠会话间传小纸条来真正干活。这会直接冲击现在的监管思路——不能再指望上线前做一次安全检查就万事大吉,按月或按季度做风险巡检才更合理。对齐研究也得转向,从盯着冻结的权重,变成防止模型在持续更新中被...

推荐理由:Dwarkesh 在 AI 播客圈本身可信度就高,这篇是他自己的预测文章,不是访谈转述,观点浓度够。如果持续学习真的落地,确实会动摇现在的安全框架,K 和 R 都站得住。我会先打个折:持续学习还没成现实,但推演逻辑是通的,所以重要性给 78 不算虚高。

8月6日星期四

AI HOT 精选

宇树科技科创板 IPO 定价 150.8 元/股,市盈率是行业平均的近 6 倍

宇树科技把发行价定在 150.8 元/股,对应市值约 610 亿元。这个价格对应的市盈率是 219.23 倍,而行业平均只有 38.56 倍,贵了将近 6 倍。公司 2025 年营收 16.99 亿元,净利润 2.78 亿元,是全球少数能靠通用机器人赚钱的公司。战略配售名单里有社保基金和 DeepSeek。网上申购 8 月 10 日开始,12 日缴款。...

推荐理由:宇树科创板上市定价 150.8 元/股,市盈率 219 倍,比行业平均 38.56 倍贵了快 6 倍,这个溢价本身就够扎眼。但公司 2025 年有 16.99 亿营收和 2.78 亿净利润,是少数真靠通用机器人挣到钱的,不是纯烧钱讲故事。战略配售名单里除了社保基金,还出现了 DeepSeek,这个组合不常见,给定价争议加了点想象空间。我会先打个折:正文没披露 DeepSeek 具体认购金额和合作细节,这点先别太激动。整体看,这条消息既有硬数据又有话题性,对关注机器人商业化和国内科技 IPO 的人值得一读。

纽约时报中文网

非洲开发者用脚投票,中国开源模型靠便宜和能定制抢走硅谷客户

乌干达开发者用阿里巴巴的模型做了个叫Sunflower的多语言种田工具,处理本地话比Meta和谷歌的产品都好,还更省钱。在OpenRouter上,中国开源模型的使用量已经占到一半,一年前还不到四分之一;Hugging Face下载量前25的模型里有19个是中国货。肯尼亚、尼日利亚、加纳的开发者也在拿它们做法律、教育和聊天机器人应用。主要吸引力就三点:免...

推荐理由:纽约时报实地采访,有具体开发者和硬数据,不是观点评论。非洲开发者用阿里模型做多语言农耕工具,处理本地话比 Meta 和谷歌产品好,成本还低,这个信号比多数行业叙事超前。OpenRouter 和 Hugging Face 的用量数字让趋势可量化。扣分是因为文章没展开讲这些模型在非洲部署的具体延迟、硬件限制和长期维护成本,但作为趋势信号已经足够清晰。

8月4日星期二

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

8月1日星期六

AI 群聊日报

DeepSeek V4 Flash 深夜上线,agent 跑分逼近 Opus 4.8,成本不到一半

DeepSeek 在深夜悄悄把 V4 Flash 的 API 接口原地升级了。Terminal Bench 2.1 分数从预览版的 61.8 直接拉到 82.7,超过了 GLM-5.2 的 81.0,离 Opus 4.8 的 85.0 很近了。第三方横评里,它中位分 58.80,单题测试成本 4.19 元,不到 GPT-5.6 Luna xhigh 的...

推荐理由:DeepSeek V4 Flash 正式版半夜原地升级,Agent 跑分逼近 Opus 4.8 但成本只有几分之一,是实打实的国产旗舰模型更新,触发正面信号加分。群聊日报给出了具体的 benchmark 数字和第三方横评成本对比,信息量够硬。我会先打个折——正文没提推理延迟和实际业务场景的稳定性验证,这点先别太激动,但就凭「接口不变、性能白送、价格屠夫」这三板斧,放在 featured 档没问题。

Latent Space

DeepSeek V4-Flash 0731 发布:不改模型结构,纯靠训练后优化,把智能体能力拉到接近 GPT-5.6,成本还低了六成

DeepSeek 放出了 V4-Flash 0731 版本,模型大小和结构没变,还是 284B 总参数、13B 活跃参数、100 万上下文窗口。这次更新全靠训练后优化,没有动预训练。最直观的变化是 Terminal-Bench 分数从 56.9 跳到 82.7,其他智能体相关的跑分也全面上涨。API 定价是输入每百万 token 0.14 美元、输出 ...

推荐理由:这条消息的核心看点很集中:DeepSeek V4-Flash 0731 没动预训练、没改结构,纯靠后训练把 Terminal-Bench 拉高 25.8 分,其他智能体跑分也全面上涨。对从业者来说,这说明后训练在提升模型实际干活能力上的空间比很多人想的大。定价和开源权重让它在 GPT-5.6 降价后依然有竞争力。不过原文是付费 newsletter 的汇总,不是一手发布公告,标题自己也说'今天没啥大事',所以分数没给到 85 以上。

Computing Life · Share · 鸭哥调研

DeepSeek V4 Flash 0731:用轻量级价格买到中端性能,但落地干活还有三个坑

DeepSeek 在 7 月 31 日更新了 V4 Flash API,模型结构没变(284B 总参数,每次只激活 13B),只是重新做了一遍后训练。独立评测显示它的综合能力得分 50 分,比预览版涨了 10 分,和 Gemini 3.6 Flash、GPT-5.6 Luna 这些轻量级模型差不多。价格确实便宜:没命中缓存时输入每百万 token 0....

推荐理由:DeepSeek V4 Flash 更新是本周热点,但“斩杀线”说法太简化了。这篇用独立评测和 Agent 真实开销把讨论拉回事实层面,有数据支撑的判断比纯 hype 有用。没给更高分是因为它本质是评论而非一手爆料,但对从业者做决策很实在。

Computing Life · Share · 鸭哥调研

一张草稿纸,一个 Controller:重新理解大模型推理

推理模型并没有长出会思考的新大脑。Chain of Thought 先给 Transformer 一张只能往后写、不能往回擦的草稿纸,把原本挤在单次前向传播里的隐层心算,平摊到几十上百个自回归时间步上;后训练再练出一个 Controller,决定什么时候在草稿纸上检查、回退、换路或停笔。s1 的 Wait 实验和 pass@k 衰减测试都指向同一个结论...

推荐理由:这篇文章不是新论文或产品发布,而是一篇机制解读,但解读质量很高。它用草稿纸和控制器两个比喻把 Chain of Thought 和后训练的分工讲清楚了,还挂了 s1 的实验数据,不是空对空。H 轴靠比喻和机制拆解拿满,K 轴有具体实验支撑,R 轴因为好懂且有料,转发动力强。整体是评论向的优质内容,不是一手发布,所以分数落在 78 这个区间,不往上拔。

AI HOT 精选

DeepSeek V4 Flash 0731 开源,MIT 协议,284B 总参数量,开源模型里排进前三

DeepSeek 把 V4 Flash 0731 开源了,MIT 协议,可以随便用。模型总参数 2840 亿,但每次推理只激活 130 亿,跑起来大概需要 167GB 显存(FP4/FP8 混合精度)。在 Artificial Analysis 的智能指数上拿了 50 分,开源模型里排前三。架构和定价跟之前的 V4 Flash 一样,官方 API 已经...

推荐理由:DeepSeek 把一个旗舰级模型用 MIT 协议开源,直接挂到开源榜前三。2840 亿/130 亿的稀疏架构给出了一个具体的效率数字,不是宣传稿。国内模型发布按政策给同等权重,开源带来的生态扩散也值得关注。

Hacker News 首页

Manifest 下线了自己的模型路由器,认为省下的钱会在别处花掉

Manifest 今年三月上线了一个模型路由器,把请求按复杂度分成四档,想用便宜模型处理简单任务来省钱。跑了四个月、服务了七千个云用户后,他们在六月把它标记为弃用,九月一日彻底关停。核心问题有三个:第一,光看提示词根本判断不了真实复杂度——比如“评估 $GIT_REPO 的测试并改进”,对静态个人网站很简单,对 Linux 内核就是地狱难度。第二,缓存...

推荐理由:Manifest 这篇四个月的生产复盘,把模型路由器为什么失败讲得很具体,有场景、有数字、有自我打脸,不是泛泛而谈。扣分点在于这只是单家公司的经验,没有对照实验,而且文章正文被截断,完整论证看不到。我会先打个折,但整体信息密度和诚实度都够,值得推给正在纠结路由方案的从业者。