跳到正文

Microsoft / Copilot

微软的 AI 布局:Copilot 全家桶、Azure AI 基础设施与 OpenAI 合作关系的持续追踪。

198 条精选相关主题OpenAI / ChatGPTAI 编码产品更新

最新精选

第 101–120 条 · 共 198 条

6月4日星期四

Latent Space

微软 CEO 纳德拉对谈:把 AI 做成生态,别只盯着一两个模型

纳德拉在 Build 大会的播客里聊了微软的 AI 思路,核心是把 AI 当成一个生态平台来做,而不是押注单个模型。他举了比尔·盖茨那条老原则:平台创造的价值得远超平台自己赚走的。微软这次主推的 MAI 系列模型,强调从预训练阶段就保证数据干净、可追溯,因为现在很多开源模型在榜单上看着漂亮,实际用起来不行。有意思的是他们拿一个 50 亿参数的小模型做“...

推荐理由:HKR 三项都踩中了:Satya 本人就是流量钩子,文章给出了微软企业级多模型平台的具体组件名,还透露了 5B 小模型用 traces 做 hill climbing 的机制,对从业者判断技术路线有参考价值。不过它终究是 Build 大会的访谈,不是独立模型发布,所以 78 分合理。

6月3日星期三

AI HOT 精选

微软和 OpenAI 正式分手,现在准备正面开打

微软 AI 负责人 Mustafa Suleyman 在 Build 大会上放话,说微软必须从零开始证明自己能独立搞定所有事。两家公司从合作转向直接竞争,但文章没透露具体产品路线图和时间表。Suleyman 还提到,微软正在把 AI 智能体(让模型进业务流程干活的工具)作为重点方向,不过目前没有给出任何性能数据或客户案例来支撑这个说法。

推荐理由:H 和 R 都站得住:微软和 OpenAI 翻脸会影响整个 agent 平台的格局,从业者肯定盯着。K 偏弱,因为正文除了 Suleyman 一句“必须从头证明自己能独立搞定”之外,没给出任何可落地的信息,所以整体卡在 featured 门槛上。

AI HOT 精选

微软 Build 2026:生图超谷歌,推理还在追

微软在 Build 2026 一口气发了七个自研模型,头一回做推理模型 MAI-Thinking-1。这是个万亿参数、每次激活 350 亿的大家伙,上下文窗口 12.8 万 token,专啃多步指令和代码。内部盲测说比 Anthropic 的 Sonnet 4.6 更受偏爱,但看公开跑分,大概跟 DeepSeek V3.2 打个平手。微软强调模型是从干...

推荐理由:微软在 Build 2026 上发了 7 个自研模型,图像生成直接对标 Google 并声称超越,推理模型则明确说还在追赶。同时公布了一种新调优方法和一个后台自主智能体。正文没披露具体模型名称、基准分数和开放时间,所以信息有冲击力但缺验证细节,重要性给到 84 是合适的,先别急着当定论。

AI 群聊日报

微软发布自研推理模型MAI-Thinking-1,35B参数在编程和数学上追平Opus 4.6

微软首个正式对外发布的自研推理模型MAI-Thinking-1,用了35B活跃参数、总参数约1T的稀疏MoE架构。SWE-Bench Pro编程测试跟Claude Opus 4.6打平,AIME 2025数学测试拿到97%,盲测里人类偏好优于Sonnet 4.6。训练全程没用任何第三方模型蒸馏,预训练数据也排除了AI生成内容。不过群友对微软年底拿第一的...

推荐理由:这条消息的钩子很清晰:微软的 MAI-Thinking-1 在代码基准上追平了 Opus 4.6,而且给出了具体的参数规模和数学测试得分。我会先打个折——来源是群聊日报,不是官方公告,正文没披露模型是否开源、API 定价和完整评测设置,所以权威性偏弱。但 H/K/R 三个维度都踩中了:有竞争对标、有硬数字、有平台格局的冲击力。综合来看,值得作为 featured 推给从业者看一眼,但别急着把它当正式发布。

Latent Space

微软一口气发了7个新模型,MAI-Thinking-1是主打,还附了109页技术报告

微软在Build大会上发布了7个MAI系列模型,覆盖文本推理、代码、图像、语音转文字和语音合成。主角是MAI-Thinking-1,一个35B活跃参数的混合专家模型,支持256K上下文窗口。它被定位为微软首个推理模型,训练数据链条干净,没有用任何第三方模型做蒸馏。随模型一起公开的109页技术报告在圈内评价很高,因为透明度给得足。报告里写明,模型的推理能...

推荐理由:我会先打个折:微软这次没公开模型权重、定价,也没给第三方评测结果,所以没法验证它实际有多强。但光凭 7 个模型、35B 激活参数的 MoE、256K 上下文和 109 页技术报告这几个硬数字,信息密度已经够高。加上这事发生在 Build 大会,直接摆在微软自家模型和 OpenAI 依赖的交叉点上,话题性拉满。正文没披露具体 benchmark 分数,这点先别太激动,但作为当天新闻,重要性给到 87 是合理的。

r/LocalLLaMA

微软在 Build 2026 发了两个端侧模型 Aion 1.0:一个管推理和调工具,一个管总结改写

微软在 Build 2026 大会上发了两个能在设备本地跑的模型,都叫 Aion 1.0。一个是 Aion 1.0 Plan,140 亿参数,专门做推理和调用工具,上下文窗口 3.2 万 token,会直接预装在配置够的 Windows 设备里。另一个是 Aion 1.0 Instruct,定位是总结、改写、理解意图、无障碍功能,会集成进 Edge 浏...

推荐理由:微软在 Build 2026 发了 Aion 1.0 Instruct 和 Plan 两个端侧模型,其中 Plan 是 14B 参数、32K 上下文的规划模型,会直接跟着 Windows 推给符合条件的设备。我会先打个折:文章没提许可证、跑分、具体硬件门槛,所以实际落地效果还得观望。但 Windows 内置这件事本身,分发优势和生态卡位就很明显,对做端侧 AI 和 agent 的人来说值得盯一下。

AI HOT 精选

智能性价比

微软在模型发布卡里加了个新指标:平均 token 用量。他们的新模型在 SWE-Bench Verified 上拿了 71.6 分,但消耗的 token 只有 Claude Haiku 4.5 的三分之一。这意味着现在衡量模型得看两个维度:活儿干得怎么样,以及干这活儿花了多少钱。靠烧 token 刷榜、靠补贴打价格战的时代在翻篇。Uber 四个月烧光预...

推荐理由:H、K、R 三条都站得住。用“跑分除以 token 消耗”当钩子,比单纯报分数更让人想点进去看。71.6 分和三分之一的 token 量是实打实的新信息。不过文章没给出完整的测试配置和具体定价对比,所以重要性停在 78 分,我会先打个折,不往更高拉了。

AI HOT 精选

特朗普签行政令:AI 模型上线前可自愿交给政府做安全检查

特朗普政府推出一项自愿机制,AI 公司可以在前沿大模型发布前 30 天内,把模型提交给美国商务部下属的 CAISI 中心做安全评估,主要查模型的网络攻防能力。谷歌、微软和 xAI 已经同意配合,OpenAI 和 Anthropic 早在 2024 年就签了类似协议。这次行政令明确不是强制审批,企业自己决定交不交,交了能拿到保密保护。政策转向的直接导火索...

推荐理由:特朗普用行政令搭了个自愿通道,前沿模型上线前可以交给联邦政府做安全评估,谷歌、微软和 xAI 已经点头让 CAISI 来查。机制是自愿的,不是强制审批,所以重要性在政策类里算必须写,但还没到震动行业的程度。正文没披露评估具体查哪些项、不交有没有后果,这点先别太激动。

AI HOT 精选

微软放出 MAI-Thinking-1,35B 活跃参数的 MoE 模型,没靠蒸馏自己从头训

微软发了 MAI-Thinking-1,一个混合专家(MoE)模型,总参数 1 万亿但每次只激活 350 亿,跑起来相对省算力。它用 30T token 从零预训练,没拿第三方模型做蒸馏,这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”,听着像在反复试错往上拱。成绩单上,AIME 2025 拿了 97.0%,LiveCodeBench v6 拿了 ...

推荐理由:微软发了 MAI-Thinking-1,一个 MoE 架构的推理模型,活跃参数 35B,总参数 1T,用 30T tokens 从零开始预训练。我会先打个折:正文没给任何跑分、开放方式或定价,所以没法判断实际水平。光看参数规模,35B 活跃部分在推理时成本不会太高,但 1T 总参数意味着训练和存储都不便宜。这点先别太激动,等有 benchmark 和访问方式再说。

TechCrunch · AI

微软开源新工具,用文字描述就能给 AI 模型出考卷

微软发布了一个叫 ASSERT 的开源框架,让开发者直接用自然语言写测试要求,就能自动生成一套评估 AI 行为的考题和回归测试。正文没披露它具体支持哪些模型、打分指标怎么算,也没提使用限制。

推荐理由:我会先打个折:正文没披露这个框架支持哪些模型、具体用什么指标、以及跑起来的硬件或环境要求,所以实际能省多少事还不好说。但方向本身挺对——让开发者用自然语言写测试意图,而不是手搓脚本,确实能降低回归测试的门槛。微软把它开源出来,至少说明不是内部玩具。这点先别太激动,等看到跑分和兼容性再判断值不值得集成。

NVIDIA 博客

英伟达和微软搞了一套统一方案,让 AI 能在 Windows 电脑、云端和本地服务器之间来回跑

微软 Build 大会上,两家宣布把 AI 部署的底层打通了。简单说,就是同一个 AI 应用,既能在你笔记本的 RTX 显卡上跑,也能无缝切到 Azure 云或者公司本地的 DGX 工作站上,不用重写代码。现场还亮了两款新硬件:RTX Spark 是个小盒子,能提供 1 petaflop 的 AI 算力(大概相当于每秒一千万亿次计算);DGX Stat...

推荐理由:HKR 三项都过了。NVIDIA 和微软这次合作,把 agent 部署从 Windows 到 Azure 再到本地串成一条线,还亮出了 1 petaflop 和 20 petaflops FP4 两个硬件规格,对从业者来说有信息增量。不过消息源是厂商自己,正文没给定价、跑分和迁移细节,所以分数没往上拉。

Hacker News 首页

微软 MAI-Code-1-Flash 用 50 亿活跃参数在 SWE-Bench Pro 上拿到 51% 的分数

微软新放出的 MAI-Code-1-Flash 是个代码模型,只激活 50 亿参数就在 SWE-Bench Pro(一个让模型修真实 GitHub 问题的测试集)上跑出 51% 的分数。这个成绩放在小模型里算亮眼,但正文没披露它是在什么评测设定下跑的、用了哪些训练数据、什么时候发布,也没说部署条件。所以这个 51% 我先打个折看——不知道是不是挑过题、...

推荐理由:HKR 三条都过,靠的是微软这个 5B 活跃参数拿 51% SWE-Bench Pro 的说法。但正文没披露评测设置、训练数据和发布时间,信息缺口明显,分数只能压在 72–77 这个区间。

Hacker News 首页

微软发布 MAI-Thinking-1,一个主打复杂推理的中等成本模型

微软一口气发了七款 MAI 系列模型,这篇公告只重点介绍了 MAI-Thinking-1。官方说它擅长解决复杂问题,在 SWE-Bench Pro(一个测代码修改能力的榜单)上拿了高分,价格定在“中等权重”档位。但正文没披露参数量、具体跑分、定价细节和上线时间,所以实际性价比和落地表现还得等更多信息。

推荐理由:HKR 三条都踩中了:微软给模型起名 Thinking,又放出 7 个 MAI 模型,正好打在它和 OpenAI 若即若离的关系上,话题性够。但正文只说了发布,没参数、没评测、没时间表,信息密度很低,所以分数卡在 76 这个 featured 门槛上,没往上拉。

AI HOT 精选

微软发布自研推理模型 MAI-Thinking-1,中等规模,没从第三方模型蒸馏

微软在 Build 2026 上掏出了自己的第一款高级推理模型 MAI-Thinking-1。官方说这是个中等尺寸的模型,在一些软件工程基准上能跟一线模型打平。训练数据完全自建,没走知识蒸馏的捷径——也就是没拿别家大模型当老师来教它。这是微软在模型自研上的一次表态,之前它主要靠 OpenAI,最近两家刚重新谈了合作,关系没那么紧了。

推荐理由:微软在 Build 2026 发了 MAI-Thinking-1,说是中等规模推理模型,在软件工程基准上能打平领先模型。我会先打个折——正文没披露具体分数、访问方式和定价,所以没法判断它到底多强、多便宜。这点先别太激动。但这是微软第一个自研高级推理模型,信号很明显:它在试着减少对 OpenAI 的依赖,同时往开发者工具链里塞自己的货。

TechCrunch · AI

微软给开发者发了份说明书,让 AI 代理的行为能按规矩来

微软发布了一份 AI 代理的行为规范说明书,让开发、合规和安全团队能把想让代理遵守的规则,写进可移植的策略文件里。正文没提版本号、开源协议、支持哪些开发框架,也没说什么时候正式上线。

推荐理由:我会先打个折:正文没披露版本号、开源协议和具体支持的框架,所以没法判断落地有多顺滑。但“可移植策略文件”这个机制本身是实在的,它让开发、合规、安全三拨人能用同一份文件定规矩,不用各说各话。对正在搭 Agent 的团队来说,规则能不能跨栈迁移是个真需求,这点先别太激动,但值得放进 featured 里提醒大家关注。

AI HOT 精选

微软推出 Scout 个人助手,基于 OpenClaw,能常驻在 Outlook 和 Teams 里干活

微软发了 Microsoft Scout,一个能一直挂在 Outlook、OneDrive、Teams 里的 AI 助手。企业可以把它分给员工,让它帮忙管日历、处理报销、起草邮件。微软副总裁 Omar Shahine 说这是他们第一次给客户一个真正的个人助手,功能比应用内嵌的 Copilot 更宽。不过正文没提 OpenClaw 具体是什么、怎么跟现有...

推荐理由:这篇就是微软 workplace agent 的产品更新,给了集成范围和任务类型,但没给定价、上线时间,也没技术细节。信息量够上 featured 低段,但别指望从这篇看出落地节奏。

The Verge · AI

微软在 Build 2026 上发了 Project Solara,一个给 AI 硬件跑智能体的安卓系统

微软在 Build 2026 大会上公布了 Project Solara,一个专门为跑 AI 智能体的硬件设计的操作系统。它底层是安卓,不是 Windows。现场展示了两个概念机:一个是类似 Echo Show 的桌面设备,用人脸识别解锁后可以直接调用各种 AI 智能体;另一个是可穿戴工牌,带摄像头和指纹扫描,能唤醒 AI 智能体。正文没披露具体上市时...

推荐理由:我会先打个折:正文没给发货时间、开发者接口和定价,所以别当产品发布看。亮点是微软在 Build 2026 上拿出的 Project Solara,一个跑在 Android 上的 AI 硬件系统,不是 Windows。现场有两台概念机,一台放桌上的带人脸识别,一台可佩戴的徽章带摄像头和指纹,说明微软在试探 agent 硬件长什么样。系统层面用 Android 意味着生态借力,但也绕开了自家系统,这点挺有意思。隐私那块正文没展开,只提了人脸和指纹,具体怎么处理数据没说。

Latent Space

GitHub COO 聊怎么让平台接住 AI 代理的代码洪流

GitHub COO Kyle Daigle 说,2026 年 AI 驱动的代码提交量涨了 14 倍,这给原本按人类节奏设计的 GitHub 基础设施带来了很大压力,公开的宕机问题也跟这有关。他聊了 Copilot 的演变:从代码补全到命令行工具、桌面应用、云端代理和 SDK,以及 WorkIQ、MCP 这些让模型接入 Slack、邮件等公司上下文的方...

推荐理由:HKR 三项都成立:GitHub 高管给出 14 倍 AI 代码提交这个具体数字,把 Copilot、Actions、MCP、WorkIQ 和云端 agent 串成一条线来讲,信息量够。不是重大产品发布,所以重要性停在 80 分。

6月2日星期二

量子位 · 公众号

老黄带着英伟达 CPU 杀进 PC 赛道

英伟达要在今年秋天把一台叫 RTX Spark 的 Windows 电脑推向市场。这台机器把一块 Blackwell 架构的 RTX 显卡和一颗 20 核 Arm 架构的 Grace CPU 焊在一起,通过 NVLink-C2C 高速互联,共享 128GB 统一内存。官方给出的 AI 算力是 1 petaflop,号称能在本地跑起 1200 亿参数、上...

推荐理由:英伟达把RTX Spark搬进Windows PC,不是发新模型,而是给开发者一台能本地跑120B模型的机器。1 petaflop算力和128GB统一内存这些数字,说明它想解决本地跑大模型内存不够、上下文装不下的痛点。对从业者来说,这意味着可以省掉一部分云端推理成本,延迟也更可控。不过正文没提具体功耗和价格,实际性价比还得等上市再看。整体是硬件产品更新,不是基础模型发布,所以分数落在78到84之间。

Latent Space

英伟达连发三弹:Cosmos 3 世界模型、Nemotron 3 Ultra 大模型,还有一台叫 Spark 的个人超算

英伟达在台北电脑展上放出了一波开源模型和硬件。Cosmos 3 是一个能同时处理文字、图片、视频、音频和动作的“世界模型”,用了混合 Transformer 架构,把负责推理和负责生成的两个模块拼在一起。它分 Nano(16B)和 Super(64B)两个尺寸,其中 Super 微调后的文生图和图生视频能力,在开放权重模型里直接冲到了第一。Nemotr...

推荐理由:这次发布把视觉世界模型、大语言模型和本地推理硬件捆在一起推,信息密度高。Cosmos 3 的 MoT 架构和两个具体尺寸(16B/64B)给了明确的技术锚点,Nemotron 3 Ultra 的 550B-A55B 开放权重对想自己部署大模型的人是个实在消息。不过正文没给出具体 benchmark 对比或价格,实际效果和性价比还得等上手。整体影响面广,但还没到前沿实验室发新基础模型那种震动级别。