TurboGPT:用 CUDA C++ 在 13 秒内训练 22KiB Transformer
TurboGPT 是一个用 CUDA C++ 实现的字节级微型 GPT 训练项目,采用 MIT 协议,可在 13 秒内训练 22KiB 的 Transformer。
TurboGPT 是一个用 CUDA C++ 实现的字节级微型 GPT 训练项目,采用 MIT 协议,可在 13 秒内训练 22KiB 的 Transformer。
PostHog 在 GitHub 开源 Jeeves 项目,通过推理能力改进 Jev 类决策模型。仓库包含 drafter、inference、loader、model、prep、sdk 等模块,并附有 calibrate.py、checkpoint.py 等脚本,采用 master 单分支,已获 49 星、7 次 fork。
Jeff 是一组从 Qwen3.5 和 Gemma 4 微调出来的 0.8B 参数小模型,专门做零样本分类——也就是不给例子直接判断类别。亮点是作者说在家用普通显卡上就能训练,推理一次只要 30 毫秒左右,延迟很低,适合塞进实时决策流程。模型兼容 Jev 格式,GitHub 上放了代码和权重。不过正文没披露用了多大训练集、在什么基准上测过,所以实际效果...
GitHub 的安全团队拿安卓开源项目(AOSP)跑了一遍他们开源的 AI 安全 Agent,自动扫出 24 个漏洞,还顺手把补丁交了。这个 Agent 相当于一个能自己看代码、找问题、写修复方案的自动化工具,把以前靠人肉审计的活变成了机器自主跑流程。不过正文没提具体是哪些类型的漏洞,也没说误报率有多高、底层用的是哪个模型。工具代码已经开源,想试的可以...
LightCloud 是一个新的云控制台,把项目、数据库、容器都组织成文件系统树,左边目录右边操作,像在本地 IDE 里管理文件一样。静态站点自动走全球 CDN,容器空闲时缩到零实例(不跑就不计费),Postgres 数据库可以在同一个项目里直接创建,凭证自动加密并注入到应用。每个分支和 PR 都会生成一个独立的预览链接,推送即构建。它还接入了 Cla...
一个GitHub项目火了:在没GPU的笔记本上跑700亿参数的GLM模型。办法是把SSD当显存用,用存储换速度。正文没披露具体延迟和精度损失,但思路很直接——内存不够硬盘凑。对没显卡的开发者来说,是个低成本试大模型的办法。
GitHub 发了一篇面向新手的 Copilot 教程,教你怎么用“画布”(canvases)搭自定义工作流。注意,这不是新功能发布,只是操作指南,没提任何技术参数或模型更新。对刚接触 Copilot 的开发者有用,但如果你想知道底层模型有没有升级、性能有没有提升,这篇正文里没有。
GitHub 工程团队分享了一个优化思路:不再等浏览器懒加载 CSS,而是把关键样式直接内联到初始 HTML 里。迁移到 CSS Modules 后,他们分析了关键渲染路径,提取了首屏 CSS,并避免了重复。结果是服务端渲染时间降了 55%,首次内容绘制也快了。对做前端性能或 SSR 优化的团队来说,是个很实在的案例。
Jev 是一个开源的代码审查工具,主打“先理解开发者意图,再解释代码改动”。它提供本地命令行、Agent 技能和 GitHub 扩展三种使用方式。正文没披露用了哪个模型、定价和性能基准,所以实际效果和成本还不清楚。
这个 GitHub 仓库给团队提供了一套从想法到上线的完整流程,专门配合 Copilot 这类 AI 编程助手用。它覆盖了写需求文档、搭架构、做测试、安全检查、代码审查和 CI/CD(自动构建部署),作者说已经在实际项目中验证过。不过正文没放任何跑分数据或用户案例,效果到底怎么样得自己试。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。作者认为聊天只是 AI 的通用兜底界面,用户明确任务时更该让智能体生成可复用工具,而非把智能体本身当工具、白白消耗 token。示例包括 Connect 4 游戏、Winget 包管理、SQLite 操作和开发工作流自动化。
Parcha.ai 开源了 AgentRun,一个声明式 DSL(领域特定语言),专门用来编排多智能体工作流。你可以把多个智能体步骤链成可复用的流水线,支持分支、循环和并行执行。说白了,就是用代码定义工作流,而不是靠写提示词(prompt)来凑合。项目目前只有 8 个 Star,刚起步。正文没提它跟 LangChain 或 CrewAI 具体有什么区别...
GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量并锚定到文件、行与侧,避免滚动跳动。
Jason Page 开源了 Seal,一个让你写数字遗书和存密码的工具,只有在你死后才会交给家人。你设定一个不活跃期限——比如连续 30 天没登录——Seal 就会把加密内容发给指定联系人。正文没披露它怎么可靠地区分“真死了”和“只是忘了登录”,所以这点先别太激动。
Orbital 是一个刚上 GitHub 的开源项目(277 星),口号是“上下文归你,agent 可替换”。它把 Claude Project 里锁在平台里的对话上下文变成可复用的资产,你可以导出、换模型、换 agent 流程。如果你受够了 Claude Project 不能导出上下文、不能换 agent,这个值得看。正文没披露支持哪些模型、是否兼容...
GitHub 工程师让 Copilot 的智能体模式(agent mode)主导了这次迁移,分三步走:先让智能体逐个文件翻译,再用测试驱动修 bug,最后做性能和安全审查。搬完以后,服务启动从 30 秒降到 3 秒,内存占用砍到原来的三分之一,首 token 响应时间从 11 秒压到 1.2 秒。团队强调人始终在决策环里——智能体干重活,工程师管架构、...
推荐理由:GitHub 第一方案例,Copilot 智能体主导了 83 万行 Rust 迁移,性能提升有硬数字。HKR 全中,但这是产品能力秀而非独立突破,所以放在 featured 档,82 分。
Jim Nielsen 吐槽现在 GitHub、Claude 等服务的状态页只写“99.72% 可用率”,对非基础设施用户来说基本没意义。他引用 Jason Gorman 的观点:从 90% 到 99% 的难度和从 99% 到 99.9% 一样大,但数字看起来差不多。他的改进建议很直接:把“98.31% 可用率”改成“过去 30 天受影响 12 小时(...
这是一个GitHub合并门禁,专门检测AI写的代码有没有让项目结构变烂。传统测试只检查功能对不对,但AI代码经常能通过测试却让代码库越来越难维护——比如重复逻辑、混乱依赖、命名随意。ImpactGate会算一个“结构衰减分”,分数太低的PR直接拒绝合并。正文没披露具体怎么打分、阈值设多少,但思路很直接:把质量门禁从“跑得通”扩展到“结构好”。如果真能落...
Panel 是一个开源的研究工作台,核心思路是让 AI 代理自己创建和排列面板,而不是由人预先画好 UI。项目在 GitHub 上已有 594 次提交,但正文没披露支持哪些模型、能不能接外部工具。如果你在探索让 AI 自己生成界面的方向,值得看一眼,但先别太激动——目前信息还比较薄,实际效果和落地门槛都不清楚。
Runway 放出了 Solaris 的研究预览,这个系统不写前端代码,靠模型逐帧把界面画出来,用户的点击拖拽直接驱动下一帧画面。目前只有官方精剪的演示视频和一个候补名单,没有公测、定价和 API,第三方实测也还没出现。官方自报用户偏好度比传统代码界面高,但成本对比的参照系是更贵的视频扩散模型,不代表比普通网页渲染省钱。Google Research ...
推荐理由:三条打包,Solaris 是主钩子。Runway 逐帧画界面的思路确实新鲜,但目前只有官方精剪演示和候补名单,没公测、没定价、没 API,第三方实测也还没影,成本对比还绕开了普通网页渲染。所以我会先打个折,重要性给 78。Google 的 WikiSkill 让 agent 从失败里自己总结技能文档,机制具体,但正文没披露规模验证。GitHub 的 Copilot 企业版编码模式把数据留在本地,对合规敏感的公司是刚需,不过细节还不多。整体有话题性,但都缺实测,tier 放 featured 合适。
一个叫 Kinesis 的开源项目,让你用 Meta 的 Neural Band 神经手环来控制 Mac。它把脑机接口信号转成 macOS 原生操作,比如手势滚动和移动光标。代码跑在本地,不依赖云端,隐私上放心一点。项目刚上 GitHub,目前只有 23 颗星,还非常早期。正文没披露延迟、准确率或支持哪些 macOS 版本,想试的话得自己跑代码测。
Liniora 是一个面向工程团队的 AI 工作区,能把 Jira/Asana 的工单、GitHub/GitLab 的分支和 PR、Slack 聊天记录、会议笔记全部拉到一个地方。它的 AI 会建一个代码库和对话的语义图,你可以直接问自然语言问题,比如“支付网关当时怎么定的?”然后得到答案。它还能自动总结 PR、从日历同步里提取行动项、从工单直接创建分...
有人在Reddit发帖,说自己用WhatsApp群聊记录微调了一个2B参数的小模型,并且把完整流程做成了GitHub cookbook开源。正文被Reddit屏蔽了,所以看不到基座模型、训练成本、效果评测这些关键信息。2B模型的好处是本地跑得动,适合拿自己的聊天记录训练一个模仿群聊口吻的玩具。如果你也想试试,这个cookbook是个不错的起点,但具体花...
GitHub 日韩营销负责人分享了一个实操案例:把活动策划、执行到跟进的全流程写成代码,用 Copilot 自动生成活动页面、发送跟进邮件、分析参会数据。核心思路是把营销运营当软件工程做,AI 负责砍掉重复劳动。正文没有披露具体节省了多少人力或时间,但思路本身对运营团队有参考价值。
Herdr Studio 是一个开源浏览器客户端,让你在一个可视化界面里同时管理多个 AI agent 的终端、文件、代码差异和工作树。它依赖 Herdr 守护进程,即使浏览器或笔记本断线,agent 会话也不会丢。支持本地和 SSH 连接,还能以 PWA 形式装到手机上。目前只提供了 macOS 和 Linux 的安装脚本,Windows 用户得去 ...
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示代码的增删改,终端面板支持直接运行项目命令并可通过 Run 按钮配置脚本,浏览器面板则提供 Pick & Polish 工具来选取页面元素并让智能体调整。
作者认为 AI 生成代码的最大问题是信任——不信任写 ticket 的人、不信任工程师是否理解需求、不信任测试能拦住回归、不信任 CI/CD 和监控。解决方案是让工程师对交付负责,同时给足自主权。具体做法包括:定好编码规范(AI agent 会读)、多用类型语言和 linter 等确定性工具、强制小 PR(太大直接拒)、手写测试用例(AI 只负责实现)...
GitHub 在博客里公开了一个叫 Project HydraFusion 的研究预览,核心是一个运行时的模型路由器。它会看每次请求的难度:简单任务直接丢给便宜的小模型,复杂任务才调用 Claude Sonnet 4.5 这类顶尖模型。GitHub 说这样能在保持 Copilot 回答质量的同时,把推理成本降到纯用顶级模型的五分之一。目前没有上线时间表...
推荐理由:这是 GitHub 官方博客的研究预览,有具体成本数据和模型名称,不是纯公关稿。我会先打个折,因为没给上线时间,所以放在 featured 78 分这个档位。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在会话视图中查看各任务标题与进度,例如在同一项目上并行执行 funded sort 开发、无障碍审查和测试运行。
OpenRouter 数据显示智能体每周消耗 7.3 万亿 token,名义上是人类用量的 5.2 倍。但这 5.2 倍里 70% 到 85% 是缓存读取,模型服务商对这部分只收原价的一折左右,所以实际账单大概只多出 1 倍。这个数字只能代表 OpenRouter 一家平台,它的流量只占全球推理量的 1%,而且区分人类和智能体的算法权重没公开,没法复现...
推荐理由:三条消息打包,但核心价值在第一篇:终于有人把智能体名义 token 消耗和缓存打折后的真实成本拆开算了,结论是实际账单大概只翻了一倍。OpenAI 芯片跑分和 GitHub 文档压缩原型是附赠信息,密度稍低。跨源聚合的编辑判断清晰,没有硬吹。
GitHub 发了一篇工程博客,讲他们怎么把 Copilot 的 AI 编码成本降到原来的三分之一左右,同时任务质量没明显下降。核心做法是训练了一个 18 亿参数的小模型当“路由器”:它看 1040 组偏好样本,学会判断一个请求该交给便宜的小模型,还是该叫更强的模型来救场。上线后,强模型的调用量直接少了 70%,整体延迟控制在 11 秒以内。文章里还提...
推荐理由:GitHub 这篇工程博客给出了一个带真实数字和方法的成本优化方案,对正在落地 AI 编码的团队有直接参考价值。分数没给更高是因为它属于工程优化,不是新模型发布,但 70% 的调用削减和三分之一成本下降这两个数据足够硬,值得放进精选。
Shopify 把内部用的 ML 流水线编辑器 Tangle 开源了。核心卖点是拖拽式可视化搭建,团队可以一起编辑、克隆、跑不同版本,支持任意语言和框架(把现有代码包进容器就行)。中间结果会按内容缓存,重复跑的时候省时间省算力。有在线 Playground 可以直接试,代码在 GitHub。适合不想写胶水代码、想快速搭实验流程的团队。
Neil Alexander 直接点名了一种新乱象:有人用 Claude 等模型批量生成拼写修复 PR 和安全漏洞报告,只为在 GitHub 个人页上刷绿点和贡献者头像,好给招聘方看。他举了一个具体例子——一个从 2018 年底几乎零活动的账号,突然给项目提了三个修注释拼写的 PR,全是 AI 写的、AI 提交的,连 commit 签名都带上了 Cla...
推荐理由:一篇维护者第一视角的吐槽,有具体案例和模式分析,三个维度都打中了。扣到 78 分是因为它是一篇个人博客,不是行业事件,而且问题本身不算新发现。
Plicara 扫了 187 万份智能体技能文件(就是教 AI 干活的说明书),发现非英语写的比例从 2026 年一季度的 13% 跳到了二季度的 16.3%,这个速度比 GitHub 文档的多元化快得多。中文技能占 6.2%,差不多是 GitHub 文档里中文占比的两倍。欧洲语言在同一时期翻了一倍多,日语和韩语反而下滑了。各家公布的数字对不上,是因为...
推荐理由:Plicara 扫了 187 万份教 AI 干活的技能说明书,发现非英语写的比例一个季度从 13% 跳到 16.3%,比 GitHub 文档的多元化速度快得多。中文技能占 6.2%,差不多是 GitHub 文档里中文占比的两倍,欧洲语言翻了一倍多,日语韩语反而在掉。这个数据角度很新鲜,有具体数字支撑,不是泛泛谈多语言趋势。我会先打个折:Plicara 不是家喻户晓的名字,数据权威性还需要更多验证,正文也提到各家公布的数字对不上,因为统计口径不一样。但选题本身够聪明,直接回答了“AI 开发到底在哪里发生”这个问题,对非英语开发者有天然的吸引力,所以给...
AI 编程工具 Cursor 正式发布了自己的代码托管平台 Origin,目标就是跟 GitHub 抢开发者。标题里提到了 Stacked PR(一种把大改动拆成小 PR 的协作方式)、AI Agent 和 Copilot,暗示 Origin 会深度集成 AI 能力,比如让 AI 自动帮你管理分支、合并代码。但正文完全没披露具体功能、定价和上线时间,所...
Cursor 开始向所有付费用户推送 Origin 的早期测试版,相当于在编辑器里内置了一个代码托管平台。你可以直接创建仓库、发起和审核合并请求、浏览代码,还能把 GitHub 上的仓库实时同步过来,两边互相发评论。每个仓库都住着一个 AI 助手,能回答代码问题、改代码、推分支。首批集成的应用有 Vercel(自动生成预览链接)、Depot 和 Bui...
推荐理由:Cursor 从编辑器往平台迈了一步,每个仓库配 AI 助手、能同步 GitHub 评论、集成 Vercel 和 Depot,产品上确实有料。但现在是早期测试版,正文没提正式上线时间和定价,实际稳定性还不知道,所以分数没给更高。
AutoGPT 项目现在超过 60% 的拉取请求来自 AI 工具。维护者 Reinier van der Leer 在仓库里放了一个 AGENTS.md 文件,给 AI 贡献者立规矩,还加了技能门控:只有通过代码格式检查和单元测试的 AI 代理才能提交代码。垃圾 PR 数量大幅下降,但正文没披露有多少人类贡献者被误拦了。
推荐理由:AutoGPT 维护者的一手经验,有硬数字(60% AI PR)和两套可复现的机制。缺点是正文没披露多少人类贡献者被误拦了,而且只是单个项目的案例,能不能推广到别的项目还不好说。
GitHub 工程师分享了一套处理 AI 生成大块代码的工作流:先让模型一次性吐出整个功能的代码,再用堆叠式 Pull Request 自动把几千行改动按文件依赖和语义拆成 200 到 400 行一个的逻辑块。每个 PR 只关注一层改动,审阅的人不用同时看所有东西。文章给了具体命令和分支命名规范,但没披露内部有多少人用、审阅时间到底缩短了多少。
推荐理由:GitHub 官方工程博客分享了一套处理 AI 生成大块代码的实操工作流,用堆叠式 PR 把巨型改动拆成小块审阅,命令和拆分逻辑都给了,团队可以直接参考。但我会先打个折:内部使用规模和审阅效率提升的数据都没公布,这点先别太激动。
Starling 不是浏览器里的模拟界面,而是一个直接驱动 GPU 的 Wayland 桌面环境。它由一个人指挥 AI 在六个月内写完,代码量约 33.5 万行,其中桌面本体、Wayland 和 X11 服务器及内置应用约 6.2 万行。它能原生运行 Chrome、Slack 和 Zoom 这些它自己没写过的程序,支持一键切换平铺和浮动窗口、热插拔多显...
推荐理由:一个人加 AI,六个月交出能驱动 GPU 的 Wayland 桌面,代码公开可查,还能原生跑 Chrome 和 Slack——这个案例把 AI 辅助开发的边界推得很远。数字和可复现性让它不是空口说白话,所以给 82 分。没给更高是因为正文没披露 AI 具体怎么参与、人工干预多少、稳定性如何,这些缺口让判断得先打个折。
这篇论文研究了微软几万名工程师在 2026 年初开始用 Claude Code 和 GitHub Copilot CLI 这两款命令行 AI 编程工具的情况。有三个发现比较实在:第一,大家开始用主要是因为看到身边的同事在用,靠的是同事间的社交网络,不是公司硬性摊派。第二,能不能坚持用下去,跟工程师写代码的活跃度关系更大,跟年龄、性别这些背景信息关系不大...
推荐理由:这篇论文拿微软内部几万工程师的实操数据说话,不是实验室跑分。我会先打个折——它是一篇研究论文,不是产品发布,但信息密度够高。三个发现都反直觉:推广靠同事圈子的社交传染,不是公司强推;能不能坚持用跟年龄性别关系不大,主要看你平时写代码多不多;token 开销集中在少数重度用户身上。这些对做工具落地的人有直接参考价值,所以给 featured。