跳到正文

#GitHub

今日 1 条

今天 · 9月30日星期三 · 1 条

昨天 · 9月29日星期二

Hacker News 首页

PostHog 开源 Jeeves:用推理改进 Jev 类决策模型

PostHog 在 GitHub 开源 Jeeves 项目,通过推理能力改进 Jev 类决策模型。仓库包含 drafter、inference、loader、model、prep、sdk 等模块,并附有 calibrate.py、checkpoint.py 等脚本,采用 master 单分支,已获 49 星、7 次 fork。

Hacker News 首页

Jeff:在家用消费级显卡训的 0.8B 决策模型,推理只要 30 毫秒

Jeff 是一组从 Qwen3.5 和 Gemma 4 微调出来的 0.8B 参数小模型,专门做零样本分类——也就是不给例子直接判断类别。亮点是作者说在家用普通显卡上就能训练,推理一次只要 30 毫秒左右,延迟很低,适合塞进实时决策流程。模型兼容 Jev 格式,GitHub 上放了代码和权重。不过正文没披露用了多大训练集、在什么基准上测过,所以实际效果...

AI HOT 精选

GitHub 安全团队用自家开源 AI 安全 Agent 在安卓项目里自动找出 24 个漏洞

GitHub 的安全团队拿安卓开源项目(AOSP)跑了一遍他们开源的 AI 安全 Agent,自动扫出 24 个漏洞,还顺手把补丁交了。这个 Agent 相当于一个能自己看代码、找问题、写修复方案的自动化工具,把以前靠人肉审计的活变成了机器自主跑流程。不过正文没提具体是哪些类型的漏洞,也没说误报率有多高、底层用的是哪个模型。工具代码已经开源,想试的可以...

9月27日星期日

Hacker News 首页

LightCloud:把云资源当文件系统管,还能用 Claude 一句话部署

LightCloud 是一个新的云控制台,把项目、数据库、容器都组织成文件系统树,左边目录右边操作,像在本地 IDE 里管理文件一样。静态站点自动走全球 CDN,容器空闲时缩到零实例(不跑就不计费),Postgres 数据库可以在同一个项目里直接创建,凭证自动加密并注入到应用。每个分支和 PR 都会生成一个独立的预览链接,推送即构建。它还接入了 Cla...

9月26日星期六

量子位 · 公众号

笔记本跑7000亿参数GLM:没显卡也行,把SSD当显存用

一个GitHub项目火了:在没GPU的笔记本上跑700亿参数的GLM模型。办法是把SSD当显存用,用存储换速度。正文没披露具体延迟和精度损失,但思路很直接——内存不够硬盘凑。对没显卡的开发者来说,是个低成本试大模型的办法。

AI HOT 精选

GitHub Copilot 新手教程:用画布搭自定义工作流

GitHub 发了一篇面向新手的 Copilot 教程,教你怎么用“画布”(canvases)搭自定义工作流。注意,这不是新功能发布,只是操作指南,没提任何技术参数或模型更新。对刚接触 Copilot 的开发者有用,但如果你想知道底层模型有没有升级、性能有没有提升,这篇正文里没有。

9月25日星期五

AI HOT 精选

GitHub 把 CSS 提前塞进 HTML,SSR 时间砍掉 55%

GitHub 工程团队分享了一个优化思路:不再等浏览器懒加载 CSS,而是把关键样式直接内联到初始 HTML 里。迁移到 CSS Modules 后,他们分析了关键渲染路径,提取了首屏 CSS,并避免了重复。结果是服务端渲染时间降了 55%,首次内容绘制也快了。对做前端性能或 SSR 优化的团队来说,是个很实在的案例。

Hacker News 首页

Jev:一个先看意图再看代码的 AI 审查工具

Jev 是一个开源的代码审查工具,主打“先理解开发者意图,再解释代码改动”。它提供本地命令行、Agent 技能和 GitHub 扩展三种使用方式。正文没披露用了哪个模型、定价和性能基准,所以实际效果和成本还不清楚。

Hacker News 首页

Vibe Coding 生产套件:把 AI 写代码从“玩票”变成正经工作流

这个 GitHub 仓库给团队提供了一套从想法到上线的完整流程,专门配合 Copilot 这类 AI 编程助手用。它覆盖了写需求文档、搭架构、做测试、安全检查、代码审查和 CI/CD(自动构建部署),作者说已经在实际项目中验证过。不过正文没放任何跑分数据或用户案例,效果到底怎么样得自己试。

GitHub Blog · AI & ML

GitHub Copilot 的 canvas:当聊天不再是正确的 AI 交互界面

GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。作者认为聊天只是 AI 的通用兜底界面,用户明确任务时更该让智能体生成可复用工具,而非把智能体本身当工具、白白消耗 token。示例包括 Connect 4 游戏、Winget 包管理、SQLite 操作和开发工作流自动化。

9月24日星期四

Hacker News 首页

AgentRun:用声明式 DSL 把 AI 智能体串成可复用工作流

Parcha.ai 开源了 AgentRun,一个声明式 DSL(领域特定语言),专门用来编排多智能体工作流。你可以把多个智能体步骤链成可复用的流水线,支持分支、循环和并行执行。说白了,就是用代码定义工作流,而不是靠写提示词(prompt)来凑合。项目目前只有 8 个 Star,刚起步。正文没提它跟 LangChain 或 CrewAI 具体有什么区别...

GitHub Blog · AI & ML

GitHub Copilot 应用如何渲染超大 pull request

GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量并锚定到文件、行与侧,避免滚动跳动。

9月19日星期六

Hacker News 首页

Seal:你死后才打开的加密遗书和密码库

Jason Page 开源了 Seal,一个让你写数字遗书和存密码的工具,只有在你死后才会交给家人。你设定一个不活跃期限——比如连续 30 天没登录——Seal 就会把加密内容发给指定联系人。正文没披露它怎么可靠地区分“真死了”和“只是忘了登录”,所以这点先别太激动。

9月18日星期五

Hacker News 首页

Orbital:开源版 Claude Project,对话上下文归你,agent 随便换

Orbital 是一个刚上 GitHub 的开源项目(277 星),口号是“上下文归你,agent 可替换”。它把 Claude Project 里锁在平台里的对话上下文变成可复用的资产,你可以导出、换模型、换 agent 流程。如果你受够了 Claude Project 不能导出上下文、不能换 agent,这个值得看。正文没披露支持哪些模型、是否兼容...

9月17日星期四

AI HOT 精选

GitHub 用自家 Copilot 智能体把 Copilot 运行时从 TypeScript 搬到了 83 万行 Rust

GitHub 工程师让 Copilot 的智能体模式(agent mode)主导了这次迁移,分三步走:先让智能体逐个文件翻译,再用测试驱动修 bug,最后做性能和安全审查。搬完以后,服务启动从 30 秒降到 3 秒,内存占用砍到原来的三分之一,首 token 响应时间从 11 秒压到 1.2 秒。团队强调人始终在决策环里——智能体干重活,工程师管架构、...

推荐理由:GitHub 第一方案例,Copilot 智能体主导了 83 万行 Rust 迁移,性能提升有硬数字。HKR 全中,但这是产品能力秀而非独立突破,所以放在 featured 档,82 分。

9月16日星期三

Hacker News 首页

能不能别再只报 99.9% 的可用率了?

Jim Nielsen 吐槽现在 GitHub、Claude 等服务的状态页只写“99.72% 可用率”,对非基础设施用户来说基本没意义。他引用 Jason Gorman 的观点:从 90% 到 99% 的难度和从 99% 到 99.9% 一样大,但数字看起来差不多。他的改进建议很直接:把“98.31% 可用率”改成“过去 30 天受影响 12 小时(...

Hacker News 首页

ImpactGate:给AI生成的代码打“结构健康分”,不达标就拦在合并前

这是一个GitHub合并门禁,专门检测AI写的代码有没有让项目结构变烂。传统测试只检查功能对不对,但AI代码经常能通过测试却让代码库越来越难维护——比如重复逻辑、混乱依赖、命名随意。ImpactGate会算一个“结构衰减分”,分数太低的PR直接拒绝合并。正文没披露具体怎么打分、阈值设多少,但思路很直接:把质量门禁从“跑得通”扩展到“结构好”。如果真能落...

9月15日星期二

Hacker News 首页

Panel:让 AI 自己搭工作台,每个面板都是它动态生成的

Panel 是一个开源的研究工作台,核心思路是让 AI 代理自己创建和排列面板,而不是由人预先画好 UI。项目在 GitHub 上已有 594 次提交,但正文没披露支持哪些模型、能不能接外部工具。如果你在探索让 AI 自己生成界面的方向,值得看一眼,但先别太激动——目前信息还比较薄,实际效果和落地门槛都不清楚。

Computing Life · Share · 鸭哥调研

三条 AI 新闻:会画界面的模型、给自己写说明书的 agent、脱离厂商云的企业编程

Runway 放出了 Solaris 的研究预览,这个系统不写前端代码,靠模型逐帧把界面画出来,用户的点击拖拽直接驱动下一帧画面。目前只有官方精剪的演示视频和一个候补名单,没有公测、定价和 API,第三方实测也还没出现。官方自报用户偏好度比传统代码界面高,但成本对比的参照系是更贵的视频扩散模型,不代表比普通网页渲染省钱。Google Research ...

推荐理由:三条打包,Solaris 是主钩子。Runway 逐帧画界面的思路确实新鲜,但目前只有官方精剪演示和候补名单,没公测、没定价、没 API,第三方实测也还没影,成本对比还绕开了普通网页渲染。所以我会先打个折,重要性给 78。Google 的 WikiSkill 让 agent 从失败里自己总结技能文档,机制具体,但正文没披露规模验证。GitHub 的 Copilot 企业版编码模式把数据留在本地,对合规敏感的公司是刚需,不过细节还不多。整体有话题性,但都缺实测,tier 放 featured 合适。

9月14日星期一

Hacker News 首页

Kinesis:用 Meta 神经手环控制 Mac,开源项目已上线

一个叫 Kinesis 的开源项目,让你用 Meta 的 Neural Band 神经手环来控制 Mac。它把脑机接口信号转成 macOS 原生操作,比如手势滚动和移动光标。代码跑在本地,不依赖云端,隐私上放心一点。项目刚上 GitHub,目前只有 23 颗星,还非常早期。正文没披露延迟、准确率或支持哪些 macOS 版本,想试的话得自己跑代码测。

9月12日星期六

Hacker News 首页

Liniora:一个把项目管理、代码和聊天记录全塞进一个工作区的AI工具

Liniora 是一个面向工程团队的 AI 工作区,能把 Jira/Asana 的工单、GitHub/GitLab 的分支和 PR、Slack 聊天记录、会议笔记全部拉到一个地方。它的 AI 会建一个代码库和对话的语义图,你可以直接问自然语言问题,比如“支付网关当时怎么定的?”然后得到答案。它还能自动总结 PR、从日历同步里提取行动项、从工单直接创建分...

r/LocalLLaMA

把2B小模型微调成微信群聊风格,全套代码开源了

有人在Reddit发帖,说自己用WhatsApp群聊记录微调了一个2B参数的小模型,并且把完整流程做成了GitHub cookbook开源。正文被Reddit屏蔽了,所以看不到基座模型、训练成本、效果评测这些关键信息。2B模型的好处是本地跑得动,适合拿自己的聊天记录训练一个模仿群聊口吻的玩具。如果你也想试试,这个cookbook是个不错的起点,但具体花...

AI HOT 精选

GitHub 日韩营销负责人用 Copilot 把活动运营写成代码

GitHub 日韩营销负责人分享了一个实操案例:把活动策划、执行到跟进的全流程写成代码,用 Copilot 自动生成活动页面、发送跟进邮件、分析参会数据。核心思路是把营销运营当软件工程做,AI 负责砍掉重复劳动。正文没有披露具体节省了多少人力或时间,但思路本身对运营团队有参考价值。

9月11日星期五

Hacker News 首页

Herdr Studio:给AI agent集群一个浏览器驾驶舱

Herdr Studio 是一个开源浏览器客户端,让你在一个可视化界面里同时管理多个 AI agent 的终端、文件、代码差异和工作树。它依赖 Herdr 守护进程,即使浏览器或笔记本断线,agent 会话也不会丢。支持本地和 SSH 连接,还能以 PWA 形式装到手机上。目前只提供了 macOS 和 Linux 的安装脚本,Windows 用户得去 ...

GitHub Blog · AI & ML

GitHub Copilot 应用新手指南:使用 diff、终端与浏览器面板

GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示代码的增删改,终端面板支持直接运行项目命令并可通过 Run 按钮配置脚本,浏览器面板则提供 Pick & Polish 工具来选取页面元素并让智能体调整。

9月7日星期一

Hacker News 首页

AI 生成代码的信任危机:工程师要对交付负责

作者认为 AI 生成代码的最大问题是信任——不信任写 ticket 的人、不信任工程师是否理解需求、不信任测试能拦住回归、不信任 CI/CD 和监控。解决方案是让工程师对交付负责,同时给足自主权。具体做法包括:定好编码规范(AI agent 会读)、多用类型语言和 linter 等确定性工具、强制小 PR(太大直接拒)、手写测试用例(AI 只负责实现)...

9月5日星期六

AI HOT 精选

GitHub 放出 HydraFusion 研究预览:用多模型调度把 Copilot 推理成本砍到只用顶级模型的五分之一

GitHub 在博客里公开了一个叫 Project HydraFusion 的研究预览,核心是一个运行时的模型路由器。它会看每次请求的难度:简单任务直接丢给便宜的小模型,复杂任务才调用 Claude Sonnet 4.5 这类顶尖模型。GitHub 说这样能在保持 Copilot 回答质量的同时,把推理成本降到纯用顶级模型的五分之一。目前没有上线时间表...

推荐理由:这是 GitHub 官方博客的研究预览,有具体成本数据和模型名称,不是纯公关稿。我会先打个折,因为没给上线时间,所以放在 featured 78 分这个档位。

9月4日星期五

GitHub Blog · AI & ML

GitHub Copilot 应用新手指南:如何同时运行多个智能体

GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在会话视图中查看各任务标题与进度,例如在同一项目上并行执行 funded sort 开发、无障碍审查和测试运行。

9月3日星期四

Computing Life · Share · 鸭哥调研

智能体 token 用量超人类 5 倍,但缓存打折后实际账单只多 1 倍

OpenRouter 数据显示智能体每周消耗 7.3 万亿 token,名义上是人类用量的 5.2 倍。但这 5.2 倍里 70% 到 85% 是缓存读取,模型服务商对这部分只收原价的一折左右,所以实际账单大概只多出 1 倍。这个数字只能代表 OpenRouter 一家平台,它的流量只占全球推理量的 1%,而且区分人类和智能体的算法权重没公开,没法复现...

推荐理由:三条消息打包,但核心价值在第一篇:终于有人把智能体名义 token 消耗和缓存打折后的真实成本拆开算了,结论是实际账单大概只翻了一倍。OpenAI 芯片跑分和 GitHub 文档压缩原型是附赠信息,密度稍低。跨源聚合的编辑判断清晰,没有硬吹。

AI HOT 精选

GitHub Copilot 用偏好训练的小模型当“路由器”,把 AI 编码成本砍到三分之一

GitHub 发了一篇工程博客,讲他们怎么把 Copilot 的 AI 编码成本降到原来的三分之一左右,同时任务质量没明显下降。核心做法是训练了一个 18 亿参数的小模型当“路由器”:它看 1040 组偏好样本,学会判断一个请求该交给便宜的小模型,还是该叫更强的模型来救场。上线后,强模型的调用量直接少了 70%,整体延迟控制在 11 秒以内。文章里还提...

推荐理由:GitHub 这篇工程博客给出了一个带真实数字和方法的成本优化方案,对正在落地 AI 编码的团队有直接参考价值。分数没给更高是因为它属于工程优化,不是新模型发布,但 70% 的调用削减和三分之一成本下降这两个数据足够硬,值得放进精选。

Hacker News 首页

Tangle:Shopify 开源的可拖拽 ML 流水线编辑器

Shopify 把内部用的 ML 流水线编辑器 Tangle 开源了。核心卖点是拖拽式可视化搭建,团队可以一起编辑、克隆、跑不同版本,支持任意语言和框架(把现有代码包进容器就行)。中间结果会按内容缓存,重复跑的时候省时间省算力。有在线 Playground 可以直接试,代码在 GitHub。适合不想写胶水代码、想快速搭实验流程的团队。

8月28日星期五

Hacker News 首页

开源维护者喊话:别再用 AI 生成的垃圾 PR 刷简历了

Neil Alexander 直接点名了一种新乱象:有人用 Claude 等模型批量生成拼写修复 PR 和安全漏洞报告,只为在 GitHub 个人页上刷绿点和贡献者头像,好给招聘方看。他举了一个具体例子——一个从 2018 年底几乎零活动的账号,突然给项目提了三个修注释拼写的 PR,全是 AI 写的、AI 提交的,连 commit 签名都带上了 Cla...

推荐理由:一篇维护者第一视角的吐槽,有具体案例和模式分析,三个维度都打中了。扣到 78 分是因为它是一篇个人博客,不是行业事件,而且问题本身不算新发现。

8月25日星期二

Hacker News 首页

AI 智能体技能文件里,非英语占比一个季度从 13% 涨到 16.3%

Plicara 扫了 187 万份智能体技能文件(就是教 AI 干活的说明书),发现非英语写的比例从 2026 年一季度的 13% 跳到了二季度的 16.3%,这个速度比 GitHub 文档的多元化快得多。中文技能占 6.2%,差不多是 GitHub 文档里中文占比的两倍。欧洲语言在同一时期翻了一倍多,日语和韩语反而下滑了。各家公布的数字对不上,是因为...

推荐理由:Plicara 扫了 187 万份教 AI 干活的技能说明书,发现非英语写的比例一个季度从 13% 跳到 16.3%,比 GitHub 文档的多元化速度快得多。中文技能占 6.2%,差不多是 GitHub 文档里中文占比的两倍,欧洲语言翻了一倍多,日语韩语反而在掉。这个数据角度很新鲜,有具体数字支撑,不是泛泛谈多语言趋势。我会先打个折:Plicara 不是家喻户晓的名字,数据权威性还需要更多验证,正文也提到各家公布的数字对不上,因为统计口径不一样。但选题本身够聪明,直接回答了“AI 开发到底在哪里发生”这个问题,对非英语开发者有天然的吸引力,所以给...

8月22日星期六

最佳拍档

Cursor 推出代码托管平台 Origin,直接叫板 GitHub

AI 编程工具 Cursor 正式发布了自己的代码托管平台 Origin,目标就是跟 GitHub 抢开发者。标题里提到了 Stacked PR(一种把大改动拆成小 PR 的协作方式)、AI Agent 和 Copilot,暗示 Origin 会深度集成 AI 能力,比如让 AI 自动帮你管理分支、合并代码。但正文完全没披露具体功能、定价和上线时间,所...

8月18日星期二

AI HOT 精选

Cursor 推出自家代码托管服务 Origin,付费用户现在可以不用 GitHub 了

Cursor 开始向所有付费用户推送 Origin 的早期测试版,相当于在编辑器里内置了一个代码托管平台。你可以直接创建仓库、发起和审核合并请求、浏览代码,还能把 GitHub 上的仓库实时同步过来,两边互相发评论。每个仓库都住着一个 AI 助手,能回答代码问题、改代码、推分支。首批集成的应用有 Vercel(自动生成预览链接)、Depot 和 Bui...

推荐理由:Cursor 从编辑器往平台迈了一步,每个仓库配 AI 助手、能同步 GitHub 评论、集成 Vercel 和 Depot,产品上确实有料。但现在是早期测试版,正文没提正式上线时间和定价,实际稳定性还不知道,所以分数没给更高。

8月13日星期四

AI HOT 精选

AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的拉取请求

AutoGPT 项目现在超过 60% 的拉取请求来自 AI 工具。维护者 Reinier van der Leer 在仓库里放了一个 AGENTS.md 文件,给 AI 贡献者立规矩,还加了技能门控:只有通过代码格式检查和单元测试的 AI 代理才能提交代码。垃圾 PR 数量大幅下降,但正文没披露有多少人类贡献者被误拦了。

推荐理由:AutoGPT 维护者的一手经验,有硬数字(60% AI PR)和两套可复现的机制。缺点是正文没披露多少人类贡献者被误拦了,而且只是单个项目的案例,能不能推广到别的项目还不好说。

8月5日星期三

AI HOT 精选

GitHub 用堆叠式 PR 把 AI 一次生成的巨型代码拆成人类能审的小块

GitHub 工程师分享了一套处理 AI 生成大块代码的工作流:先让模型一次性吐出整个功能的代码,再用堆叠式 Pull Request 自动把几千行改动按文件依赖和语义拆成 200 到 400 行一个的逻辑块。每个 PR 只关注一层改动,审阅的人不用同时看所有东西。文章给了具体命令和分支命名规范,但没披露内部有多少人用、审阅时间到底缩短了多少。

推荐理由:GitHub 官方工程博客分享了一套处理 AI 生成大块代码的实操工作流,用堆叠式 PR 把巨型改动拆成小块审阅,命令和拆分逻辑都给了,团队可以直接参考。但我会先打个折:内部使用规模和审阅效率提升的数据都没公布,这点先别太激动。

7月29日星期三

Hacker News 首页

一个人用 AI 写了六个月,做出了一个能跑 Chrome 和 Zoom 的 Linux 桌面

Starling 不是浏览器里的模拟界面,而是一个直接驱动 GPU 的 Wayland 桌面环境。它由一个人指挥 AI 在六个月内写完,代码量约 33.5 万行,其中桌面本体、Wayland 和 X11 服务器及内置应用约 6.2 万行。它能原生运行 Chrome、Slack 和 Zoom 这些它自己没写过的程序,支持一键切换平铺和浮动窗口、热插拔多显...

推荐理由:一个人加 AI,六个月交出能驱动 GPU 的 Wayland 桌面,代码公开可查,还能原生跑 Chrome 和 Slack——这个案例把 AI 辅助开发的边界推得很远。数字和可复现性让它不是空口说白话,所以给 82 分。没给更高是因为正文没披露 AI 具体怎么参与、人工干预多少、稳定性如何,这些缺口让判断得先打个折。

7月14日星期二

Hacker News 首页

微软 2026 年初在内部铺开 Claude Code 和 Copilot CLI,用上的人合并的 PR 多了约 24%

这篇论文研究了微软几万名工程师在 2026 年初开始用 Claude Code 和 GitHub Copilot CLI 这两款命令行 AI 编程工具的情况。有三个发现比较实在:第一,大家开始用主要是因为看到身边的同事在用,靠的是同事间的社交网络,不是公司硬性摊派。第二,能不能坚持用下去,跟工程师写代码的活跃度关系更大,跟年龄、性别这些背景信息关系不大...

推荐理由:这篇论文拿微软内部几万工程师的实操数据说话,不是实验室跑分。我会先打个折——它是一篇研究论文,不是产品发布,但信息密度够高。三个发现都反直觉:推广靠同事圈子的社交传染,不是公司强推;能不能坚持用跟年龄性别关系不大,主要看你平时写代码多不多;token 开销集中在少数重度用户身上。这些对做工具落地的人有直接参考价值,所以给 featured。