跳到正文

#GitHub

今日 0 条

5月5日星期二

新智元 · 公众号

CMU 论文实锤 GitHub 假星产业链:1 美元能买 10 颗星,热门仓库可能藏木马

卡内基梅隆大学的研究员扫了 2019 年 7 月到 2024 年 12 月的 GitHub 活动日志,用他们开发的 StarScout 工具揪出约 600 万次疑似刷星行为,涉及 18617 个仓库和 301000 个账号。刷星价格低到离谱,1 美元就能买 10 颗星。这些假星不只是虚荣指标,供应链风险很实在:GitHub 已经删掉了被标记仓库里的 9...

推荐理由:我会先打个折:这不是模型或平台发布,所以重要性停在80分。但选题很准,CMU团队用StarScout扫了五年多的GitHub事件,揪出大量假星和关联账户,2024年7月热门收星仓库里16.66%涉假。真正让人警惕的是后续风险——涉事仓库九成已被GitHub删掉,剩下在线的样本里约30%仍是垃圾、钓鱼或恶意软件。对从业者来说,这比单纯刷星更值得盯,因为选错一个依赖就可能中招。

4月21日星期二

量子位 · 公众号

GitHub 星星明码标价 5 毛一颗,AI 项目刷假星最严重

卡内基梅隆大学一项研究扒出了 GitHub 上约 600 万颗疑似假星,时间跨度从 2019 到 2024 年,涉及 1.8 万多个仓库和超过 30 万个账号。他们用自研工具 StarScout 来识别机器人号和同步刷星行为,准确率自称 81%。有 78 个严重注水的项目一度冲上了 Trending 热门榜。对搞 AI 的人来说最扎眼的一点:在非恶意仓...

推荐理由:HKR 三项都站得住。CMU 的研究把 GitHub 假 Star 做成了可量化的安全问题——600 万颗假星、18617 个仓库、81% 的检测准确率,而且把最严重的非恶意造假指向了 AI/LLM 项目。这不是模型发布或产品上线,但作为一条行业信号,值得放进 featured。

2024年8月13日星期二

OpenAI News

OpenAI 发布 SWE-bench Verified:人工复核过的代码能力测试集

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集,叫 SWE-bench Verified。他们发现原版测试有坑:单元测试太死板、问题描述含糊、环境搭不起来,导致明明对的代码被判错,会系统性地低估模型写代码的真实水平。截至 2024 年 8 月 5 日,头部智能体在原版 SWE-bench 上得分约 20%,在 SWE-bench...

推荐理由:这不是一次常规发布。OpenAI 拉着原作者把 SWE-bench 翻了一遍,点出三类硬伤,还给出了新的分数天花板。我会先打个折:正文没披露修正后的完整新榜单,但现有数据已经足够让人重新审视那些代码智能体的评测成绩。