跳到主要内容

AI 一天找出近 5000 个比特币漏洞:国产大模型发力,开源不等于安全

8月7日 10:16
AI 一天找出近 5000 个比特币漏洞:国产大模型发力,开源不等于安全

16 个人, 27.5 小时, 4962 个安全问题, 85 个严重漏洞, 635 个高危漏洞。

这组数字来自一个叫 Bitcoin Red Team 的志愿者组织。过去两天,他们用 AI 模型对 390 个比特币开源项目发起了一场地毯式安全审计,平均每小时提交 166 个发现, 每人每小时锁定一个严重级别的漏洞。

Cashu 协议创始人 Calle在 X 上公布了首份战报,开头四个字概括了局面:"情况极其糟糕。"

但真正令人不安的,不是数字本身。

4 万美元和一场消防演习

这场审计不是凭空发起的。

一周前, 比特币生态刚经历了硬件钱包史上最大的安全事故。Coldcard 钱包因 2021 年一次固件更新中的随机数生成器缺陷,导致私钥可被离线推算。攻击者从 7月 30 日起分四波洗劫了超过 5200 个地址, Galaxy Research 的追踪数据显示损失约 1816枚 BTC,按当时价格计算超过 1.16 亿美元。

这个 Bug 在公开代码里静静躺了五年,任何人都可以审计,几乎没有人系统性地看过。

Coldcard 事件是导火索。Calle和 AnchorWatch CEO Rob Hamilton 迅速组建了 Red Team,从 OpenSats 拿到资金,在 AI 算力上烧掉了超过 4 万美元。他们使用的模型包括月之暗面的 Kimi K3、OpenAI的 GPT Sol、Anthropic的 Fable和 Opus,以及智谱的 GLM5.2。

项目初期,OpenAI和 Anthropic 的模型访问受限,团队主要依赖中国的开源模型。这个细节本身就挺有意思:守卫全球最大加密资产基础设施安全的,竟然是一群志愿者手持中国开源 AI 在通宵作战。

27.5 小时后的数据拼图是这样的:4962 个问题中, 14.5%属于高危或严重级别,平均每个项目命中 1.85 个严重问题。隐私和 CoinJoin 类工具的严重发现占比最高,达到 24%;其次是交易所和互换协议,21%;密码学库和 SDK 产出了最多的原始发现量(1101 个),但严重占比只有 10%。91%的发现通过自动化扫描提交, 21%已经用概念验证代码在本地环境中复现。

17 个贡献者里, 14 个是人类, 3 个是自动化系统。

瓶颈已经翻转

Rob Hamilton在 X 上写了一句话,比所有数字都重要:“最难的部分不是找到 Bug,是把它们送到对的人手里。”

在传统安全研究的世界里,"发现"是最昂贵的环节。一个顶级安全研究员可能花几周时间逆向一段代码, 找到一个可利用的漏洞。AI 把这个成本压到了接近零。16 个人配合 AI 模型, 一天的产出相当于一家审计公司几个月的工作量。

问题出在发现之后。截至战报发布时, 390 个被审计项目中只有 19 个(不到 5%)完成了上游披露。Calle 在推文中向维护者道歉,说知道报告潮涌增加了他们的压力, 团队还在学习如何过滤噪音。8 个发现已经被撤回为误报。

这是一个结构性的变化:AI 把“找 Bug”变成了近乎免费的行为, 整个安全流水线的瓶颈从最上游的发现环节,一下子转移到了中下游:验证、分类、路由到正确的维护者、修复、测试、部署补丁。这些环节依然高度依赖人工, 依然缓慢, 依然混乱。

而这正是攻击者的结构性优势所在。

不对称的军备竞赛

防御者需要走完一条完整的链路:发现漏洞→验证→负责任披露→等待维护者确认→修复→推送补丁→用户更新。每一步都有摩擦,都有延迟。

攻击者只需要:发现漏洞→利用。

AI 让链路的起点对双方都变得廉价。但后续步骤的不对称性,意味着这场军备竞赛天然有利于进攻方。Coldcard 的案例就是明证:一个 2021 年的 Bug 在代码库里公开存放了五年,防御者没有系统扫描,攻击者用 AI 找到了可预测的密钥空间,41 分钟扫走 1083枚 BTC。

更大的信号已经出现。今年 4 月,Anthropic 对外展示了 Claude Mythos Preview,一个因安全风险过高而拒绝公开发布的 AI 模型。根据 Anthropic 的说明,Mythos 在不到 50 美元的算力成本下就能锁定单个漏洞, 团队用它自主发现了 OpenBSD 操作系统中一个存在了 27 年的缺陷。OpenBSD 是全球公认安全性最高的操作系统之一,被大量用于运行防火墙和关键基础设施。Anthropic 因此启动了 Project Glasswing 计划, 联合 AWS、苹果、微软、谷歌等约 40 家机构,用这个模型抢在攻击者之前修补漏洞。

5 月,Google 威胁情报团队公布了另一个里程碑:他们截获了一个犯罪团伙利用 AI 模型发现零日漏洞并编写了利用代码的案例。那个漏洞是一个双因素认证绕过,嵌在一个被广泛使用的开源管理工具中。Google 通过代码中的 AI 特征(虚构的 CVSS 评分、教科书式的 Python 注释)识别了攻击来源, 并在犯罪团伙发起大规模利用之前与厂商合作完成了修补。

Google 威胁情报首席分析师 John Hultquist 的话没有留任何余地:"认为 AI 漏洞军备竞赛即将到来的看法是一种误判。现实是, 这场竞赛已经开始了。"

开源从来不等于审计过

Ledger CTO Charles Guillemet 在评价 Coldcard 事件时说了一句被广泛引用的话:“开源和被审查过,是两回事。”

这句话刺穿了加密行业一个长期存在的认知泡沫。比特币社区对开源有一种近乎宗教性的信仰,认为代码公开意味着任何人都可以检查,因此天然是安全的。Coldcard 的代码确实公开了五年。Red Team 的审计覆盖了 390 个项目。这两个事实放在一起,画面很清晰:可审计从来不等于已审计。

Red Team 的经验也暴露了 AI 安全审计的局限。Calle 说, 团队的大部分工作仍然是"手动引导 AI",让每个人用自己偏好的方式提示模型, 结果比统一方法覆盖面更广。这说明当前的 AI 安全审计更接近"人类专家驾驶 AI 工具"而非"AI 自主巡逻"。模型能快速扫描代码模式,但判断一个发现是否真正可利用、影响范围有多大、该通知谁,仍然需要人类的经验和判断。

Hamilton 说, 团队计划将审计框架开源, 让比特币公司可以对自己的闭源代码运行同样的扫描。这是正确的方向, 但也意味着同样的工具必然落入攻击者手中。

这场审计真正揭示的,是一个正在形成的新等式:

AI 让发现漏洞的成本趋近于零。但修复漏洞的成本(组织协调、人力投入、用户迁移)依然昂贵且缓慢。

4 万美元的 AI 算力,27.5 小时,就能把一个管理着数千亿美元资产的开源生态翻个底朝天。Coldcard 五年没人看的 Bug, 被攻击者找到后 41 分钟卷走了 1.16 亿美元。

比特币的安全叙事正在被重写。

过去的逻辑是:“代码是开源的,所以是安全的。”新的逻辑更残酷:“代码是开源的,所以攻击者也在用 AI 扫描它。”

防御者唯一的优势是先手,在攻击者之前找到并修补漏洞。Red Team 正在争夺这个先手,但他们的战报也说明,即便拿到了先手, 后续的补丁分发链路仍然是生态最薄弱的环节。

比特币面临的困境,可能只是一场更大变局的预演。整个开源软件世界都即将迎来同样的拷问:当发现 Bug 不再需要专家,修复 Bug 仍然需要,这个落差要靠什么来填?

欢迎加入币营 Coincamps官方社群:

X 官方账号:https://x.com/coincamps

Telegram 订阅群:https://t.me/coin_camps

推荐阅读

虚拟银行卡巨头上市前,被币安起诉了

8月7日 11:36
虚拟银行卡巨头上市前,被币安起诉了

除了股神基金亏麻,其他对冲基金在 7 月表现如何?

8月7日 11:17
除了股神基金亏麻,其他对冲基金在 7 月表现如何?

典当商账簿

8月7日 11:16
典当商账簿

Sonic Labs CEO 长文反思:DeFi Summer 不会重演,转向收入驱动的四条新产品线

8月7日 10:48
Sonic Labs CEO 长文反思:DeFi Summer 不会重演,转向收入驱动的四条新产品线

Bitget UEX 日报|特朗普对多晶硅加征关税;SpaceX、特斯拉启动168亿美元Terafab项目;今夜非农数据来袭

8月7日 10:30
Bitget UEX 日报|特朗普对多晶硅加征关税;SpaceX、特斯拉启动168亿美元Terafab项目;今夜非农数据来袭

比特币矿企转型 AI 的真实成绩单:收入下滑、亏损扩大,但电力资产正在重新估值

8月7日 10:28
比特币矿企转型 AI 的真实成绩单:收入下滑、亏损扩大,但电力资产正在重新估值