一部手机就是一个AI红队,Nightcrawler做到了

2026.08.04 09:21
2026年4月,Garage HQ发布了Nightcrawler,一个完全离线的AI渗透测试工具,核心硬件平台仅仅是一部手机。12亿参数的小模型跑在手机GPU上,内置24,956条CVE数据库和27个Playbook,可以在无人干预的情况下自主完成漏洞扫描、利用链编排和渗透测试全流程。这不仅是技术突破,更标志着安全攻防的民主化进入新阶段,当一部手机可以成为一个红队时,防御者需要重新思考一切。

2026年7月,一部手机静静地躺在测试者的口袋里。没有联网,没有调用任何云端API,它正在对周围的企业Wi-Fi网络执行一次完整的渗透测试,扫描主机、枚举端口、匹配CVE漏洞、执行多步骤利用链。这一切由手机上本地运行的一个AI模型自主决策,不需要人类介入,不需要向云端发送任何数据。

这不是科幻电影。这是Garage HQ在GitHub上发布的开源项目Nightcrawler展示的真实能力。

一部手机,一个完整的红队

2026年4月29日,Garage HQ在GitHub上发布了Nightcrawler v0.1.0,MIT开源许可。它的核心硬件平台是一部手机。

这个项目的引擎是LFM2.5-1.2B-Instruct-Heretic,一个12亿参数的语言模型,运行在手机的GPU上,通过OpenCL加速。在参考测试设备OnePlus 8(骁龙865、Adreno 650)上,prompt处理速度约为每秒115个token,生成速度约为每秒13个token。这个速度远远不及云端前沿模型,但足以支撑一个自主安全Agent的完整决策循环。

Nightcrawler内置了24,956条CVE漏洞数据库,支持版本感知匹配,以及27个漏洞利用Playbook,可以自动编排多步骤攻击链路。在超过72小时的跨网络自主运行测试中,它交出了这样的成绩单:每网络发现30+台主机、自主执行2,000+条命令、发现10+个漏洞、成功执行6+个Playbook。Agent的内存消耗始终稳定在35-50MB,没有出现内存泄漏。

整个系统完全离线运行。不需要互联网连接,不需要调用任何云端API。这意味着它可以部署在任何物理位置,不存在网络出口被封锁的问题,也不存在数据被截获或泄露的风险。

12亿参数,凭什么?

安全行业长期存在一个默认假设:AI驱动的安全测试必须依赖云端大模型。GPT-4、Claude、Gemini,这些参数规模在数千亿的前沿模型,被认为是真正能理解安全任务的底线。Nightcrawler用12亿参数挑战了这个假设。

设计者选择了一条截然不同的路线。不追求模型的通用智能,而是将模型深度嵌入一个高度结构化的工具链中。CVE数据库负责知道漏洞,Playbook负责知道利用方法,模型只需要做一件事,在正确的时间选择正确的工具。

这种小模型加结构化工具链的架构,与2025-2026年学术界和产业界的一个趋势不谋而合:小型语言模型在特定领域的表现正在逼近甚至超越大模型。

Stratosphere实验室开发的Hackphyr,基于7B参数的Zephyr模型微调,在网络安全环境中达到了与GPT-4接近的表现水平。Novee Labs的研究更直接:通过对27B参数的开源模型进行微调,在XSS漏洞利用任务上,以约40%的成本实现了前沿模型约80%的exploit率。Novee的4B参数模型在真实浏览器漏洞利用测试中甚至达到了90%的准确率,超过Claude 4 Sonnet约55%。

Nightcrawler将这个趋势推到了极致:12亿参数,一部手机,完整的渗透测试循环。

门槛正在消失

Nightcrawler最具冲击力的意义,不是技术指标,而是它正在消除的门槛。

传统渗透测试的成本极高。一次企业级红队评估,费用通常在数万到数十万美元,需要多名资深安全专家,携带专用设备,提前数周准备。即便是AI辅助的渗透测试工具,也大多需要云端API调用、GPU服务器或专业工作站。

Nightcrawler把这一切压缩到一部手机里。一台可以运行它的Android设备,加上Kali NetHunter和Magisk Root,任何人都可以组装一个AI驱动的渗透测试平台。这个平台不需要云服务订阅,不需要高速网络,甚至不需要操作者具备专业知识。Agent自主决策,用户只需部署。

这种民主化的正面价值显而易见。中小型企业、安全咨询公司、蓝队团队可以以极低成本获得持续的安全测试能力。许多企业受限于预算,每年只做一次渗透测试,而Nightcrawler意味着可以做到7×24小时持续测试。

但硬币的另一面同样尖锐。当一部手机就能执行完整的红队操作时,攻击者的门槛也被同步拉低。项目方在README中明确声明仅用于授权测试,并设置了双层安全防护,但开源工具的双刃剑属性是无法回避的。

安全架构与真实局限

Nightcrawler的安全设计值得仔细审视。项目文档中描述了两层防御机制。

第一层是Scope Proxy,对每一条即将执行的命令进行网络边界验证,确保操作不超出定义的目标范围。第二层是Command Filter,拦截破坏性操作并实施速率限制。此外,项目还提供了一个Web仪表盘,展示所有命令、发现和Agent决策记录,并支持C2控制,可以拉黑主机、强制切换阶段、暂停恢复、注入命令。

部署门槛本身也是一道天然屏障。需要Kali NetHunter、Magisk Root权限、12GB以上RAM(模型约占用1.3GB,Android系统约占用4GB),以及特定型号的Android设备。这远不是一键安装的脚本小子工具。

但诚实地讲,v0.1.0版本存在明显的局限性。没有公开的独立评测数据,成功率、误报率、真实环境下的端到端可靠性,目前只有项目方自行报告的72小时测试数据。Scope Proxy能否抵御来自扫描过程中读取的banner信息的Prompt Injection攻击,目前没有公开验证。13 token/s的生成速度,在面对复杂多层网络环境时,其决策质量是否足够,仍需更多测试。

项目方在GitHub上公开承认了当前的瓶颈:模型命令格式合规率仅约50%,目标是提升到85%以上。这也是他们正在寻求社区帮助的方向,包括模型微调、新Playbook开发、CVE数据库扩展。

这不是孤立的信号

Nightcrawler的出现,放在2026年AI安全的大背景下,并非孤立事件。

2026年4月,Anthropic的Mythos Preview在主流操作系统和浏览器中发现了数千个高危漏洞,其能力远超此前公开的任何模型。英国AI安全研究所的评估确认,Mythos在CTF挑战和多步骤网络攻击模拟中代表了质的飞跃。

2025年底,XBOW的自主Agent登顶HackerOne美国区排行榜,随后又达到全球第一,在数千名人类安全研究员的竞争中胜出。它累计提交了超过1,060个漏洞,执行了长达48步的利用链,将一名资深渗透测试人员40小时的工作压缩到了28分钟。

学术界方面,ARACNE在2025年实现了60%的成功率对抗自主防御Agent,PentestAgent在AsiaCCS 2025发表,Red-MIRROR提出了带反思验证的多智能体架构。2026年的ICLR上,Cyber-Zero展示了无需运行时环境的网络安全Agent训练方法。

这些事件共同指向一个方向:AI渗透测试正在从辅助工具向自主Agent演进。而Nightcrawler给出的答案是,这种演进不仅发生在云端,也可以发生在你的口袋里。

安全测试的口袋化意味着什么?

安全测试的物理形态正在被重新定义。当一个安全Agent可以装进口袋、离线运行、自主决策时,传统的安全实验室概念正在瓦解。未来的安全测试可能不是在专门的机房里进行,而是在目标网络的物理边界内,由一部手机完成。

小型模型加结构化工具链的架构范式,正在被证明是一条可行的道路。在Scaling Law遭遇瓶颈的今天,Nightcrawler展示了另一种可能性:不是模型越大越好,而是模型与工具链的契合度越深越好。Novee的4B模型在特定任务上击败Claude 4 Sonnet,Nightcrawler的1.2B模型在手机上跑通完整渗透测试,这些信号叠加起来,暗示着一个更深刻的趋势:足够好的模型加上足够深的工具链,可能比更大的模型更实用。

最值得警惕的是,当一部手机可以成为一个红队时,防御者需要重新思考可信边界。未来的网络攻击可能不再来自某个IP段、某个APT组织,而是来自一部被带入办公楼的手机。Nightcrawler的仪表盘默认伪装成nginx服务器,对目标网络返回空404,这种隐身设计本身就是对当前防御体系的一种无声拷问。

安全攻防的军备竞赛,正在从数据中心的GPU集群,移向每个人口袋里的那部手机。Nightcrawler只是开了一扇门,问题在于,谁先走进来。

作品声明:内容由AI生成