8美元芯片跑通2890万参数,Google的存算分离改写边缘AI

2026.07.26 13:15
乌克兰独立开发者slvDev在GitHub开源了esp32-ai项目,成功在售价仅8美元的ESP32-S3微控制器上运行了一个2890万参数的语言模型,每秒生成9.5个词。这项突破的核心来自Google Gemma模型的Per-Layer Embeddings技术,将大部分参数存放在闪存而非内存中,让边缘AI的算力成本曲线出现了一次根本性下移。

你敢信?一个卖8美元的芯片,正在本地运行2890万个参数的语言模型。不联网,不传数据,不依赖任何云端GPU,每秒生成9.5个词,全部在芯片上完成。

在此之前,同类芯片上跑过的最大语言模型只有26万个参数。2890万,是它的111倍。而两者之间的时间差,不过两三年。

这不是大厂实验室的作品。这是乌克兰独立开发者Slava S.(GitHub: slvDev)一个人写出来的。项目叫esp32-ai,上线后在GitHub上已获得超过490个Star。而让这一切成为可能的,是Google在Gemma 3n和Gemma 4中引入的一项非主流技术——Per-Layer Embeddings(PLE),它被这位开发者移植到了芯片的内存层级上,然后发现,这条路走得通。

当大模型遇到8美元芯片

ESP32-S3是乐鑫科技(Espressif)推出的AIoT微控制器,双核Xtensa LX7处理器,主频240MHz,内置512KB SRAM,外挂8MB PSRAM和16MB闪存。整块芯片的批量采购价在8美元左右。乐鑫的全球累计芯片出货量已超过10亿颗,是物联网领域最普及的芯片平台之一。

在传统认知里,这种芯片能跑个简单的关键词唤醒或手势识别就已经是极限。但slvDev的项目让这个认知失效了。

他的配置是这样的:核心推理模块(dense core)仅55.9万参数,4-bit量化后仅273KB,刚好塞进512KB的SRAM;输出头(output head)约310万参数,在PSRAM中流式处理;而最大的一块,2500万参数的嵌入查找表(PLE table),直接放在16MB闪存中,按需读取。

最终模型在4-bit量化后总大小仅14.9MB,写入一个自定义的15.6MB闪存分区,还有685KB的富余空间。在ESP32-S3上,它生成文本的端到端速度约为9.5 tok/s,纯计算速度9.72 tok/s,每一步模型推理耗时约102.9毫秒。

这个数字意味着什么?你读这句话的时间里,这个8美元的芯片已经生成了十几个词。

为什么以前做不到,现在可以了

内存瓶颈:AI在边缘端的死穴

理解这个突破的意义,首先要理解一个微控制器的内存有多抠。

ESP32-S3的SRAM只有512KB。这是什么概念?一张普通手机照片的JPEG压缩文件,通常就有200到300KB。而一个最小可用的大语言模型,仅参数本身就需要几十MB到几百MB。这就是为什么此前的记录,在类似芯片上运行语言模型,只有26万参数。不是没人想做大,是物理上放不下。

传统方案的思路是把模型变小:剪枝、量化、蒸馏……但参数少到一定程度,语言能力就断崖式下跌。26万参数能生成几个词,但谈不上连贯的叙事。

关键突破:Per-Layer Embeddings的存算分离

slvDev找到的解法,来自Google Gemma 3n和Gemma 4中的Per-Layer Embeddings(PLE)技术。

要理解PLE,先理解一个大语言模型里参数是怎么分布的。一个典型Transformer中,词嵌入表(embedding table)占了参数的绝大部分。但这部分参数的工作方式和其他层不同,它不参与计算,只是被查表读取。模型在推理时,不是用整个嵌入表做矩阵运算,而是根据当前token的索引,从表中取出对应的那几行向量。

Google的PLE设计,正是把这一层做到了极致。它把嵌入表做得更大、更深,但让它完全驻留在慢速存储中,只按需读取极少量的行。在esp32-ai的案例中,每次推理只需要从闪存中读取约6行数据,总计约450字节。

这就是存算分离的极致版本:2500万参数的嵌入表塞在闪存里,每次推理只读450字节;而真正参与计算的55.9万参数核心,放在SRAM中。占总量86%的参数,对推理时间的影响微乎其微。

在带宽测试中,闪存随机读取的延迟是每行20.3微秒,6行合计约0.12毫秒,只占每次推理总内存时间的0.7%。换句话说,那2500万参数的大块头,在推理成本上几乎等于免费。

数据验证:不是有就行,而是真的好

如果只是勉强能跑,这篇文章可能不值得写。但slvDev在RESULTS.md中提供了完整的消融实验数据,证明了PLE不仅让模型塞得进去,而且表现更好。

在32,768词汇量的配置下,采用PLE的模型(28.9M参数)在困惑度(perplexity)上比基线模型(3.7M参数,无PLE)降低了9.3%。在4-bit量化后,PLE的优势不仅没有缩水,反而保持或增强了126%到121%。

这让PLE在边缘AI场景中有了一个独特的优势:模型越大,收益越高。因为大词汇表意味着嵌入表更胖,而PLE的存算分离设计,正好在这种胖表场景中发挥最大效率。4-bit量化的实验进一步证实:嵌入表的冗余结构天然抗量化损伤,比小模型的密集参数更鲁棒。

坦诚的边界:它能做什么,不能做什么

这篇文章不想制造边缘AI取代GPU的幻觉。slvDev本人也在项目文档中写得很清楚。

这个模型是在TinyStories数据集上训练的,这是微软研究院2023年发布的一个合成数据集,用GPT-3.5和GPT-4生成了一批仅包含3到4岁儿童词汇量的短篇故事。TinyStories的初衷是回答一个问题:语言模型能小到什么程度,还能说出连贯的英语?

所以,这个模型能写短篇童话故事,而且写得还不错。实测生成案例:

Once upon a time, there was a little girl named Lily. She loved to play outside in the sunshine. One day, she saw a big tree with a hole in it. She was curious and wanted to see what was inside.

但它不能回答事实问题,不能写代码,不能遵循复杂指令,不能做多轮对话。这些限制来自推理核心(那55.9万参数的小模型)的能力上限,而PLE的存算分离技术并没有改变这个上限。它只是让这个上限在几乎不增加成本的前提下,达到了当前硬件条件下的最优解。

边缘AI的成本悬崖正在到来

什么是足够好的AI

从2022年底ChatGPT引爆大模型浪潮以来,行业的主流叙事一直是越大越好:千亿参数、万亿参数、十万卡集群、千亿美元算力投入。每一次Scaling Law的跃迁,都伴随着指数级增长的成本。

但一个被忽视的事实是:大量实际应用场景不需要一个万亿参数模型。智能家居设备需要的是打开客厅灯和空调调到26度之间的语义理解,而不是写一首十四行诗。工业传感器需要识别异常振动模式,而不是讨论哲学。可穿戴设备需要实时监测心率并给出简短建议,而不是生成一篇论文。

这些场景的共同特征是:任务简单、实时性要求高、隐私敏感、成本敏感。而今天的大模型部署范式,数据上传到云端、推理后返回结果,在这类场景中恰恰是性价比最低的。

8美元芯片的鲶鱼效应

全球边缘AI市场在2025年已达到约250到300亿美元的规模,预计到2035年将增长到1700到2250亿美元,年复合增长率在21%到32%之间。但这个市场此前的主流叙事,是如何在边缘设备上跑更小的模型。esp32-ai提供了一个反向思路:如何在更便宜的设备上跑更大的模型。

这两者的区别是根本性的。前者意味着边缘设备还是不够强,所以模型要妥协;后者意味着模型可以很强,因为存储成本已经足够低。

乐鑫芯片的全球累计出货量已超过10亿颗,这意味着它的成本已经被摊薄到极致,单颗8美元甚至更低。它的生态已经成熟,Arduino、ESP-IDF、MicroPython三大开发环境齐备。它的功耗已经被优化到毫瓦级别。如果一个28.9M参数的模型能在这样的平台上流畅运行,那么一个商业级的边缘AI产品,硬件成本可能只需要几美元到十几美元。

谁在受益,谁在被挑战

这项技术最直接的受益者,是智能家居、可穿戴设备、工业物联网、消费电子等领域的硬件厂商。他们不需要再为AI能力支付高额的云端推理费用,也无需为设备配备昂贵的专用AI芯片。一个普通的ESP32模块,加上一个微型OLED屏幕,就能变成一个本地AI终端。

被挑战的,则是云端推理这条商业路径的底层逻辑。如果边缘设备能在本地处理大部分简单的语言任务,那么云端推理的价值就只剩下复杂任务和模型更新,而这两部分的市场规模,可能远小于简单任务乘以海量设备的组合。

但也要看到,目前的PLE方案仍然有明确的边界。ESP32-S3的闪存只有16MB,即便用PLE技术,能塞进去的模型规模仍然受限于物理存储空间。此外,闪存的随机读取延迟(20.3微秒)虽然对于当前配置可以忽略,但如果PLE表的维度或层数继续增加,这个延迟会线性增长。slvDev在文档中也明确标注了这一点。

AI的下沉刚刚开始

esp32-ai项目真正的价值,不在于它做到了什么,而在于它证明了什么。

它证明了,AI的下沉不需要等待专用芯片的成本下降,也不需要等待模型架构的彻底革命。Google已经给出了一个被大多数人忽视的优雅方案,Per-Layer Embeddings。而一位独立开发者用30次commit,就把它移植到了8美元的芯片上,跑出了每秒9.5个词的生成速度。

它证明了,在AI产业越大越好的主流叙事之外,还有另一条路正在被悄然铺开:让AI的能力渗透到每一个微小的设备中,以极低的成本,做足够好的事情。

当10亿颗乐鑫芯片中的一部分开始拥有本地语言能力,当你的智能音箱、你的手表、你的家电不再需要联网就能理解你的指令,那种无处不在的AI才真正开始变得可能。

而这一切的起点,只是一个人和一个8美元芯片的周末项目。

AI的尽头不只有千亿参数的星辰大海,还有8美元芯片上的涓涓细流。

作品声明:内容由AI生成