2026 年 9 月 15 日,荷兰埃因霍温。Axelera AI 将一张 PCIe 卡插进了 Dell XE5 服务器的空槽位,卡上那颗 35×35mm 的芯片,开始以 45W 的功耗吞吐 Llama 3 70B 的推理 Token。公司说,同样的 Token 量,显卡要花 6 倍的电。
这话如果经得起独立验证,AI 推理的成本结构就要被改写。
一张 PCIe 卡,三组颠覆数字
Axelera AI 于 2026 年 9 月正式发售其第二代 AI 处理器单元 Europa。它不是 GPU,而是一颗专门为 AI 推理设计的 AIPU(AI Processing Unit),基于三星 5nm 工艺制造,提供三种出货形式:裸芯片、半高半长的 Edge 232p PCIe 卡(单芯片)、全高全长的 Server 250p PCIe 卡(四芯片)。首发即获得 Dell XE5 和 Supermicro 111AD 服务器平台的认证支持。
Europa 的核心规格如下:
- 8 颗第二代 AI 处理核心,基于数字存内计算 (D-IMC) 架构
- 629 TOPS 峰值算力(INT8/INT4/INT16 精度)
- 45W TDP 功耗
- 16 颗 RISC-V 矢量处理核心(片上完成前后处理,不占用主机 CPU)
- 128MB 片上 L2 SRAM + 256-bit LPDDR5,DRAM 带宽 200GB/s
- 单芯片最大 64GB 内存容量,四芯片配置可达 256GB
- 内建 H.264/H.265 视频解码器
- PCIe Gen4 x4 接口
但这些参数不如公司给出的三组对比数字有冲击力:Axelera 宣称 Europa 在每瓦 Token 吞吐量上是 GPU 方案的 6 倍(HPCWire 报道数据);在 Llama 3 系列模型上,性能/价格比达竞品(英伟达 L40 GPU 及 Jetson SoC)的 3 到 6 倍,性能/功耗比达 2 到 3 倍;四芯片配置下对 Llama 3 70B 的优势最为显著。这些数据来自 Axelera 内部测试叠加竞品公开发布的 NIM 基准,目前尚未经第三方独立验证。但即使取最低值 3 倍性价比,也已足够让任何一个运营大规模推理集群的 CTO 停下脚步。
推理主导时代,GPU 的结构性浪费
2025 年,推理已超过训练成为 AI GPU 支出中占比最大的单一用途。多家市场研究机构及行业分析指向同一趋势:推理占 AI 计算总量的比重持续攀升,在生产环境中更是压倒性地主导日常算力消费。这个转变背后的逻辑极为朴素:大模型从「练出来」走向「用起来」,每一次 API 调用、每一段 AI 生成的内容、每一个 Agent 链式推理循环,都是推理计算。训练是一次性的开销,推理是永不停机的账单。
但 GPU 的架构设计天生偏向训练。数千个 CUDA 核心全开时的矩阵乘法吞吐是训练所需的核心能力,但在推理场景中,尤其当 LLM 需要逐 Token 自回归生成时,真正的瓶颈不在算力,而在显存带宽和 KV Cache 容量。一张 H100 在跑单用户低延迟推理时,利用率可能只有 20% 到 30%。你花几万美元买来的算力,大部分在等待数据搬运。
这就是 Axelera 要攻的突破口:当 GPU 的结构性浪费在推理场景中被放大到极致,专用芯片就有了弯道超车的空间。
D-IMC 技术:算得快,但搬得更少
Axelera 的核心技术是数字存内计算(Digital In-Memory Compute)。这个思路在学术界已存在十多年,但很少被商业化到 Europa 这种量级。
D-IMC 的核心逻辑很简单:把矩阵向量乘法就地放在 SRAM 存储单元内部完成,而不是把数据从存储器搬到运算单元再写回去。Axelera 宣称每颗核心可实现 50+ TOPS 的 INT8 计算效率(FP32 等效精度达 99.9%,无需重训练),芯片级能效达 15 TOPS/W。正是这个数字让 Europa 在 45W 功耗下实现了 629 TOPS。
与第一代 Metis(214 TOPS,4 到 8W 功耗)相比,Europa 的进化是全方位的:AI 核心数翻倍至 8 个,片上 L2 缓存提升至 128MB(约 3 倍),首次集成 16 颗 RISC-V 矢量核心承担前后处理,内置硬件视频解码器。对一个工业视觉流水线场景来说,Europa 可以独立完成从视频流解码到 AI 推理再到输出结果的完整链路,不再需要主机 CPU 介入。
「我们想把尽可能多的处理放到芯片上完成,这样客户不需要重写他们的主机应用。」—— Alexis Crowell,Axelera AI CMO
这不仅仅是算力提升。它意味着更低的主机配置要求、更低的系统集成复杂度、更快的部署周期。一张 PCIe 卡插进现有服务器,装好 Voyager SDK 就能跑起来。Voyager 工具链同时支持 Metis 和 Europa,一套 YAML 管道配置文件两端通用。2026 年 7 月,Axelera 还推出了 Voyager Wingman(Agentic 开发层)和 AxeleraScript 模型编译器,进一步拓宽了兼容模型的范围。据 SiliconANGLE 报道,开发者可以用自然语言描述所需的计算机视觉流水线,Wingman 会自动生成可运行的管道并建议编译器设置。
对标的不是 H100,是 L40 和 Jetson
Europa 的真正对手是谁?
CRN 报道中,Axelera CMO Alexis Crowell 挑明了答案:所有对比都针对英伟达最近几代边缘计算产品。具体来说,是 L40 GPU 和 Jetson SoC 系列。Europa 的策略不是在训练市场挑战 Blackwell 或 H100,那个领域被 CUDA 生态圈和 InfiniBand 网络组成的系统性壁垒牢牢锁住。它瞄准的是英伟达相对薄弱但需求激增的边缘推理阵地。
Axelera 提供的对比图表显示,在 Llama 3 8B、Llama 3 70B 和 Llama 3.2 11B Vision 模型上,Europa 的性能/价格比达竞品的 3 到 6 倍。其中四条 PCIe 卡组成四芯片 256GB 配置后,跑 Llama 3 70B 时的性价比优势最为突出。性能/功耗比则是 2 到 3 倍。
「AI 工厂」是另一个新战场。Crowell 表示已收到专门针对公司技术的 AI 工厂提案请求。AI 工厂,即专为大模型推理和微调设计的数据中心,对每 Token 成本极度敏感。在一个机架功耗上限已成为硬约束的时代,Europa 的 45W/卡能效比是它进入这个市场最有力的敲门砖。
PCIe Gen4 的「插得进去」哲学
Europa 选择了 PCIe Gen4 而非最新的 Gen5。这不是技术上的妥协,而是一个精明的商业决策。
「我们要能插进尽可能多的系统。」Crowell 的解释坦率到近乎直白。全球绝大多数在役服务器和工作站都配备 PCIe Gen4 插槽。选择 Gen4,意味着存量设备无需更换整机即可通过一张加速卡获得 AI 推理能力。Axelera CEO Fabrizio del Maffeo 此前说过:我们希望集成商能把卡插进电脑、装好软件、直接跑起来。
这种「插得进去」的哲学对应的是 AI 推理市场的一个现实:愿意为新算力花大价钱的是少数,多数客户希望以最低的升级成本获得尽可能多的性能提升。Europa 精确卡位在这个需求点上。
与之配套的是统一的 Voyager SDK。Axelera 200 多人的团队中一半从事软件开发,这意味着软件栈是公司的第二核心能力。一套工具链覆盖 Metis 和 Europa 两条产品线,从 6W 的低功耗模组到 180W 的四卡服务器,客户部署推理流水线的学习成本被压到最低。
欧洲特色的 AI 芯片路线
Axelera 的总部位于埃因霍温,与光刻机巨头 ASML 同城。欧洲半导体产业的历史证明了一条规律:不追逐大规模通用计算芯片,而是在精密设备和差异化专用芯片上建立壁垒。NXP(汽车芯片)、Infineon(功率半导体)、ASML(光刻机)都遵循这条路径。Axelera 没有例外。
2025 年 3 月,Axelera 获得 EuroHPC JU 的 DARE 项目 6160 万欧元拨款,用于开发 Titania AI 推理 chiplet(路透社报道)。2026 年 2 月,公司完成超过 2.5 亿美元 C 轮融资,由 Innovation Industries 领投,BlackRock、SiteGround Capital、Samsung Catalyst Fund、CDP Venture Capital 等参投。这不仅是欧洲 AI 半导体公司迄今最大的一轮融资,也是 Axelera 从初创走向规模化的重要信号。
截至发稿,Axelera 已拥有超过 600 家客户(StorageReview 报道数据),覆盖电信、航空航天、国防与公共安全、工业制造、零售、企业 IT 等领域。从一个 2021 年成立的埃因霍温初创公司到 600 家客户的全栈推理芯片公司,这个速度值得注意。
数据需要验证,但趋势已经浮现
需要明确一点:以上所有效率对比数据均来自 Axelera 内部测试,尚未有独立第三方发布 Europa 的实测结果。这在半导体行业是惯例,但 Europa 瞄准的是英伟达的底盘,独立验证是它必须闯过的关卡。
如果在实际部署中性能/功耗/成本优势能稳定达到宣称水平(3 到 6 倍性价比、2 到 3 倍能效比、6 倍 Token 每瓦吞吐量),Europa 将改写边缘推理市场的基本格局。如果实际表现打折扣,它将成为又一个纸面参数漂亮、落地平庸的案例。
第一批 Europa PCIe 卡已于 2026 年上半年开始出货。在这之前,AI 芯片行业的竞争按照英伟达的时间表运转。在这之后,至少有一家欧洲公司让客户多了一个备选项。
对于一个预计从 2025 年的 1060 亿美元增长到 2030 年的 2550 亿美元(MarketsandMarkets 数据)、年增长率 19.2% 的 AI 推理市场来说,多一个选项,可能意味着整个供应链的权力结构开始松动。
当 GPU 的训练光环褪去,推理的灯光下,算力的度量单位不是 TOPS,是 Token per dollar。






快报