ZML 是一个
生产级AI推理编译栈(inference stack),核心目标只有一个:
把AI工作负载从专有硬件中解耦。它不是又一个Python框架,也不是在现有运行时上包一层糖衣。它做的事情是从模型定义直接编译到底层硬件——NVIDIA GPU、AMD加速器、Google TPU、AWS Trainium,全部原生支持。
一句话:Any model, many hardware targets, one codebase, peak performance.

ZML 网站截图
🛠️ 四大硬核特色,每一刀都切在痛点上
① 一次编写,到处编译,零重写
传统路径是”为NVIDIA写一套CUDA,为AMD写一套ROCm,为TPU写一套XLA”——同样的逻辑,三套代码,三个维护地狱。ZML的做法是:你写一次模型逻辑,ZML
编译器直接生成对应硬件的峰值性能代码。换芯片?改个target参数,重新编译,完事。
② 直达金属,拒绝中间商赚差价
ZML的口号很拽,也很实在:
-
Python runtimes? Non, merci.(不,谢谢。)
-
Hidden state? Non, merci.
-
Abstractions overhead? Non, merci.
没有Python GIL拖后腿,没有隐藏的框架状态偷偷吃掉内存,没有层层抽象把性能磨平。ZML从模型直接编译到机器码,model to metal——性能就藏在离硅片最近的地方。
③ 显式、可组合、可预测
ZML的三条设计哲学,堪称基础设施领域的”反魔法宣言”:
-
Explicit over implicit(显式优于隐式):不猜你的意图,不偷偷做优化,一切行为透明可控。
-
Composability over systems(可组合性优于系统):不做大而全的黑箱,而是提供可拼装的原语。
-
Predicability over magic(可预测性优于魔法):性能表现可预期、可复现,不靠”玄学优化”。
对于需要把推理延迟压到极限、把吞吐拉到天花板的生产环境,这种”可控的确定性”比”偶尔爆发的魔法”值钱一万倍。
④ 刚发v2,更强更稳
ZML团队刚刚发布了 ZML/v2,推理栈的成熟度和性能又上了一个台阶。如果你之前关注过这个项目,现在是重新评估的好时机。
🎯 适合谁?
✅ 自建AI推理基础设施的工程师和架构师
✅ 受够了”CUDA lock-in”、想拥抱多硬件生态的团队
✅ 对推理延迟和吞吐有极致要求的生产环境
✅ 相信”性能来自对硬件的精确控制,而非框架的魔法”的系统派开发者
💡 总结
ZML不是给AI应用开发者准备的”易用框架”,它是给想把推理性能榨干、把硬件选择自由夺回的基础设施工程师准备的武器。在这个各家芯片厂商各自圈地的时代,ZML试图用编译器技术打破围墙——你的模型,你的选择,你的性能。