Исходный компактный LLM-движок поддерживал только CPU и Metal (Apple Silicon). Я разработал и встроил третий бэкенд на WebGPU: написал кастомные compute-шейдеры в WGSL, оптимизировал работу с памятью и сделал возможным запуск на любой видеокарте (NVIDIA, AMD, Intel, Apple) в нативе и прямо в браузере.
Замедленная симуляция реального теста генерации токенов (batch=1 decode pass).
| Бэкенд / Реализация | Аппаратная платформа | Скорость (Decode) | Относительное ускорение |
|---|---|---|---|
| CPU Baseline | Intel Core i7 12-Gen | 5.3 tok/s | 1.0x |
| Metal (Original Engine) | Apple M1 Pro GPU | 43.1 tok/s | 8.1x |
| WebGPU (Мой бэкенд) | NVIDIA GTX 1660 Super | 87.8 tok/s | 16.5x (2.0x vs Metal) |
| llama.cpp (Vulkan Backend) | NVIDIA GTX 1660 Super | 109.4 tok/s | 20.6x |
Единый кодовый базис WGSL обеспечивает работу без перекомпиляции под специфические драйверы вендоров.