[ML INFRASTRUCTURE · FLAGSHIP CASE STUDY]

WebGPU-бэкенд для LLM-инференса

Исходный компактный LLM-движок поддерживал только CPU и Metal (Apple Silicon). Я разработал и встроил третий бэкенд на WebGPU: написал кастомные compute-шейдеры в WGSL, оптимизировал работу с памятью и сделал возможным запуск на любой видеокарте (NVIDIA, AMD, Intel, Apple) в нативе и прямо в браузере.

0.0
tok/s
GTX 1660 Super
decode · batch=1

[01] Сравнение скорости инференса (Token Speed Race)

Замедленная симуляция реального теста генерации токенов (batch=1 decode pass).

Тест: Qwen-0.5B / Llama-1B · Decode Speed
визуализация замедлена для наглядности
CPU Baseline
Intel i7 12-gen · AVX2
0.0tok/s
Metal Backend
Apple M1 Pro · 16 GPU cores
0.0tok/s
WebGPU (Custom Backend)
GTX 1660 Super · WGSL fused
0.0tok/s
llama.cpp (Vulkan)
GTX 1660 Super · C++ Vulkan
0.0tok/s

[02] Полная сводка замеров

Бэкенд / Реализация Аппаратная платформа Скорость (Decode) Относительное ускорение
CPU Baseline Intel Core i7 12-Gen 5.3 tok/s 1.0x
Metal (Original Engine) Apple M1 Pro GPU 43.1 tok/s 8.1x
WebGPU (Мой бэкенд) NVIDIA GTX 1660 Super 87.8 tok/s 16.5x (2.0x vs Metal)
llama.cpp (Vulkan Backend) NVIDIA GTX 1660 Super 109.4 tok/s 20.6x

[03] Поддерживаемые аппаратные платформы

Единый кодовый базис WGSL обеспечивает работу без перекомпиляции под специфические драйверы вендоров.

NVIDIA CUDA/WebGPU
AMD Radeon
Intel Arc & UHD
Apple Silicon
Chrome / Firefox / Edge