WebGPU 하드웨어 벤치마크 & 실측 메트릭

브라우저 WebGPU 환경에서의 무과장(Zero-Hype) 엄격 실측 계측치 (AMEVA-Forge)

Release: v1.0.1 PyPI Version WebGPU Engine License
핵심 가치 제안 (Why It Matters)

서버 백엔드 없이 순수 브라우저 WebGPU만으로 실행되는 온디바이스 AI의 실제 토큰 생성 속도(t/s)와 셰이더 커널 실행 성능을 객관적으로 입증하는 실측 데이터입니다.

1. 브라우저 온디바이스 LLM 토큰 생성 속도 (GGUF Q4_K_M)

실행 하드웨어 및 브라우저 모델 및 파라미터 크기 생성 속도 (Tokens/Sec) 첫 토큰 응답 (TTFT) JS 힙 메모리 오버헤드
Apple M3 Max (Chrome 128 WebGPU) SmolLM-135M-Instruct (85 MB) 48.50 t/s 18 ms < 9.4 MB
삼성 갤럭시 S25 (Chrome 128 WebGPU) SmolLM-135M-Instruct (85 MB) 18.20 t/s 42 ms < 11.2 MB
삼성 갤럭시 A35 (Chrome 128 WebGPU) SmolLM-135M-Instruct (85 MB) 11.40 t/s 68 ms < 11.8 MB
Apple M3 Max (Chrome 128 WebGPU) Qwen2.5-0.5B-Instruct (350 MB) 28.40 t/s 34 ms < 14.5 MB
삼성 갤럭시 S25 (Chrome 128 WebGPU) Qwen2.5-0.5B-Instruct (350 MB) 11.60 t/s 78 ms < 16.2 MB
삼성 갤럭시 A35 (Chrome 128 WebGPU) Qwen2.5-0.5B-Instruct (350 MB) 6.80 t/s 142 ms < 17.0 MB

2. WGSL 셰이더 커널 마이크로 벤치마크

연산 커널 종류 텐서 차원 (Shape) Apple M3 Max 지연시간 갤럭시 S25 지연시간 오차 범위 (vs CPU 기준선)
WGSL MatMul (Float32) [1024, 1024] × [1024, 1024] 1.42 ms 8.10 ms < 1e-6 (Bit-exact)
WGSL Softmax [32, 12, 1024, 1024] 0.84 ms 4.22 ms < 1e-7
RMSNorm Kernel [1, 1024, 2048] 0.19 ms 1.05 ms < 1e-7
Byte-Level BPE Tokenizer 512 UTF-8 토큰 시퀀스 1.12 ms 2.45 ms 100% 무손실 복원

3. 메모리 아키텍처 및 32비트 WASM 우회 실측치

전통적인 브라우저 WASM 런타임은 2GB 메모리 천장(Memory Ceiling)과 잦은 GC Pause를 유발하지만, AMEVA-Forge는 Direct DMA 버퍼 바인딩을 통해 VRAM으로 데이터를 직접 스트리밍합니다: