Benchmarks & Profiling

Deterministic latency and VRAM allocation statistics

1. Flagship Real-Device Samsung Galaxy S25 (Snapdragon 8 Elite / Adreno 830)

Empirical on-device inference measured on Samsung Galaxy S25 under Android 15 Termux (Qwen2.5-0.5B-Instruct GGUF Q4_K_M):

Hardware ModeCLI ConfigurationPrompt SpeedGeneration SpeedVRAM / MemoryStatus
Vulkan GPU Full Offload --device vulkan -ngl 32 -fa 0 30.9 tokens/sec 27.1 tokens/sec 1,721 MiB PASS (Optimal)
Pure CPU NEON --device cpu -t 4 19.8 tokens/sec 21.2 tokens/sec 620 MiB PASS

2. Samsung Galaxy S21 (Exynos 2100 / ARM Cortex-X1 & A78)

Hardware ModeExecution PathPrompt SpeedGeneration SpeedStatus
Pure CPU NEON Big-Core --device cpu -t 4 72.0 tokens/sec 28.5 tokens/sec PASS (Fleet Record)

3. Samsung Galaxy A35 (Exynos 1380 / Mali-G68 GPU)

Interface ModeModelPrompt SpeedGeneration SpeedStatus
CLI Mode (termux-llama run) Qwen 2.5 0.5B Instruct 13.0 tokens/sec 3.9 tokens/sec PASS (Medium MatMul)
Python SDK (LlamaRuntime.generate) Qwen 2.5 0.5B Instruct 13.9 tokens/sec 8.5 tokens/sec PASS

4. Samsung Galaxy S20+ (Snapdragon 865 / Adreno 650)

ModelQuantizationCold WarmupPrompt SpeedGeneration Speed
Llama 3.2 1B Instruct Q4_K_M (800 MB) 1.8s 18.2 tokens/sec 16.5 tokens/sec
Llama 3.2 3B Instruct Q4_K_M (1.92 GB) 2.3s 16.2 tokens/sec 10.2 tokens/sec