Benchmarks & Profiling
Deterministic latency and VRAM allocation statistics
1. Flagship Real-Device Samsung Galaxy S25 (Snapdragon 8 Elite / Adreno 830)
Empirical on-device inference measured on Samsung Galaxy S25 under Android 15 Termux (Qwen2.5-0.5B-Instruct GGUF Q4_K_M):
| Hardware Mode | CLI Configuration | Prompt Speed | Generation Speed | VRAM / Memory | Status |
| Vulkan GPU Full Offload |
--device vulkan -ngl 32 -fa 0 |
30.9 tokens/sec |
27.1 tokens/sec |
1,721 MiB |
PASS (Optimal) |
| Pure CPU NEON |
--device cpu -t 4 |
19.8 tokens/sec |
21.2 tokens/sec |
620 MiB |
PASS |
2. Samsung Galaxy S21 (Exynos 2100 / ARM Cortex-X1 & A78)
| Hardware Mode | Execution Path | Prompt Speed | Generation Speed | Status |
| Pure CPU NEON Big-Core |
--device cpu -t 4 |
72.0 tokens/sec |
28.5 tokens/sec |
PASS (Fleet Record) |
3. Samsung Galaxy A35 (Exynos 1380 / Mali-G68 GPU)
| Interface Mode | Model | Prompt Speed | Generation Speed | Status |
CLI Mode (termux-llama run) |
Qwen 2.5 0.5B Instruct |
13.0 tokens/sec |
3.9 tokens/sec |
PASS (Medium MatMul) |
Python SDK (LlamaRuntime.generate) |
Qwen 2.5 0.5B Instruct |
13.9 tokens/sec |
8.5 tokens/sec |
PASS |
4. Samsung Galaxy S20+ (Snapdragon 865 / Adreno 650)
| Model | Quantization | Cold Warmup | Prompt Speed | Generation Speed |
| Llama 3.2 1B Instruct |
Q4_K_M (800 MB) |
1.8s |
18.2 tokens/sec |
16.5 tokens/sec |
| Llama 3.2 3B Instruct |
Q4_K_M (1.92 GB) |
2.3s |
16.2 tokens/sec |
10.2 tokens/sec |