informatique:ai_lm:gpu_bench
Différences
Ci-dessous, les différences entre deux révisions de la page.
| Les deux révisions précédentesRévision précédenteProchaine révision | Révision précédente | ||
| informatique:ai_lm:gpu_bench [11/07/2026 20:45] – [--override-tensor] cyrille | informatique:ai_lm:gpu_bench [15/07/2026 12:00] (Version actuelle) – [--ubatch-size] cyrille | ||
|---|---|---|---|
| Ligne 594: | Ligne 594: | ||
| </ | </ | ||
| + | Avec '' | ||
| + | |||
| + | < | ||
| + | # | ||
| + | LLAMA_DIR=" | ||
| + | MODEL_DIR="/ | ||
| + | # https:// | ||
| + | MODEL=" | ||
| + | |||
| + | # | ||
| + | # ne gère pas options multiples pour " | ||
| + | # -b 2048, | ||
| + | # -ub 1024, | ||
| + | # | ||
| + | |||
| + | " | ||
| + | -c 196000 \ | ||
| + | -b 2048 \ | ||
| + | -ub 1024 \ | ||
| + | -ngl 99 \ | ||
| + | --n-cpu-moe 39 \ | ||
| + | --cache-type-k q8_0 --cache-type-v q8_0 \ | ||
| + | --threads 8 \ | ||
| + | --temp 1.0 --top-p 0.95 --top-k 40 --min-p 0.01 --repeat-penalty 1.0 \ | ||
| + | --flash-attn on \ | ||
| + | -npp 512, | ||
| + | -ntg 32,64,128 \ | ||
| + | -npl 1 \ | ||
| + | --output-format md | ||
| + | |||
| + | == Résultats: | ||
| + | |||
| + | llama_batched_bench: | ||
| + | is_pp_shared = 0, is_tg_separate = 0, n_gpu_layers = 99, n_threads = 8, n_threads_batch = 8 | ||
| + | |||
| + | | PP | TG | B | N_KV | T_PP s | S_PP t/s | T_TG s | S_TG t/s | T s | S t/s | | ||
| + | |-------|--------|------|--------|----------|----------|----------|----------|----------|----------| | ||
| + | | 512 | 32 | 1 | 544 | 1.752 | | ||
| + | | 512 | 64 | 1 | 576 | 1.681 | | ||
| + | | 512 | 128 | 1 | 640 | 1.677 | | ||
| + | | 1024 | 32 | 1 | 1056 | 2.124 | | ||
| + | | 1024 | 64 | 1 | 1088 | 2.139 | | ||
| + | | 1024 | 128 | 1 | 1152 | 2.156 | | ||
| + | | 2048 | 32 | 1 | 2080 | 4.304 | | ||
| + | | 2048 | 64 | 1 | 2112 | 4.422 | | ||
| + | | 2048 | 128 | 1 | 2176 | 4.419 | | ||
| + | |||
| + | </ | ||
| ==== --n-cpu-moe ==== | ==== --n-cpu-moe ==== | ||
| Ligne 713: | Ligne 761: | ||
| | | ||
| -p 16384 -n 256 -b 8192 -ub 2560 | -p 16384 -n 256 -b 8192 -ub 2560 | ||
| + | |||
| + | ... --n-cpu-moe 39 | ||
| | n_cpu_moe | n_batch | n_ubatch | test | t/s | | | n_cpu_moe | n_batch | n_ubatch | test | t/s | | ||
| Ligne 723: | Ligne 773: | ||
| | 39 | 8192 | 2560 | tg256 | 38.69 ± 1.52 | | | 39 | 8192 | 2560 | tg256 | 38.69 ± 1.52 | | ||
| - | ... --override-tensor ' | + | ... --n-cpu-moe 39 --override-tensor ' |
| | n_cpu_moe | n_batch | n_ubatch | ot | | n_cpu_moe | n_batch | n_ubatch | ot | ||
| Ligne 729: | Ligne 779: | ||
| | 39 | 8192 | 2560 | token_embd|output_norm=CPU | pp16384 | 1117.62 ± 3.23 | | | 39 | 8192 | 2560 | token_embd|output_norm=CPU | pp16384 | 1117.62 ± 3.23 | | ||
| | 39 | 8192 | 2560 | token_embd|output_norm=CPU | tg256 | 38.65 ± 0.39 | | | 39 | 8192 | 2560 | token_embd|output_norm=CPU | tg256 | 38.65 ± 0.39 | | ||
| + | |||
| + | ... --n-cpu-moe 38 | ||
| + | |||
| + | | n_cpu_moe | n_batch | n_ubatch | test | t/s | | ||
| + | | ---------: | ------: | -------: | --------------: | ||
| + | | 38 | 8192 | 2560 | | ||
| + | | 38 | 8192 | 2560 | tg256 | 41.13 ± 0.15 | | ||
| + | | 38 | 8192 | 2560 | | ||
| + | | 38 | 8192 | 2560 | tg256 | 34.95 ± 1.32 | | ||
| + | | 38 | 8192 | 2560 | pp131072 | | | ||
| + | | 38 | 8192 | 2560 | tg256 | | | ||
| + | |||
| + | ... --n-cpu-moe 38 --override-tensor ' | ||
| + | |||
| + | | n_cpu_moe | n_batch | n_ubatch | ot | ||
| + | | ---------: | ------: | -------: | -------------------------- | -------: | --------------: | ||
| + | | 38 | 8192 | 2560 | token_embd|output_norm=CPU | pp32768 | 1082.00 ± 1.84 | | ||
| + | | 38 | 8192 | 2560 | token_embd|output_norm=CPU | tg256 | 40.96 ± 0.35 | | ||
| + | |||
| + | ... --n-cpu-moe 38 -ot ffn_up_exps=CPU -ot ffn_gate_exps=CPU | ||
| + | |||
| + | | n_cpu_moe | n_batch | n_ubatch | ot | ||
| + | | ---------: | ------: | -------: | -------------------------- | -------: | --------------: | ||
| + | | 38 | 8192 | 2560 | | pp32768 | | | ||
| + | | 38 | 8192 | 2560 | | tg256 | | | ||
| + | |||
| </ | </ | ||
| - | On dirait que llama fait tout seul la sélection des tensors à charger ou pas sur le GPU/CPU : | + | On dirait que llama calcule |
| < | < | ||
| Ligne 775: | Ligne 851: | ||
| load_tensors: | load_tensors: | ||
| ... | ... | ||
| + | </ | ||
| + | |||
| + | === Avec Opencode === | ||
| + | |||
| + | Avec Opencode sur un gros projet Php | ||
| + | |||
| + | Context ~ 36k ~ 42k | ||
| + | |||
| + | '' | ||
| + | |||
| + | < | ||
| + | nvtop memory = 91% | ||
| + | |||
| + | prompt eval time = | ||
| + | eval time = | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | prompt eval time = 7333.79 ms / 4423 tokens ( 1.66 ms per token, | ||
| + | eval time = 3952.75 ms / 111 tokens ( 35.61 ms per token, | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | prompt eval time = 2740.89 ms / 2051 tokens ( 1.34 ms per token, | ||
| + | eval time = 8666.17 ms / 227 tokens ( 38.18 ms per token, | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | </ | ||
| + | |||
| + | '' | ||
| + | < | ||
| + | nvtop memory = 91% | ||
| + | |||
| + | prompt eval time = | ||
| + | eval time = | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | prompt eval time = 8837.18 ms / 6270 tokens ( 1.41 ms per token, | ||
| + | eval time = 1544.96 ms / 48 tokens ( 32.19 ms per token, | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | prompt eval time = | ||
| + | eval time = | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | </ | ||
| + | |||
| + | '' | ||
| + | < | ||
| + | nvtop memory = 92% | ||
| + | |||
| + | prompt eval time = | ||
| + | eval time = 1747.92 ms / 61 tokens ( 28.65 ms per token, | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | prompt eval time = 8109.03 ms / 7356 tokens ( 1.10 ms per token, | ||
| + | eval time = 5224.43 ms / 154 tokens ( 33.92 ms per token, | ||
| + | total time = | ||
| + | | ||
| + | |||
| + | init sampler, took 3.03 ms, tokens: text = 38663, total = 38663 | ||
| + | prompt eval time = 2758.26 ms / 2168 tokens ( 1.27 ms per token, | ||
| + | eval time = 1580.45 ms / 52 tokens ( 30.39 ms per token, | ||
| + | total time = 4338.71 ms / 2220 tokens | ||
| + | | ||
| + | stop processing: n_tokens = 38714, truncated = 0 | ||
| + | |||
| + | init sampler, took 3.42 ms, tokens: text = 44117, total = 44117 | ||
| + | prompt eval time = 3915.89 ms / 2673 tokens ( 1.46 ms per token, | ||
| + | eval time = 2496.57 ms / 78 tokens ( 32.01 ms per token, | ||
| + | total time = 6412.46 ms / 2751 tokens | ||
| + | | ||
| + | stop processing: n_tokens = 44194, truncated = 0 | ||
| + | |||
| + | init sampler, took 2.71 ms, tokens: text = 35046, total = 35046 | ||
| + | prompt eval time = 1804.42 ms / 902 tokens ( 2.00 ms per token, | ||
| + | eval time = | ||
| + | total time = | ||
| + | | ||
| + | stop processing: n_tokens = 35784, truncated = 0 | ||
| </ | </ | ||
informatique/ai_lm/gpu_bench.1783795501.txt.gz · Dernière modification : de cyrille
