Sources & chiffres

D'où viennent les débits annoncés

Aucun chiffre de ce guide n'est inventé. Voici les mesures publiées, leurs conditions de test, le plafond théorique, et les points qui restent incertains.

La règle appliquée

Pour une machine lente, on préfère toujours sous-promettre. Les fourchettes du guide sont donc construites en prenant les mesures publiées les plus basses quand plusieurs sources se contredisent, et en se limitant aux chiffres obtenus avec Ollama (et non avec llama.cpp, plus rapide de 10 à 20 % sur le même matériel). Les mesures faites avec un ventilateur, un SSD et une alimentation officielle sont retenues ; celles faites avec un Pi surchauffé ou sur microSD ne le sont pas.

1.Le plafond théorique (bande passante mémoire)

Générer un jeton oblige à relire une fois la totalité des poids du modèle depuis la mémoire vive. Le débit maximal possible n'est donc pas une question de puissance de calcul mais de bande passante :

Pi 5 : LPDDR4X-4267 sur un bus de 32 bits
       4267 MT/s × 32 bits ÷ 8 = 17,1 Go/s

jetons/s (plafond absolu) ≈ 17,1 ÷ taille du modèle en Go
  modèle de 2,0 Go  ->  8,5 j/s maximum
  modèle de 2,5 Go  ->  6,8 j/s maximum
  modèle de 5,2 Go  ->  3,3 j/s maximum

Fiche technique officielle du Pi 5 (mémoire LPDDR4X-4267, BCM2712)

2.Les mesures réelles (Ollama, Pi 5, CPU)

2.1 Jeff Geerling / ai-benchmarks — le jeu de données le plus complet

Mesures Ollama sur Pi 5, CPU uniquement, Pi OS Bookworm, plusieurs firmwares testés (les écarts entre firmwares montrent la sensibilité de la machine aux réglages mémoire). Source : github.com/geerlingguy/ai-benchmarks — issue #7 (benchmark Pi 5 16 GB) et, pour la comparaison 8 Go, github.com/geerlingguy/ollama-benchmark — issue #1.

MachineModèle (Ollama)Débit mesuréPuissance
Pi 5 16 Gollama3.2:3b4,51 – 4,88 j/s11,0 – 11,9 W
Pi 5 16 Gollama3.1:8b1,87 – 2,17 j/s10,8 – 11,6 W
Pi 5 16 Gollama2:13b1,20 – 1,36 j/s10,5 – 10,9 W
Pi 5 8 Gollama3.2:3b4,61 j/s13,9 W
Pi 5 8 Gollama3.1:8b1,99 j/s13,2 W
Pi 5 8 Gollama2:13bDNF (ne rentre pas)—

C'est de cette source que viennent, par analogie de taille, les fourchettes du guide pour un 8B (1,5–2,5 j/s) et pour un 3B (4–5,8 j/s). À noter : un 13B ne rentre pas dans 8 Go — DNF signifie « Did Not Finish », c'est-à-dire échec de chargement, et non lenteur.

2.2 DFRobot — comparaison multi-modèles sur Pi 5 8 Go

Ollama, Pi 5 8 Go, Raspberry Pi OS. dfrobot.com — Performance Analysis of SLM on Raspberry Pi 5

ModèleTailleDébit mesuré
qwen2.5:0.5b-q4398 Mo19,4 j/s
phi3.5:3.8b-q42,2 Go3,42 j/s
phi3:3.8b-q42,2 Go3,06 j/s
gemma2:2b-q41,6 Go2,97 j/s
llama3.1:8b-q44,7 Go1,18 j/s
mistral:7b-q44,1 Go0,97 j/s
llama2:7b-q43,8 Goimpossible à charger

Lecture importante : un 7B annoncé à ~4 j/s « en théorie » tombe en pratique à 1 j/s ou moins. C'est exactement pourquoi les tableaux du guide sont pessimistes.

2.3 Vitesse d'absorption du prompt (la phase qui fait « attendre 10 minutes »)

Le seul chiffre qui décide du confort réel de Hermes sur un Pi, car Hermes envoie un préambule fixe volumineux avant votre message. Mesures llama.cpp sur Pi 5 8 Go avec ventilateur, Llama-3.2-3B Q4_K_M, 4 threads :

QuantificationTailleAbsorption du promptGénération
Q4_01,92 Go34,1 j/s6,1 j/s
Q4_K_M2,02 Go31,7 j/s5,8 j/s
Q8_03,42 Go19,3 j/s2,9 j/s
F166,43 Go10,1 j/s1,6 j/s

Source : quickfixsurrey.ca — Llama 3.2 3B Raspberry Pi 5 Benchmark (256 jetons en entrée, 256 en sortie, médiane de 3 passes, Pi 5 8 Go, refroidissement actif). Cette page documente aussi l'effet du nombre de threads : 4 threads = 5,8 j/s, 3 threads = 5,0 j/s, 8 threads = 4,4 j/s (moins bien que 3 !). D'où le réglage OLLAMA_NUM_PARALLEL=1 recommandé dans le guide.

Avec 28 j/s d'absorption et un préambule Hermes d'environ 16 000 jetons, le calcul du guide est : 16 000 ÷ 28 ≈ 570 s ≈ 9,5 minutes pour la première réponse d'une session. On retient « 5 à 12 minutes » comme fourchette.

2.4 Comparaisons entre moteurs, et le petit modèle le plus rapide

3.Tailles des modèles et support des outils

Toutes les tailles et les capacités tools viennent des fiches officielles de la bibliothèque Ollama, consultées lors de la rédaction :

Vérification qui vaut toutes les fiches : sur votre propre machine, ollama show qwen3:4b liste les capacités réelles du modèle téléchargé (section Capabilities). C'est le contrôle à faire, pas celui du site.

4.Documentation du logiciel

Hermes Agent

Ollama

Ubuntu et Raspberry Pi

5.Ce qui reste incertain (à vérifier sur la machine)