Hitéa

Outils

SecureSend Testeur de mot de passe Générateur de mot de passe Explicateur crontab Quel LLM local ? Générateur de QR code Tout le catalogue

Contenu

Blog Guides

Outil · IA

Quel LLM local pour ma machine ?

Décrivez votre matériel : l'outil confronte les modèles open source du moment à votre mémoire et vous dit lesquels tournent, à quelle quantisation, et comment les lancer.

Comprendre les chiffres

Quantisation (Q4_K_M, Q8_0)
Les poids du modèle sont compressés pour tenir en mémoire. Q4_K_M (4,9 bits par poids) réduit la taille à environ 30 % de l'original pour une perte de qualité minime — c'est le format de référence. Q8_0 (8,5 bits par poids) est presque deux fois plus gros mais quasiment indiscernable du modèle d'origine. Certains modèles, comme les GPT-OSS, sont publiés déjà quantisés (MXFP4).
VRAM, mémoire unifiée, RAM
Un modèle n'est rapide que si ses poids tiennent dans la mémoire directement accessible au processeur qui calcule : la VRAM d'un GPU, la mémoire unifiée d'un Mac. Le débordement en RAM classique fonctionne, mais fait chuter la vitesse. Sur Mac, macOS ne laisse d'ailleurs au GPU qu'une partie de la mémoire unifiée — environ deux tiers jusqu'à 36 Go, trois quarts au-delà (relevable via sysctl iogpu.wired_limit_mb) — et c'est cette part que nous comptons.
MoE (Mixture of Experts)
Ces modèles n'activent qu'une fraction de leurs paramètres à chaque mot généré : ils demandent la mémoire d'un gros modèle mais offrent la vitesse d'un petit. Le meilleur plan quand la RAM est là mais pas le GPU.
Le contexte compte aussi
Nos estimations réservent une marge pour environ 8 000 tokens de contexte. Travailler sur de longs documents demande davantage : comptez large si c'est votre usage.

Nos recommandations

Outils et services que nous utilisons et recommandons

Les liens ci-dessous sont des liens d'affiliation Amazon. En tant que Partenaire Amazon, nous réalisons un bénéfice sur les achats remplissant les conditions requises, sans surcoût pour vous.

Maker & domotique