Compteur de tokens IA

Collez un texte pour compter ses tokens selon l'encodage GPT-4o, GPT-4/3.5, ou une estimation pour Claude — calcul 100% local, rien n'est envoyé à un serveur.

Encodage exact utilisé par GPT-4, GPT-4 Turbo et GPT-3.5.

Tokens0
Caractères0
Caractères / token

Qu'est-ce qu'un token ?

Un token est l'unité de base que manipule un modèle de langage : avant de traiter un texte, celui-ci est découpé en tokens par un algorithme de tokenisation (souvent une variante de Byte Pair Encoding). Un token peut correspondre à un mot entier, à un fragment de mot, à un espace ou à un signe de ponctuation — il n'y a pas de correspondance directe avec les mots ou les caractères du texte d'origine.

Compter les tokens d'un texte est utile pour deux raisons concrètes : la plupart des API de modèles de langage facturent l'usage au token (en entrée comme en sortie), et chaque modèle a une fenêtre de contexte maximale — un nombre de tokens au-delà duquel il ne peut plus traiter de texte supplémentaire.

Repères : fenêtres de contexte des modèles courants

Chiffres donnés à titre indicatif (référence : septembre 2026), susceptibles d'évoluer sans préavis des fournisseurs — vérifiez toujours la documentation officielle du modèle visé avant de vous y fier pour un usage en production.

ModèleFenêtre de contexte
GPT-4o128 000 tokens
GPT-4.11 000 000 tokens
o3200 000 tokens
Claude Sonnet 4.5200 000 tokens
Claude Opus 4.1200 000 tokens
Gemini 2.5 Pro1 048 576 tokens

Un token n'est pas un mot : c'est une unité de découpage utilisée par le modèle, qui peut représenter un mot entier, une partie de mot, un signe de ponctuation ou même un seul caractère. En anglais et en français, on compte en moyenne environ 0,75 mot par token, mais ce ratio varie beaucoup selon la langue et le texte (les mots rares ou composés sont souvent découpés en plusieurs tokens).

Chaque famille de modèle est entraînée avec son propre vocabulaire de tokens, construit à partir d'un corpus d'entraînement et d'un algorithme de type BPE (Byte Pair Encoding). GPT-4o (o200k_base) et GPT-4/3.5 (cl100k_base) utilisent des vocabulaires différents : un même texte peut donc donner un nombre de tokens différent selon l'encodage choisi. Il n'existe pas de tokenizer universel commun à tous les modèles.

Non, c'est une approximation. Anthropic ne publie pas de bibliothèque de tokenisation exacte et librement utilisable côté client pour Claude. La valeur affichée est estimée à partir de la longueur du texte et donne un ordre de grandeur raisonnable, mais elle peut s'écarter du nombre de tokens réellement facturé par l'API Anthropic. Pour un compte exact, référez-vous à la réponse de l'API elle-même (champs d'usage retournés par Anthropic).

Les API des modèles de langage sont généralement facturées au token (en entrée et en sortie), et chaque modèle a une fenêtre de contexte maximale exprimée en tokens. Compter les tokens d'un texte permet d'estimer son coût et de vérifier qu'il tient dans la limite du modèle visé avant de l'envoyer.

Autres outils · IA