Découpeur de texte en chunks
Collez un texte, réglez la taille de chunk et l'overlap : les chunks sont générés en direct, prêts pour un pipeline RAG.
0 caractères · ~0 tokens (estimation)
0 chunk produit
Collez du texte ci-dessus pour générer les chunks.
Qu'est-ce que le chunking et pourquoi c'est important
Le chunking consiste à découper un document en morceaux (chunks) avant de l'indexer dans un système RAG (retrieval-augmented generation). Chaque chunk est ensuite transformé en vecteur (embedding) et stocké dans une base vectorielle : au moment de la recherche, ce sont ces chunks, et non le document entier, qui sont comparés à la question posée.
La taille des chunks a un impact direct sur la qualité des réponses. Des chunks trop grands mélangent plusieurs sujets dans un même vecteur, ce qui rend la recherche par similarité moins précise. Des chunks trop petits perdent le contexte environnant et peuvent produire des fragments incompréhensibles pris isolément. L'overlap (chevauchement) entre chunks consécutifs limite le risque qu'une information importante soit coupée exactement à la frontière entre deux chunks.
Cet outil ne fait pas de découpe sémantique (basée sur des embeddings) : il propose trois stratégies simples — brute par taille, en respectant les phrases, ou en respectant les paragraphes — suffisantes pour prototyper rapidement un pipeline RAG sans écrire de script.
Ça dépend du cas d'usage. Pour de la recherche documentaire précise (retrouver un passage exact), des chunks courts (200-400 tokens) donnent de meilleurs résultats. Pour conserver du contexte autour d'une réponse (résumé, question complexe), des chunks plus longs (500-1000 tokens) sont souvent préférables. Un chunk trop grand dilue le signal utile dans le bruit lors de la recherche par similarité ; un chunk trop petit perd le contexte nécessaire pour comprendre l'information.
Sans chevauchement, une information à cheval sur la frontière entre deux chunks peut être coupée en deux et devenir difficile à retrouver ou à interpréter correctement lors de la recherche. L'overlap (typiquement 10 à 20 % de la taille du chunk) fait qu'une partie du texte de fin d'un chunk se retrouve aussi en début du chunk suivant, ce qui réduit le risque de perdre du contexte à la coupure.
Un caractère est une unité fixe (une lettre, un chiffre, un espace). Un token est l'unité que consomme réellement un modèle de langage : selon l'encodage, un mot peut représenter un ou plusieurs tokens. Découper par tokens colle donc mieux à la vraie consommation du modèle et à la limite de sa fenêtre de contexte, alors que découper par caractères est plus simple et prévisible mais moins fidèle au comptage réel du modèle. Ici, le comptage en tokens est une estimation (environ 4 caractères par token), pas un tokenizer exact.
Seulement si un paragraphe entier dépasse déjà la taille de chunk demandée : dans ce cas précis, ce paragraphe est lui-même redécoupé pour respecter la taille cible. Tant qu'un paragraphe (ou une phrase, selon la stratégie choisie) reste plus court que la taille cible, il n'est jamais coupé au milieu.