Votre tokenizer taxe les langues asiatiques.Mesurez-le en deux minutes.

asia-fertility est un benchmark open source qui mesure ce que les tokenizers de LLM facturent réellement pour 16 langues asiatiques : multiplicateur de coût, fenêtre de contexte effective et rappel en écriture native. Un pip install, une commande, aucune clé API.

8,9×
multiplicateur de coût médian sur cl100k_base, 11 écritures non latines
0–2 / 10
rappel needle-in-a-haystack à 4k tokens pour quatre modèles frontière sur cinq
~1 milliard
locuteurs natifs pour les 16 langues mesurées

Lancez-le en deux minutes

pip install "asia-fertility[oai]"
asia-fertility reproduce

Exécute hors ligne une suite de référence de 10 phrases × 16 langues en trois secondes environ, sans clé API : de quoi vérifier que l'installation reproduit la méthodologie du papier.

Mesurez votre propre corpus

asia-fertility measure --text "your text here" --tokenizer cl100k_base
asia-fertility cost --text "your text here" --model gpt-4o
asia-fertility tokenizers list
asia-fertility languages list

1. Ratio de coût : la facture API

Multiplicateur de coût médian pour les 11 écritures non latines sur cl100k_base d'OpenAI (GPT-3.5, GPT-4 Turbo) : 8,9×. Le birman paie 11,66×, le lao 9,60×, le malayalam 8,94×, sur le même contenu parallèle FLORES-200. La taxe tient surtout au choix du tokenizer, pas à un problème de fine-tuning : passer le tamoul sur o200k_base (GPT-4o, GPT-5) la ramène de 7,61× à 1,98×, le birman de 11,66× à 3,18×.

Carte de chaleur du ratio de coût pour 16 langues asiatiques et 10 tokenizers

2. Rappel : le modèle retrouve-t-il un contenu en écriture native ?

Une grille needle-in-a-haystack de 4 000 cellules : 16 langues × 5 modèles frontière × 5 niveaux de remplissage × 5 positions de marqueur × 2 essais. Quatre modèles sur cinq s'effondrent à 0–2 sur 10 de rappel sur les langues asiatiques non latines dès 4k tokens, bien à l'intérieur de toutes les fenêtres de contexte annoncées. gemini-2.5-flash conserve 84,5 % de rappel agrégé sur la même grille : l'effondrement est un choix d'entraînement du fournisseur, pas une propriété de la tâche.

Capacité en contexte : dégradation du rappel selon l'écriture

3. Latence : la pénalité de coût atteint-elle l'utilisateur ?

Corrélation de Pearson agrégée entre ratio de coût et ratio de temps de réponse : 0,314 sur 5 modèles × 16 langues × 10 essais. Les piles de service modernes absorbent l'essentiel de la pénalité côté entrée : un directeur financier voit 11× sur le birman, un utilisateur voit environ 1,5× en moyenne. Problèmes différents, remèdes différents.

Corrélation entre surcoût et rappel

Pourquoi c'est important

Tout produit d'IA tarifé sur l'économie du coût anglais va sous-servir, déprioriser ou exclure en silence les utilisateurs en langue native, à grande échelle. Le tokenizer décide de la facture API, de la fenêtre de contexte effective et de la possibilité même d'un rappel en écriture native, et depuis des années cette décision se prend globalement sans mesure.

Le tokenizer devient donc une décision d'achat. Les modèles en embarquent de très différents. La mesure ne coûte rien et prend deux minutes : si vous construisez de l'IA pour les marchés asiatiques, mesurez avant de déployer.

contact

Décrivez votre situation en quelques lignes, sans engagement. Un échange suffit pour savoir s'il y a un système qui vaut la peine d'être construit, et par quelle porte commencer. Ou envoyez-moi un message.

Helmo ©2026