Il y a quelque temps, j'ai regardé un pipeline de récupération laisser tomber le seul document qui comptait. Un mémo de tarification, enfoui dans un ensemble de 40 documents, s'est silencieusement retrouvé en 51e position alors que nous renvoyions les 50 premiers. L'agent a résumé les 49 autres et a transmis un nombre confiant à un client. Le mauvais nombre. La solution n'était pas une fenêtre de contexte plus grande. C'était corriger le classifieur.
Je garde cette histoire en poche chaque fois que quelqu'un s'emballe pour un LLM à contexte de 12M tokens, car l'argument de vente est toujours « mets tout dans le prompt et le problème disparaît. » Ce n'est pas le cas. Laissez-moi expliquer pourquoi, et ce qui s'en vient réellement.
D'abord, l'avertissement honnête. Il n'existe aucun modèle 12M en production au moment où j'écris ceci. La frontière est à 1M tokens — Claude Opus 4.8 et Fable 5 fonctionnent tous deux avec une fenêtre de contexte de 1M, et la gamme longue-contexte de Gemini est dans le même registre. Tout ce qui suit est de l'analyse, pas un benchmark que j'ai exécuté. Je préfère raisonner sur la physique que réciter une keynote.
Pourquoi un LLM à contexte de 12M tokens a besoin d'une attention sous-quadratique
Voilà le mur. L'attention standard évolue avec le carré de la longueur de séquence. Multipliez votre entrée par douze et le coût d'attention monte par douze au carré — 144 fois le calcul et la mémoire pour la matrice d'attention. Vous ne pouvez pas vous sortir de là avec plus de H100. La seule issue est de changer la mathématique.
C'est toute la ligne de recherche sous-quadratique. Les modèles d'espace d'états comme Mamba, les variantes d'attention linéaire et creuse, les récurrences de style RWKV, et les conceptions hybrides qui accrochent quelques véritables couches d'attention sur une colonne vertébrale principalement linéaire. Le papier Mamba rapporte un échelonnement linéaire en longueur de séquence et environ 5 fois plus de débit d'inférence que les Transformers comparables, avec une qualité maintenue sur des séquences de longueur millionnaire.
Mais le même papier est direct sur l'obstacle. Les auteurs notent que ces architectures « n'ont pas aussi bien performé que l'attention sur des modalités importantes comme le langage. » Cet écart, c'est tout le jeu. L'attention linéaire est bon marché parce qu'elle écrase le passé dans un état de taille fixe, et écraser signifie oublier. La seule question qui importe est de savoir si elle oublie ce dont vous aviez besoin. Les hybrides sont le pari intelligent ici — gardez quelques couches d'attention complète pour la précision, faites tourner le reste sous-quadratique en volume. Vous perdez la garantie que chaque token voit tous les autres. À 12M tokens, vous n'auriez de toute façon jamais pu vous offrir cette garantie.
Le mode d'échec que personne ne comptabilise : la dégradation du contexte
Nous ne pouvons pas pleinement utiliser les fenêtres de 1M que nous avons déjà. C'est la partie qui me rend sceptique de tout le cadre « plus de contexte règle tout. »
La recherche de Chroma sur la dégradation du contexte a testé un large ensemble de modèles de pointe et a constaté que la précision se dégrade à mesure que l'entrée croît, même lorsque la fenêtre est loin d'être pleine. Ajoutez des tokens, perdez en précision. C'est un problème de dilution de l'attention, pas de capacité.
Le symptôme classique est « perdu au milieu. » Liu et al. (2023) a montré que les modèles font bien attention au début et à la fin d'une longue entrée, et mal à ce qui est enfoui au milieu, avec une précision qui chute brusquement quand le fait pertinent se trouve au mauvais endroit. Imaginez maintenant cela à 12M tokens, sur un backbone sous-quadratique déjà avec pertes par conception. Vous empilez l'oubli architectural par-dessus la dilution positionnelle.
Et la récupération n'est pas du raisonnement — c'est le piège dans lequel les gens tombent. Un modèle peut gagner le test de l'aiguille dans une botte de foin, trouvant une phrase plantée dans 10M tokens, et échouer complètement à synthétiser une conclusion à partir de quarante faits dispersés dans cette même botte. Trouver un fait est une recherche. Raisonner sur beaucoup de faits est quelque chose de différent et de plus difficile, et des évaluations longue-contexte plus difficiles comme NoLiMa, qui vont au-delà de la correspondance littérale de mots-clés, continuent d'exposer l'écart. Gagner un test d'aiguille 12M ne vous dit presque rien sur la capacité du modèle à penser sur la botte de foin.
Une chronologie réaliste pour un LLM à contexte de 12M tokens
Je m'engage sur une fourchette, avec la mise en garde que j'ai déjà raté des prédictions de chronologie.
12 à 24 mois : contexte de 12M de qualité recherche et démonstration, principalement des architectures hybrides, avec des astérisques. Bonne récupération d'aiguille, raisonnement croisé entre documents instable. Le genre de chose qui se comporte bien en benchmark et déçoit dans votre boucle d'agent.
24 à 48 mois : accès en production où la qualité de raisonnement en profondeur est suffisamment bonne pour faire confiance au travail réel, la latence de préfill est tolérable, et le prix n'est pas absurde. Cette dernière clause porte la plus grande partie du poids.
L'économie est brutale même si l'architecture fonctionne. Un préfill de 12M est un mur de calcul avant que le modèle émette un seul token de sortie. Des secondes à des minutes de latence, et une facture à l'avenant. Aujourd'hui Opus 4.8 coûte 5 dollars par million de tokens en entrée. Un préfill froid de 12M représente 60 dollars rien qu'en entrée, à chaque fois, sauf si le cache vous sauve. Le cache de prompts cesse d'être un avantage et devient porteur de charge. Le problème est que le cache n'aide que lorsque votre préfixe est stable, et dans une boucle d'agent ce n'est fréquemment pas le cas.
Comment préparer votre flux de travail d'agent
Vous n'attendez pas 12M. Vous construisez comme si c'était en route et comme si ça ne vous sauverait pas.
Arrêtez de traiter la fenêtre de contexte comme un tiroir à déchets. L'instinct sera de déverser tout votre codebase, chaque document, l'historique complet du chat, et de laisser le modèle trier. C'est ainsi que vous déclenchez la dégradation du contexte. Les équipes qui gagneront sur les grandes fenêtres sont celles qui ont pris de la discipline sur les petites.
Quelques choses qui valent la peine d'être faites maintenant. Construisez un retrieval en lequel vous faites vraiment confiance, pour que le modèle voie les bons 50K tokens au lieu des mauvais 12M — et oui, cela signifie attraper le cas où le document qui compte se retrouve en 51e position. Traitez la mémoire comme un stockage explicite que l'agent lit et écrit, des fichiers ou une base de données ou des notes structurées, pas « remonte dans la transcript. » Élaguez les résultats d'outils périmés et résumez les sous-tâches terminées pour garder l'ensemble de travail léger. Chacune de ces compétences se transfère. Aucune ne devient obsolète quand la fenêtre s'agrandit.
Si votre agent ne fonctionne que parce que vous pouvez tout mettre dans un prompt, une fenêtre de 12M ne corrige pas votre conception. Elle vous laisse échouer à plus grande échelle et à coût plus élevé.
Le contexte est-il le goulot d'étranglement ?
Non. Et c'est la position que je vais défendre.
La longueur de contexte brute est le nombre de la fiche technique. Facile à commercialiser, facile à mesurer avec un test d'aiguille, facile à confondre avec du progrès. Le vrai goulot d'étranglement pour le travail agentique que la plupart d'entre vous fait est le retrieval, la mémoire et la conception de l'agent. La question n'a jamais été « le modèle peut-il tenir 12M tokens. » C'est « peut-il trouver, peser et raisonner sur les bons tokens » — et une plus grande botte de foin rend cela strictement plus difficile.
Donnez-moi un modèle de 200K avec un retrieval chirurgical plutôt qu'un modèle de 12M qui se dégrade au milieu. N'importe quel jour de la semaine. Un LLM à contexte de 12M tokens, quand il sera lancé, sera un véritable outil pour quelques vrais problèmes : analyse de dépôt entier, agents à long horizon qui ont vraiment besoin de l'historique. Pour la plupart de ce que vous construisez, ce sera une façon plus coûteuse de commettre la même erreur que mon pipeline — livrer avec confiance le mauvais nombre parce que le bon n'a jamais atteint l'attention du modèle.
Le contexte n'est pas la partie difficile. Décider ce qui y entre est tout le travail.
