Un RAG ordinaire refouille les documents bruts à chaque question et recommence à la suivante. Trois idées récentes séparent ce qu'il confond : organiser la connaissance, prendre une décision fermée, contrôler ce qui vient d'être produit.
L'enjeu n'est pas de demander à un modèle de tout refaire à chaque appel, mais d'organiser une fois, de décider vite sur les questions fermées et de vérifier chaque étape.
Le RAG et ses trois pannes
Un RAG découpe les documents en morceaux (chunking), les transforme en vecteurs (embeddings) dans une base vectorielle, puis vectorise la question : la recherche par K plus proches voisins retrouve les morceaux proches par similarité cosinus, que le LLM utilise pour répondre. Trois pannes surviennent : une question mal formulée guide mal la recherche, des morceaux non pertinents polluent le contexte, ou la réponse, non ancrée dans les morceaux, hallucine.
La reformulation multi-requête relance la recherche sous plusieurs angles. HyDE cherche avec une réponse hypothétique inventée par le LLM : elle a la forme et la longueur d'un vrai document, plutôt que la question brute, plus courte. Le reclassement par cross-encoder fonctionne en cascade : un tamis vectoriel rapide sort une cinquantaine de candidats, qu'un modèle plus lent et précis reclasse plus finement. Le RAG correctif vérifie pertinence et ancrage, puis peut reformuler ou régénérer.
Jev, une décision calibrée
Diogo Almeida, co-inventeur du RLHF chez OpenAI et cofondateur de TypeSafe AI, dit : « nous avons mis la main sur quelque chose d'exceptionnel et pourtant ce n'est pas utile ». Jev est un « système 1 », rapide et intuitif selon Kahneman. Fondé sur les Transformers, il ne génère pas de texte : Choice, Score et Noul renvoient des décisions typées avec probabilité calibrée. Il est entraîné sur données synthétiques par RLCD, apprentissage par renforcement pour décision calibrée.
| Chiffre annoncé | Réserve |
|---|---|
| Latence : 70 à 500 millisecondes, contre 3 à 9 secondes pour un LLM classique. | La démonstration 0,114 s contre 8,566 s pour GPT-5.6 Terra était volontairement simplifiée, admet TypeSafe. |
| Prix : 0,042 dollar par million de jetons en entrée, sortie gratuite, contre 2 et 12 dollars par million pour GPT-5.6 Terra. | TypeSafe ne peut pas prouver que son prix n'est pas subventionné. |
| Adoption : près de 13 % des équipes payantes sur la passerelle Vercel en 24 heures, un record. | Rien ne prouve sa durée ; les évaluations restent internes, avec des chiffres — « 193,6× plus rapide, 444,6× moins cher », arrondis par Vercel à 194×/445× — que TypeSafe présente lui-même comme une fourchette haute. |
Le « 0 % d'hallucination » est garanti par le schéma de sortie, non mesuré comme une exactitude ; The Register juge la comparaison avec un LLM inéquitable, Jev ne produisant pas de langage.
Chez SynapxLab
Notre recherche « par notion » sur dictionnaire.synapx.fr (174 708 mots) est un RAG : des embeddings bge-m3, calculés en local, en 1 024 dimensions sur les définitions. « outil pour couper le bois » remonte xylocope, guillaume et frison. Faute de GPU, nous avons testé puis écarté le reclassement par cross-encoder et la fusion hybride lexicale-vectorielle par RRF, qui dégradent tous deux le premier résultat. HyDE reste à tester et paraît la piste la plus prometteuse.
Nos vecteurs ne sont pas des décisions : bge-m3 mesure une distance entre deux textes sans qu'aucune question soit posée, là où une probabilité calibrée répond à une question écrite d'avance. Un « Jev de poche » comblerait l'écart en micro-service : le mot et sa définition deviennent un vecteur, une régression logistique le note, une calibration de Platt ou isotonique transforme la note en probabilité, et un seuil à 0,95 tranche entre appliquer et renvoyer à un humain. Les données existent déjà : 34 180 domaines sur 260 possibles, 30 621 notes de qualité, environ 600 registres arbitrés à la main. Le premier chantier viserait le domaine des 32 228 mots créés le 22 septembre 2026 qui n'en ont pas. Rien de cela n'est fait.
flowchart LR
A["Vecteur bge-m3"] --> B["Régression logistique"]
B --> C["Calibration"]
C --> D{"Seuil 0,95"}
D -->|"≥ 0,95"| E["Appliquer"]
D -->|"< 0,95"| F["Relecture humaine"]
Le LLM Wiki
Andrej Karpathy propose de ne pas refouiller les documents bruts à chaque question. Le modèle rédige et entretient un wiki de pages dérivées des sources ; chaque nouvelle source l'enrichit et les contradictions y sont notées. Un petit fichier de règles le maintient cohérent. Ce wiki n'est pas la source : mieux vaut garder les sources et relire ; il coûte aussi plus cher qu'un RAG pour une question isolée. C'est déjà notre manière de tenir l'état d'un projet : fichier d'état, déclarations de session et mémoire de faits datés, relus par un humain.
Organiser une fois prépare indexation, wiki et données étiquetées. Jev ou un classifieur calibré décident vite les questions fermées ; le RAG correctif et le seuil humain vérifient chaque étape. Chez SynapxLab, HyDE et le classifieur calibré restent à construire et à prouver.
Pour aller plus loin
- La vectorisation des données : quand le monde devient géométrie — d'où viennent les vecteurs, et pourquoi la similarité cosinus.
- Comment éviter les hallucinations dans un prompt IA — la troisième panne du RAG, vue du côté du prompt.
- L'IA en local : souveraineté, confidentialité, autonomie — le choix qui explique nos essais sur CPU.
- Chercher un savoir-faire quand la donnée publique ne décrit qu'une activité — une recherche sémantique sur un vrai fonds, avec ses limites.