GENAI RADAR · ÉDITION SEPTEMBRE 2026

Le bruit du marché. Les vrais signaux.

LLM, frameworks d'agents, bases vectorielles, observabilité : ce que nous voyons passer en production chez nos clients, évalué Adopt, Trial, Assess ou Hold.

Ce qu'est le GenAI Radar

Cartographie synthétique des technologies d'intelligence artificielle générative, inspirée du Technology Radar de ThoughtWorks et adaptée aux enjeux des DSI européennes. Modèles de fondation, frameworks d'agents, bases vectorielles, plateformes MLOps : nous évaluons en continu les briques qui structurent l'écosystème, en croisant maturité technique, ROI observé en production et compatibilité avec les exigences de conformité (RGPD, AI Act, NIS2).

Comment lire les quadrants

01ADOPT

Bon pour la production, sans réserve.

Briques matures, éprouvées chez nos clients sur des charges critiques. Retour sur investissement validé, écosystème stable, support durable. Allez-y : elles tiennent la promesse.

02TRIAL

La bonne fenêtre pour un pilote.

Technologies à fort potentiel, déjà éprouvées sur des cas concrets. Lancez des pilotes cadrés avec gouvernance et garde-fous, constituez votre preuve de valeur. Faites confiance, mais mesurez.

03ASSESS

À surveiller, à éprouver en laboratoire.

Technologies prometteuses encore en stabilisation. À suivre activement et à expérimenter en laboratoire. Trop tôt pour la production, juste à temps pour préparer la suite.

04HOLD

À éviter, ou à quitter.

Technologies dépréciées ou risquées. Générations retirées, verrouillage fournisseur, garde-fous manquants ou alternative plus solide disponible. Si vous en avez en production, planifiez la sortie.

Le radar

Filtrez par quadrant ou par nature. Chaque entrée porte le fait daté qui justifie sa position, une version, un chiffre d'adoption, un texte réglementaire.

Quadrant
Type
23 briques
Modèleadopt

Architecture multi-modèles

Router chaque tâche vers le modèle qui lui convient plutôt que d'en élire un seul. Les paliers tarifaires écartent désormais les modèles d'un facteur vingt-cinq : le routage est un levier de coût autant que de qualité.

GPT-5.6 est distribué en trois paliers depuis juillet 2026, de 0,20 $ à 5 $ le million de jetons en entrée.

Modèleadopt

Modèles de frontière propriétaires

Claude Opus 5, GPT-5.6 et Gemini 3.7 tiennent le haut du panier sur le raisonnement long et le travail agentique. À réserver aux tâches qui le justifient : leur coût au jeton reste un ordre de grandeur au-dessus des modèles ouverts.

Claude Opus 5 est sorti le 24 juillet 2026 ; Gemini 3.7 Flash est en disponibilité générale depuis le 13 août 2026.

Modèleadopt

Mistral Large 3 et Small 4

Poids ouverts sous licence Apache 2.0 : téléchargeables, modifiables, hébergeables chez vous sans redevance au jeton. Le choix par défaut dès que la donnée ne doit pas sortir de votre périmètre.

Mistral Large 3 est le plus grand modèle à mélange d'experts à poids ouverts publié par un laboratoire majeur.

Frameworkadopt

MCP : Model Context Protocol

Le protocole de branchement des outils sur les modèles. Il a quitté le statut de spécification d'un éditeur pour devenir la couche d'interopérabilité du marché, ce qui règle la question du verrouillage sur l'outillage.

Passé sous gouvernance de la Linux Foundation, soutenu par Anthropic, OpenAI, Google, Microsoft et AWS ; 41 % des organisations interrogées en production en 2026.

Frameworkadopt

RAG hybride

Recherche vectorielle et lexicale combinées, avec réordonnancement. C'est le socle du service documentaire en entreprise, à condition de le traiter comme une brique et non comme l'architecture entière.

77 % des responsables IT et data considèrent que le RAG seul ne suffit pas à un déploiement fiable en production.

Plateformeadopt

LangGraph

L'orchestration à état pour les agents qui vont en production : reprise sur incident, points de contrôle, intervention humaine dans la boucle. La plus longue durée d'exploitation réelle des orchestrateurs du marché.

En disponibilité générale depuis octobre 2025, avec des déploiements publics chez Klarna, Uber, LinkedIn, BlackRock et JPMorgan.

Outiladopt

pgvector

La recherche vectorielle dans le PostgreSQL que vous exploitez déjà : transactions, sauvegardes et droits d'accès sont ceux de votre base. Un système de moins à tenir, tant que le volume le permet.

Au-delà d'une dizaine de millions de vecteurs, un moteur dédié redevient pertinent, c'est le seuil que nous observons.

Outiladopt

Conventions OpenTelemetry GenAI

Les attributs normalisés gen_ai.* pour tracer appels de modèles, jetons consommés et latences. Faites-en une exigence d'achat : c'est ce qui vous permettra de changer d'outil d'observabilité sans réinstrumenter.

Les quatre plateformes d'observabilité LLM les plus répandues exportent désormais au format OpenTelemetry.

Frameworktrial

Context engineering

Gouverner tout ce qui entre dans la fenêtre de contexte, instructions, mémoire, outils, budget de jetons, compression, au lieu de peaufiner une formulation. Le prompt devient un sous-ensemble de la discipline.

82 % des responsables IT et data jugent que le prompt engineering seul ne suffit plus ; 95 % tiennent le context engineering pour important à l'échelle.

Outiltrial

Qdrant et Weaviate

Des moteurs vectoriels dédiés qui gardent leur tenue quand le filtrage sur métadonnées se durcit, parce que le filtre est intégré à l'indexation plutôt qu'appliqué après coup. À éprouver sur votre jeu de filtres réel.

Le géré coûte de 1,5 à 3 fois l'auto-hébergé autour de dix millions de vecteurs, mais supprime le travail de montée en charge.

Plateformetrial

Langfuse, LangSmith, Arize Phoenix

Traçage, versionnage des invites et évaluation continue. Sans cette couche, une régression de qualité passe inaperçue jusqu'à la réclamation client. Langfuse s'auto-héberge sous licence MIT.

Langfuse dépasse 28 000 étoiles sur GitHub et s'héberge sans restriction de licence.

Frameworktrial

A2A : Agent-to-Agent

Le pendant de MCP entre agents : découverte de capacités, délégation, réponse. Encore jeune, mais c'est déjà l'un des deux signaux d'interopérabilité que les éditeurs mettent en avant.

MCP et A2A sont les deux protocoles cités comme signaux d'interopérabilité du marché des frameworks d'agents en 2026.

Modèletrial

Modèles ouverts auto-hébergés

Llama, Qwen et DeepSeek soutiennent désormais la comparaison sur une bonne part des tests. Sur un cas d'usage cadré et à volume stable, l'inférence chez soi change l'économie du dossier.

Les modèles à poids ouverts rivalisent avec les alternatives propriétaires sur de nombreux tests de référence en 2026.

Outiltrial

vLLM et Ollama

Servir un modèle ouvert sur votre propre matériel, du poste de développement au cluster GPU. La brique qui rend l'inférence souveraine opérable plutôt que théorique.

À éprouver d'abord sur les charges à faible variabilité, où le dimensionnement GPU se calcule.

Frameworkassess

Systèmes multi-agents

Plusieurs agents spécialisés qui se répartissent une tâche. Les démonstrations convainquent ; le coût de mise au point et la difficulté à reproduire un incident tiennent encore la production à distance.

À traiter en laboratoire avec un budget de jetons plafonné et une trace complète de chaque échange.

Outilassess

Fine-tuning et distillation ciblés

Utile quand le contexte ne peut pas porter la connaissance : style maison, terminologie métier, réduction de la latence sur un geste répété. Le préalable reste un jeu d'évaluation qui prouve le gain.

Sans jeu d'évaluation antérieur, un réglage fin ne se distingue pas d'une intuition coûteuse.

Plateformeassess

Agents de développement autonomes

Des agents qui prennent un ticket et rendent une demande de fusion. Le gain se mesure sur les tickets cadrés et bien testés ; il s'effondre dès que la spécification est floue.

À mesurer sur vos propres métriques DORA avant toute généralisation.

Modèleassess

Mémoire persistante d'agent

Conserver l'état d'un agent entre les sessions plutôt que de le reconstruire à chaque appel. Le sujet ouvre autant de questions de conformité que de gains d'efficacité : ce qui est mémorisé devient une donnée à gouverner.

La mémoire est l'un des quatre piliers du context engineering, avec les instructions, la recherche et les outils.

Modèlehold

Générations de modèles retirées

GPT-4, Claude 3, Gemini 1 : ces générations ne sont plus servies ou le seront bientôt. Si l'une d'elles est encore appelée en production, la migration est un sujet de planning, pas de veille.

Chaque génération retirée emporte ses réglages : prévoyez la campagne d'évaluation avant la bascule, pas après.

Frameworkhold

Agents entièrement autonomes sans supervision

Une boucle qui décide et exécute sans point d'arrêt humain ni journal d'audit. Le risque n'est pas la performance du modèle mais l'absence de reprise en main quand la chaîne dérive.

L'AI Act est pleinement exécutoire pour les modèles à usage général depuis le 2 août 2026, avec des amendes jusqu'à 3 % du chiffre d'affaires mondial ou 15 M€.

Frameworkhold

Mise en production sans détection d'injection

Dès qu'un modèle lit un contenu qu'il n'a pas produit, page web, courriel, fichier déposé, ce contenu peut porter des instructions. Sans couche de détection ni cloisonnement des droits, l'agent devient une surface d'attaque.

Le cloisonnement des droits de l'agent compte autant que le filtre : un agent qui ne peut pas écrire ne peut pas être détourné pour écrire.

Plateformehold

Fournisseur unique sans couche d'abstraction

Appeler un seul modèle depuis tout le code applicatif. Le jour où le tarif change, où la génération est retirée ou où le service tombe, il n'existe aucun chemin de repli.

Les modèles déjà commercialisés disposent d'une fenêtre de mise en conformité jusqu'au 2 août 2027 : l'abstraction est aussi ce qui rendra cette bascule tenable.

Outilhold

Automates à règles présentés comme de l'IA

Arbres de décision et scripts rebaptisés. Rien à leur reprocher en tant qu'outils, le problème est le budget d'IA qu'ils consomment et l'attente qu'ils créent sans jamais pouvoir la tenir.

Le test tient en une question : le comportement change-t-il quand la donnée change, sans qu'on réécrive une règle ?

Le décryptage stratégique

L'IA générative a cessé d'être un sujet d'innovation pour devenir un sujet d'industrialisation. Les DSI qui réussissent ne sont pas celles qui adoptent le plus de technologies, mais celles qui choisissent les bonnes briques, les gouvernent correctement et les déploient avec des garde-fous. Ce radar filtre le bruit pour ne garder que ce que nous voyons passer en production.

Le RAG garde la connaissance hors du modèle : vous mettez à jour un document plutôt que de ré-entraîner, vous gardez la main sur vos données, et vous pouvez remonter d'une réponse à sa source. Le fine-tuning garde sa place sur le style maison, la terminologie métier et la latence d'un geste répété, mais il exige un jeu d'évaluation qui prouve le gain, ce qui manque à la plupart des projets. Cela dit, 77 % des responsables IT et data considèrent désormais que le RAG seul ne suffit pas à un déploiement fiable : c'est la discipline qui l'entoure, le context engineering, qui porte le résultat.

Ce n'est pas un choix binaire, et il ne se tranche pas une fois pour toute l'entreprise. Mistral Large 3 et Small 4 sont publiés sous licence Apache 2.0 : ils s'hébergent chez vous sans redevance au jeton, ce qui en fait le choix par défaut dès que la donnée ne doit pas sortir de votre périmètre. Les modèles de frontière propriétaires justifient leur coût sur le raisonnement long et le travail agentique. Ce qui compte, c'est la couche d'abstraction entre les deux, qui vous laisse router par tâche au lieu d'engager tout le code applicatif sur un fournisseur.

Les deux, et la différence tient entièrement à ce qui les entoure. Un agent avec un point d'arrêt humain, un budget de jetons plafonné, des droits cloisonnés et la trace complète de chaque échange est un système exploitable. Le même agent sans rien de tout cela est une surface d'attaque : dès qu'il lit un contenu qu'il n'a pas produit, ce contenu peut porter des instructions. Commencez supervisé, puis desserrez la boucle sur ce que vous avez mesuré.

Depuis le 2 août 2026, la Commission dispose de ses pleins pouvoirs d'exécution sur les fournisseurs de modèles à usage général, avec des amendes pouvant atteindre 3 % du chiffre d'affaires mondial ou 15 millions d'euros. Les modèles déjà commercialisés bénéficient d'une fenêtre de mise en conformité jusqu'au 2 août 2027. Concrètement, pour une entreprise qui déploie des modèles plutôt qu'elle n'en publie, cela rend deux choses non négociables : savoir quel modèle est appelé où, et savoir produire la trace de ce qu'il a fait.

Chaque édition est datée et reflète ce que nos équipes observent en production chez nos clients, pas une prévision de marché. Celle-ci est l'édition de septembre 2026. Une brique ne change de quadrant que si quelque chose de vérifiable bouge avec elle : une version, un chiffre d'adoption, un texte réglementaire, ou un échec que nous avons constaté nous-mêmes.

PARLER À UN EXPERT

Passons le radar en revue avec vos équipes.

La place de chaque brique dans votre architecture est une conversation, pas un tableau. Dites-nous ce que vous exploitez, nous le parcourons avec vous.

En soumettant ce formulaire, vous acceptez notre politique de confidentialité.