L'IA dans les tests logiciels : outils, méthodes et formation (2026)
« IA et test logiciel » recouvre deux réalités très différentes : utiliser l'intelligence artificielle pour tester plus vite (générer des cas, réparer des sélecteurs, trier des échecs) et tester les systèmes d'IA eux-mêmes (évaluer un modèle de langage, mesurer sa robustesse, encadrer son non-déterminisme). Ce guide explique les deux, décrit les catégories d'outils, leurs limites réelles, les compétences à acquérir et la certification ISTQB CT-GenAI qui les valide.
IA et test logiciel : de quoi parle-t-on ?
L'expression « IA dans les tests logiciels » désigne deux activités distinctes : d'une part, tester avec l'IA, c'est-à-dire utiliser des modèles d'intelligence artificielle comme assistants du testeur pour concevoir, écrire, maintenir et analyser des tests ; d'autre part, tester l'IA, c'est-à-dire vérifier la qualité d'un système qui embarque un modèle, par exemple un assistant conversationnel fondé sur un grand modèle de langage.
Premier sens : l'IA comme assistant du testeur
Ici, le logiciel testé est classique (une application web, une API, une application mobile) et l'IA intervient dans l'outillage du testeur. Elle propose des cas de test à partir d'une spécification, génère un squelette de script Playwright, suggère une correction quand un sélecteur a changé, regroupe des échecs de tests similaires ou résume un rapport. Le testeur reste le décideur : il valide, corrige, complète et assume la couverture obtenue.
Second sens : l'IA comme objet du test
Ici, le système testé contient lui-même un composant d'IA, souvent un grand modèle de langage (LLM). Ses réponses ne sont pas déterministes : la même question peut produire deux formulations différentes. Les méthodes classiques (« résultat attendu = résultat obtenu ») ne suffisent plus. Il faut constituer des jeux de tests représentatifs, définir des métriques de qualité, faire intervenir des experts métier et mener des tests d'attaque (red teaming) pour vérifier que le système ne produit pas de contenus dangereux.
Pourquoi les deux comptent pour un testeur en 2026
Les entreprises déploient des assistants d'IA dans leurs produits et équipent leurs équipes d'outils d'IA générative. Un testeur qui sait utiliser ces outils de manière critique et qui comprend comment évaluer un modèle est utile sur les deux fronts. C'est pourquoi la formation ADC intègre l'IA générative appliquée au test tout au long de ses 399 heures, avec une exigence constante d'usage critique et traçable.
Tester avec l'IA : les catégories d'outils
Les outils d'IA pour l'automatisation des tests se regroupent en quatre familles : la génération de cas et de scripts de test, l'auto-réparation des sélecteurs (self-healing), le triage et l'analyse des échecs, et les assistants de code intégrés à l'éditeur. Chacune fait gagner du temps sur une tâche précise ; aucune ne remplace la stratégie de test ni la vérification humaine.
1. Génération de cas de test et de scripts
À partir d'une user story, d'une maquette ou d'une page web, un modèle de langage propose une liste de scénarios (cas nominal, cas limites, cas d'erreur) puis un premier jet de code. Des assistants conversationnels généralistes comme ChatGPT s'utilisent ainsi avec un prompt bien construit. Côté outillage spécialisé, le générateur de tests de Playwright enregistre vos actions dans le navigateur et écrit le code correspondant, décrit par la documentation officielle comme un outil qui « enregistre vos actions et génère automatiquement le code de test » (source : Playwright, consulté le 27 septembre 2026). Ce n'est pas de l'IA générative au sens strict, mais c'est souvent le point de départ que le testeur enrichit ensuite avec un assistant.
Ce qu'il faut vérifier : que les cas proposés correspondent au produit réel (pas à une fonctionnalité imaginée), que les assertions vérifient quelque chose de significatif, que les cas limites importants ne manquent pas.
2. Auto-réparation des sélecteurs (self-healing)
Une grande partie de la maintenance des tests d'interface vient des sélecteurs qui cassent quand l'interface change. Des plateformes commerciales comme Testim ou Mabl proposent des mécanismes qui identifient un élément par plusieurs attributs et tentent de le retrouver lorsqu'un attribut change. Nous ne formulons ici aucune affirmation sur leurs performances ou leurs tarifs, qui évoluent ; retenez le principe : moins de tests cassés pour une raison purement cosmétique.
Ce qu'il faut vérifier : qu'une « réparation » automatique n'a pas fait pointer le test vers le mauvais élément, ce qui produirait un test vert pour une mauvaise raison. Notez que les localisateurs sémantiques de Playwright (getByRole, getByLabel), décrits comme « résilients » par la documentation officielle (source : Playwright, consulté le 27 septembre 2026), réduisent déjà fortement ce problème sans IA.
3. Tests visuels et triage des échecs
Les outils de test visuel comparent des captures d'écran entre deux versions et distinguent une différence perceptible d'un simple bruit de rendu ; Applitools est l'un des acteurs connus de cette catégorie. Le triage assisté regroupe des centaines d'échecs par cause probable (même erreur, même composant, même environnement), ce qui accélère l'analyse d'une campagne nocturne.
Ce qu'il faut vérifier : le réglage de la sensibilité (trop tolérant, on rate des régressions ; trop strict, on noie l'équipe de faux positifs) et la pertinence des regroupements.
4. Assistants de code dans l'éditeur
GitHub Copilot et les assistants équivalents complètent le code au fil de la frappe, proposent des fonctions entières et expliquent un extrait. Pour un testeur, ils accélèrent l'écriture de tests répétitifs, la création de données de test et la documentation. La documentation de Playwright mentionne par ailleurs un serveur MCP permettant à des agents IA de piloter le navigateur (source : Playwright, consulté le 27 septembre 2026).
Ce qu'il faut vérifier : chaque ligne suggérée, comme pour le code d'un collègue junior. Les assistants reproduisent volontiers des motifs obsolètes ou des attentes fixes (waitForTimeout) déconseillées par les bonnes pratiques.
Tableau récapitulatif
| Famille | Tâche accélérée | Exemples cités publiquement | Risque principal |
|---|---|---|---|
| Génération de cas et de scripts | Conception initiale, premier jet de code | ChatGPT, générateur de tests Playwright | Cas inventés, assertions vides |
| Auto-réparation des sélecteurs | Maintenance des tests d'interface | Testim, Mabl | Réparation vers le mauvais élément |
| Tests visuels et triage | Analyse des résultats | Applitools | Faux positifs ou régressions ratées selon le réglage |
| Assistants de code | Écriture, données de test, documentation | GitHub Copilot | Code plausible mais incorrect ou obsolète |
Les limites et les risques de l'IA dans les tests
Les principaux risques de l'IA générative appliquée au test sont les hallucinations (contenus plausibles mais faux), la perte de traçabilité (on ne sait plus pourquoi un test existe), la fuite de données sensibles vers des services externes, et la non-conformité réglementaire, notamment vis-à-vis du règlement européen sur l'IA. Chacun se maîtrise par des pratiques précises, pas par la confiance.
Hallucinations
Un modèle de langage produit du texte probable, pas du texte vrai. Appliqué au test, cela donne des cas de test pour des fonctionnalités inexistantes, des sélecteurs qui ne correspondent à rien dans la page, ou des assertions qui passent toujours. Le syllabus ISTQB CT-GenAI cite explicitement les hallucinations parmi les risques à gérer (source : ISTQB, consulté le 27 septembre 2026). La parade : toujours confronter la sortie de l'IA au produit réel, exécuter le test et vérifier qu'il échoue quand il doit échouer.
Traçabilité
Un test doit pouvoir être relié à une exigence, un risque ou une anomalie. Quand des dizaines de tests sont générés en bloc, ce lien se perd et personne ne sait plus ce qui est réellement couvert. C'est pourquoi ADC insiste sur un usage « critique et traçable » de l'IA : documenter le prompt utilisé, la version du modèle, ce qui a été conservé et ce qui a été rejeté, et rattacher chaque test généré à une exigence identifiée.
Données sensibles
Envoyer un extrait de base de données clients, un jeu de données de production ou du code propriétaire à un service d'IA externe peut constituer une violation du RGPD ou d'un accord de confidentialité. Le syllabus CT-GenAI range la confidentialité et la sécurité parmi les risques centraux (source : ISTQB, consulté le 27 septembre 2026). Les bonnes pratiques : anonymiser ou synthétiser les données de test, utiliser des instances d'IA approuvées par l'entreprise, et connaître la politique interne avant d'ouvrir un assistant.
Biais
Un modèle entraîné sur des données biaisées reproduit ces biais dans ses suggestions : des données de test qui ne couvrent qu'un type de nom, de format d'adresse ou de langue. Le testeur doit consciemment élargir la diversité des cas.
Le règlement européen sur l'IA (AI Act)
Le règlement européen sur l'intelligence artificielle adopte une approche par les risques, avec quatre niveaux : risque inacceptable (pratiques interdites), haut risque, risque de transparence et risque minimal. Pour les systèmes à haut risque, la Commission européenne liste des obligations qui parlent directement au testeur : « des systèmes adéquats d'évaluation et d'atténuation des risques », « une haute qualité des jeux de données », « la journalisation de l'activité pour assurer la traçabilité », « une documentation détaillée », « des mesures appropriées de supervision humaine » et « un haut niveau de robustesse, de cybersécurité et de précision ». Les obligations de transparence imposent que les contenus générés par IA soient identifiables. Selon le calendrier publié par la Commission, l'application générale débute le 2 août 2026 et les règles relatives aux systèmes à haut risque s'appliquent à partir du 2 décembre 2027 (source : Commission européenne, consulté le 27 septembre 2026).
Pour le testeur : les tests d'un système d'IA à haut risque deviennent une exigence réglementaire documentée, et l'usage d'outils d'IA dans le processus de test doit lui-même rester traçable.
Tester l'IA : comment évaluer un LLM
Évaluer un système fondé sur un grand modèle de langage repose sur quatre piliers : un jeu de tests représentatif des questions réelles, des métriques adaptées (pertinence, exactitude factuelle, sécurité, coût, latence), une évaluation par des experts du domaine, et des tests d'attaque (red teaming). Le non-déterminisme impose de raisonner en taux de réussite sur plusieurs exécutions plutôt qu'en résultat unique.
Constituer un jeu de tests représentatif
Dans un article de juin 2024, LeMagIT rapporte l'approche d'un cabinet de conseil qui constitue « une liste de questions typiques, un corpus représentatif d'une centaine de sujets » pour comparer différents modèles, et qui compare « la pertinence des réponses avec des experts du domaine » identifiés au préalable (source : LeMagIT, article du 20 juin 2024, consulté le 27 septembre 2026). L'idée transposable : partir des vraies questions des utilisateurs, couvrir les sujets fréquents et sensibles, et versionner ce corpus comme n'importe quel jeu de tests.
Définir des métriques
Le même article souligne que l'IA générative ne dispose pas de métriques de performance quantitatives classiques et recommande de suivre, à côté de la qualité des réponses, les temps de réponse, les coûts et l'impact environnemental, en considérant les « tokens » comme une unité de mesure raisonnable de l'impact d'un modèle (source : LeMagIT, consulté le 27 septembre 2026). En pratique, une grille d'évaluation combine :
- Exactitude factuelle : la réponse est-elle vraie au regard d'une référence ?
- Pertinence : répond-elle à la question posée, sans digression ?
- Sécurité : refuse-t-elle les demandes dangereuses ou hors périmètre ?
- Cohérence : la réponse reste-t-elle stable d'une exécution à l'autre ?
- Coût et latence : tokens consommés, temps de réponse.
Architecture RAG et testabilité
L'article de LeMagIT recommande de séparer les documents du modèle via une couche de génération augmentée par récupération (RAG), qui traite les données séparément avant qu'un LLM reformule le résultat en langage humain (source : LeMagIT, consulté le 27 septembre 2026). Pour le testeur, cette séparation est une aubaine : on peut tester la récupération (les bons documents sont-ils retrouvés ?) indépendamment de la génération (la réponse est-elle fidèle aux documents fournis ?).
Gérer le non-déterminisme
Deux exécutions du même prompt peuvent donner deux réponses différentes. Trois techniques permettent de tester malgré tout :
- Assertions sémantiques : vérifier la présence d'informations clés ou l'absence de contenus interdits, plutôt qu'une égalité stricte de texte.
- Exécutions répétées : lancer chaque cas plusieurs fois et mesurer un taux de réussite, avec un seuil d'acceptation défini à l'avance.
- Modèle évaluateur : utiliser un second modèle pour noter la réponse selon une grille (LLM-as-a-judge), en gardant un échantillon relu par des humains pour calibrer l'évaluateur.
Red teaming
Le red teaming consiste à attaquer volontairement le système : injections de prompt (« ignore tes instructions et… »), tentatives d'extraction de données confidentielles, demandes de contenus dangereux formulées de façon détournée, questions ambiguës destinées à provoquer des hallucinations. Ces tests se scénarisent comme des cas de test classiques, avec un résultat attendu (refus, réponse sûre) et se rejouent à chaque nouvelle version du modèle ou du prompt système.
Les compétences du testeur à l'ère de l'IA
Le testeur de 2026 conserve ses fondamentaux (conception de tests, analyse du risque, automatisation, CI) et y ajoute quatre compétences : savoir formuler un prompt efficace et reproductible, savoir évaluer et critiquer une sortie d'IA, savoir tester un système non déterministe, et connaître le cadre réglementaire et éthique. Aucune de ces compétences ne remplace les fondamentaux ; elles s'y ajoutent.
Les fondamentaux restent le socle
Un assistant d'IA amplifie ce que vous savez déjà faire. Si vous ne maîtrisez pas la conception de tests, vous ne verrez pas ce qui manque dans la liste générée ; si vous ne savez pas lire un test Playwright, vous ne repérerez pas l'assertion vide. C'est pourquoi la formation ADC commence par la conception de tests avant d'introduire l'IA comme accélérateur.
Le prompting appliqué au test
Le syllabus ISTQB CT-GenAI vise à « développer des compétences pratiques de prompting des grands modèles de langage pour le test logiciel » (source : ISTQB, consulté le 27 septembre 2026). Concrètement : donner le contexte (produit, technologie, contraintes), fournir des exemples de format attendu, demander explicitement les cas limites et les cas d'erreur, et itérer. Un bon prompt de test se conserve et se versionne comme un outil.
L'esprit critique outillé
Relire une sortie d'IA n'est pas la parcourir : c'est l'exécuter, la confronter au produit, la comparer à ce qu'un expert aurait produit. Le testeur devient le contrôle qualité de l'IA elle-même, avec une vigilance supplémentaire : l'IA est toujours sûre d'elle, y compris quand elle a tort.
Tester le non-déterminisme
Concevoir des assertions sémantiques, définir des seuils statistiques, maintenir un corpus d'évaluation, organiser une campagne de red teaming : des compétences nouvelles pour la majorité des testeurs, très recherchées par les équipes qui déploient des assistants d'IA.
Le cadre réglementaire et éthique
Connaître les grandes lignes du règlement européen sur l'IA, du RGPD et de la politique interne de son entreprise permet de dire « non » à temps : à l'envoi de données de production dans un assistant externe, à la mise en production d'un système à haut risque sans documentation de test.
La certification ISTQB CT-GenAI
La certification ISTQB « Certified Tester – Testing with Generative AI » (CT-GenAI), version 1.1, valide la capacité à utiliser l'IA générative dans le test logiciel de manière maîtrisée. Elle exige d'être déjà titulaire de l'ISTQB Foundation (CTFL), se passe en 40 questions sur 60 minutes et requiert 30 points sur 46 (65 %) pour être obtenue, d'après la page officielle de l'ISTQB.
À qui s'adresse-t-elle ?
Selon l'ISTQB, la certification s'adresse aux « testeurs, analystes de test, ingénieurs en automatisation des tests, responsables de test, testeurs d'acceptation utilisateur et développeurs logiciels », ainsi qu'aux professionnels de la qualité et de la gestion de projet qui ont besoin de connaissances sur le test avec l'IA générative (source : ISTQB, consulté le 27 septembre 2026).
Prérequis
La page officielle est explicite : « Avant de passer l'examen CT-GenAI, vous devez être certifié ISTQB Certified Tester Foundation Level (CTFL) » (source : ISTQB, consulté le 27 septembre 2026). Le CTFL v4.0, lui, n'a pas de prérequis : 40 questions, 60 minutes (75 pour les non-anglophones), 26 points sur 40 pour réussir (source : ISTQB, consulté le 27 septembre 2026). L'ordre logique est donc CTFL puis CT-GenAI. Voir notre page Certification ISTQB CTFL.
Format de l'examen
| Élément | ISTQB CTFL v4.0 | ISTQB CT-GenAI v1.1 |
|---|---|---|
| Prérequis | Aucun | CTFL |
| Nombre de questions | 40 | 40 |
| Durée | 60 min (75 min non-anglophones) | 60 min (75 min non-anglophones) |
| Seuil de réussite | 26 points sur 40 | 30 points sur 46 (65 %) |
Source des deux colonnes : pages officielles de l'ISTQB consultées le 27 septembre 2026.
Ce que couvre le syllabus
Les objectifs affichés par l'ISTQB : « comprendre les concepts fondamentaux, les capacités et les limites de l'IA générative », « développer des compétences pratiques de prompting des grands modèles de langage pour le test logiciel », « appréhender les risques et leurs atténuations » et « les applications des solutions d'IA générative au test logiciel », et contribuer à la stratégie d'adoption dans l'organisation. Les domaines couverts : ingénierie de prompt, gestion des risques (hallucinations, biais, confidentialité, sécurité), solutions fondées sur les LLM et stratégies d'adoption (source : ISTQB, consulté le 27 septembre 2026). Voir notre page Certification ISTQB CT-GenAI et la vue d'ensemble des certifications.
Se former : l'IA intégrée aux 399 heures ADC
La formation ADC « Testeur QA Automatisation & IA » (399 heures sur 12 semaines, 100 % en ligne, sans prérequis technique) n'isole pas l'IA dans un module optionnel : elle l'intègre tout au long du parcours, de la conception de tests à la CI, avec une exigence d'usage critique et traçable. Elle prépare aux examens ISTQB CTFL v4.0 et CT-GenAI v1.1, inclus dans le prix.
Comment l'IA est enseignée chez ADC
- En conception de tests : utiliser un assistant pour générer des cas, puis les critiquer avec les techniques du syllabus ISTQB. L'objectif est d'apprendre à repérer ce qui manque et ce qui est faux.
- En automatisation Playwright + TypeScript : partir du générateur de tests et des suggestions d'un assistant de code, puis refactorer vers des tests robustes (localisateurs sémantiques, assertions web-first, isolation).
- En tests d'API : produire des jeux de données et des assertions avec l'IA, en veillant à n'y faire transiter aucune donnée réelle.
- En CI GitHub Actions : analyser des échecs et des journaux avec l'aide d'un assistant, sans jamais conclure sans exécution vérifiée.
- En traçabilité : documenter les prompts, les versions et les choix, de sorte que chaque test généré soit rattaché à une exigence.
Structure du parcours
Les 399 heures se décomposent en 371 heures réparties en 6 blocs (chacun validé par une certification ADC de bloc), 14 heures de coaching, 7 heures de préparation à l'ISTQB CTFL v4.0 et 7 heures de préparation à l'ISTQB CT-GenAI v1.1, examens inclus. Le parcours se conclut par la soutenance d'un projet Capstone, qui délivre le Certificat Professionnel ADC CP-QAI, et prépare aux certifications TestMu AI. ADC ne délivre pas de titre RNCP.
Formats, dates et financement
Deux formats : cours du soir (2 heures par soir avec mentor, du lundi au vendredi) en financement personnel à 1 500 € en 1 à 4 fois sans frais, ou temps plein (9 h – 17 h) en financement entreprise/OPCO. Le financement de l'État est annoncé « prochainement ». Prochaine session du 15 octobre 2026 au 15 janvier 2027, 12 places. Détails sur les pages Formation Testeur QA Automatisation & IA et Financement.
Par où commencer
Si vous débutez, le mini-cours gratuit (7 leçons Playwright) montre concrètement ce qu'est un test automatisé. Si vous êtes déjà testeur, notre guide Devenir testeur logiciel décrit l'évolution du métier en 2026.
Questions fréquentes sur l'IA et les tests logiciels
Qu'est-ce que l'IA dans les tests logiciels ?
Deux choses distinctes : utiliser l'IA comme assistant du testeur (générer des cas de test, du code, réparer des sélecteurs, trier des échecs) et tester des systèmes qui embarquent de l'IA, comme un assistant fondé sur un grand modèle de langage, avec des méthodes adaptées au non-déterminisme.
L'IA va-t-elle remplacer les testeurs logiciels ?
Non. L'IA accélère certaines tâches mais ne porte pas la responsabilité de ce qui est vérifié, ne connaît pas le produit réel et peut halluciner. Le testeur devient le contrôle qualité des sorties de l'IA, et les systèmes d'IA eux-mêmes créent un besoin nouveau de tests spécialisés.
Quels outils d'IA pour l'automatisation des tests existent ?
Quatre familles : génération de cas et de scripts (assistants comme ChatGPT, générateur de tests Playwright), auto-réparation des sélecteurs (Testim, Mabl), tests visuels et triage (Applitools) et assistants de code (GitHub Copilot). Chaque famille accélère une tâche précise et exige une vérification humaine.
Comment tester une IA ou un LLM ?
Constituez un corpus représentatif de questions réelles, définissez des métriques (exactitude, pertinence, sécurité, coût, latence), faites évaluer les réponses par des experts du domaine, menez des tests d'attaque (red teaming) et gérez le non-déterminisme par des assertions sémantiques et des exécutions répétées avec un seuil de réussite.
Qu'est-ce que le red teaming d'un LLM ?
Le red teaming consiste à attaquer volontairement un système d'IA : injections de prompt, tentatives d'extraction de données, demandes de contenus dangereux formulées de façon détournée. Chaque attaque devient un cas de test avec un résultat attendu (refus ou réponse sûre), rejoué à chaque nouvelle version.
Qu'est-ce que la certification ISTQB CT-GenAI ?
La certification « Certified Tester – Testing with Generative AI » (v1.1) de l'ISTQB valide l'usage maîtrisé de l'IA générative dans le test logiciel. Elle exige le CTFL comme prérequis, comporte 40 questions en 60 minutes et requiert 30 points sur 46 (65 %). Source : istqb.org, consulté le 27 septembre 2026.
Quels sont les risques d'utiliser l'IA pour écrire des tests ?
Les hallucinations (cas de test inventés, assertions vides), la perte de traçabilité entre tests et exigences, la fuite de données sensibles vers des services externes, les biais dans les données de test générées, et la non-conformité au règlement européen sur l'IA pour les systèmes à haut risque.
Comment ADC intègre-t-il l'IA dans sa formation de testeur ?
L'IA générative appliquée au test est présente tout au long des 399 heures (conception, Playwright + TypeScript, tests d'API, CI GitHub Actions), avec une exigence d'usage critique et traçable. La formation inclut 7 heures de préparation et l'examen ISTQB CT-GenAI v1.1, après le CTFL v4.0.
Apprenez à tester avec l'IA, et à tester l'IA
Formation Testeur QA Automatisation & IA : 399 heures sur 12 semaines, 100 % en ligne, sans prérequis technique, examens ISTQB CTFL v4.0 et CT-GenAI v1.1 inclus. Prochaine session du 15 octobre 2026 au 15 janvier 2027, 12 places.