Accéder au meilleur modèle ne suffit plus à obtenir un agent IA fiable : la différence se joue dans ce qui l'entoure. Cet environnement s'appelle le harness, et il se règle comme un produit. Vous saurez quels leviers actionner, dans quel ordre, et quelles limites poser avant de confier de l'autonomie à un agent.
Harness d'agent IA : tout ce qui entoure le modèle
Le harness désigne la couche logicielle qui fait travailler un modèle de langage comme un agent. Simon Willison le décrit comme un logiciel qui sert de « harness » à un LLM : il ajoute des capacités au modèle via des prompts invisibles et des outils appelables. Un outil est une fonction que le harness met à disposition du modèle. Le harness repère l'appel d'outil dans la réponse, l'exécute, puis renvoie le résultat au modèle. C'est la boucle « LLM + prompt système + outils ».
Cette notion prolonge deux étapes que vous connaissez déjà. Le prompt engineering a servi à orienter les réponses. Le context engineering a ajouté des instructions personnalisées, de la mémoire, des connecteurs et des serveurs MCP. Le harness engineering va plus loin : il organise l'orchestration complète autour de l'agent et décide de ce qu'il peut faire ou non.
Une analogie automobile aide à situer les rôles. Le LLM est le moteur. Le harness regroupe les roues, les sièges, le tableau de bord, c'est-à-dire tout ce que vous pouvez personnaliser autour du moteur.
Gabriel Chua (OpenAI) résume Codex par une formule : modèle + harness + surfaces. Le modèle et le harness forment l'agent, les surfaces sont les interfaces pour l'utiliser.
Le modèle et le harness ne sont pas deux couches étanches
Selon Gabriel Chua, les modèles Codex sont entraînés en présence du harness : usage d'outils, boucles d'exécution, compaction, vérification itérative. Le schéma « moteur + carrosserie » est donc une simplification utile, pas une séparation stricte. Le harness de Codex est par ailleurs open source (dépôt openai/codex).
Si vous abordez les agents depuis le développement, notre analyse Vibe Coding vs ingénierie agentique montre pourquoi ces fondations comptent. Pour le cadre général, voyez notre framework complet pour comprendre l'IA agentique.
Trois niveaux de harness : du produit fermé au harness maison
Le niveau de personnalisation dépend du produit que vous choisissez. Plus vous montez, plus vous maîtrisez chaque pièce, et plus vous en êtes responsable.
| Niveau | Exemples | Ce que vous pouvez régler | Profil adapté |
|---|---|---|---|
| 1. Harness de produit | Modes agentiques de ChatGPT et de Claude (Cowork) | Connecter des outils et modifier certains éléments, sans tout personnaliser | Utilisateurs avancés, équipes métier |
| 2. Harness d'agent avancé | Claude Code, Codex | Beaucoup plus de réglages : instructions, skills, outils, automatisations | Experts qui optimisent le moindre détail |
| 3. Harness sur mesure | Votre modèle favori (LLM ou open source) et vos propres composants | Toutes les pièces | Équipes techniques qui veulent une solution 100 % personnalisée |
Cet article se concentre sur les niveaux 1 et 2. Ils couvrent la majorité des besoins sans développer votre propre orchestration.
Premier levier : le contexte
Le contexte regroupe les instructions, les connaissances et les données accessibles à l'agent. C'est le levier le plus rentable à travailler en premier. Il se décompose en quatre blocs.
- Instructions : les consignes système sont ancrées dans le produit et non modifiables. Vous agissez sur les fichiers d'instructions personnalisées : CLAUDE.md côté Claude, AGENTS.md côté OpenAI. L'agent les lit en premier pour orienter ses réponses.
- Connaissances : métadonnées de profil (nom, localisation), mémoire native et mémoire que vous ajoutez.
- Skills : une skill contient des instructions sur une tâche, éventuellement des références (documents), des assets (logos, modèles) et des scripts exécutables.
- Données externes : un dossier local, une base de données, tout ce que le modèle ne connaît pas.
Les skills reposent sur un dévoilement progressif. L'agent ne voit d'abord que le nom et la description de chaque skill, et ne l'active que s'il la juge pertinente. Le harness orchestre ainsi l'appel de la bonne connaissance au bon moment, sans saturer la fenêtre de contexte.
Ce mécanisme gagne du terrain. Simon Willison note que la plupart des outils d'agents de code l'adoptent rapidement, et que des projets comme Remotion, Supabase, Vercel et Prisma publient des skills officiels pour aider les agents à utiliser leurs outils.
Scénario : un responsable des opérations en Europe
Prenez un responsable des opérations d'une plateforme de transport qui pilote chauffeurs et courses dans plusieurs pays. Son harness de contexte peut s'assembler en quatre gestes :
- Créer un projet dédié.
- Rédiger un fichier AGENTS.md qui décrit son rôle, son périmètre et ses responsabilités.
- Déposer dans le dossier les données utiles : classeurs Excel, revues d'activité, modèles de présentation, analyses de la demande par ville.
- Transformer le modèle de fiche d'inscription des chauffeurs en skill, pour que l'agent la génère à chaque nouvelle candidature.
L'agent dispose alors d'instructions, de connaissances métier, d'un périmètre de données borné et d'une méthode de travail reproductible. Vérifiez ce périmètre en lui demandant de lister les données auxquelles il a accès : il ne doit citer que celles que vous avez déposées.
Deuxième levier : les outils, ou ce que l'agent peut faire
Le contexte apporte de la connaissance. Les outils donnent des actions sur des applications extérieures. Vous les branchent via des connecteurs et des serveurs MCP : messagerie, Notion, CRM, moteur de recherche.
Trois familles d'outils coexistent :
- Connecteurs et serveurs MCP : dans ChatGPT, vous les ajoutez via les plugins, ou via la rubrique MCP pour un serveur absent du catalogue.
- Outils via skills : un script de commande permet de piloter une application qui n'a ni connecteur ni serveur MCP et n'expose qu'une API.
- Outils embarqués : le computer use donne à l'agent la main sur votre poste, et les extensions de navigateur lui permettent d'agir dans Chrome.
Dans notre scénario, le connecteur Gmail permet de lire la demande d'un chauffeur. Un serveur MCP de recherche web alimente l'analyse de la demande. Le computer use saisit enfin des affectations dans une application web qui n'a pas d'API exploitable : l'agent ouvre le navigateur et saisit lui-même les valeurs.
Trop d'accès est la première cause de dérive
Un harness sert autant à autoriser qu'à interdire. Délimitez les droits de chaque outil. Côté secrets, Simon Willison recommande que les identifiants visibles par un agent de code (clés AWS, par exemple) soient liés à des comptes hors production avec des plafonds de dépense stricts. Il ajoute que le harness doit gérer l'authentification sans jamais révéler la clé à l'agent. Coller une clé d'API dans une conversation va à l'encontre de ce principe : privilégiez la configuration native du connecteur et révoquez toute clé exposée.
Pour voir comment un éditeur structure ce harnais côté plateforme, lisez notre article sur les agents Copilot Studio et leur nouveau harnais.
Troisième levier : les automatisations
Une automatisation déclenche l'agent sans intervention humaine. Deux mécanismes existent, et ils se distinguent par leur déclencheur.
| Mécanisme | Déclencheur | Exemple | Ce qu'il mobilise |
|---|---|---|---|
| Tâche planifiée (loop) | Un moment dans le calendrier | Chaque lundi à 9 h, heure de Paris, analyser la demande autour d'un grand événement | Serveur MCP de recherche, instructions de restitution |
| Hook | Un événement précis | Réception d'un e-mail de chauffeur, création d'un contact CRM, arrivée d'une facture | Gmail, CRM, skill de fiche d'inscription |
Les automatisations ne fonctionnent que si les deux premiers leviers sont en place. Le hook de notre scénario lit l'e-mail du chauffeur dans Gmail, récupère ses informations dans HubSpot, génère la fiche avec la skill et prépare la réponse. Chaque étape s'appuie sur un outil du niveau 2 et sur une connaissance du niveau 1.
La tâche planifiée a été testée par une exécution unique avant d'être activée. Elle a produit des prévisions par zone et par période, avec trois scénarios : bas, central et haut. Reprenez ce réflexe : lancez toujours une exécution manuelle avant de laisser tourner une automatisation seule.
Levier bonus : les évaluations et l'optimisation continue
Sans évaluation, un humain relit chaque livrable et juge seul si l'agent a trop d'accès ou s'il peut travailler en autonomie. Avec des évaluations, l'agent contrôle d'abord sa propre sortie, la corrige, puis la renvoie jusqu'à un résultat satisfaisant. L'humain ne fait plus qu'une dernière vérification.
L'agent peut aussi évaluer ses accès, signaler un risque ou demander des moyens supplémentaires. Une skill d'amélioration continue nommée auto-research va dans ce sens : elle permet à l'agent de s'auto-évaluer en continu pour monter en qualité.
Cette auto-évaluation ne dispense pas du contrôle humain final. Elle réduit le nombre d'allers-retours, pas la responsabilité de celui qui valide.
Mesurez le taux de cache hit
Simon Willison rapporte que l'équipe Claude Code construit tout son harness autour du prompt caching. Elle surveille le taux de cache hit et déclare des incidents (SEV) quand il est trop bas, car il réduit les coûts et permet des limites d'usage plus généreuses. Si vous construisez votre propre harness, gardez un contexte stable d'une requête à l'autre pour en profiter.
Questions fréquentes
Qu'est-ce qu'un harness pour agent IA ?
C'est le logiciel qui entoure un modèle de langage pour en faire un agent : prompt système invisible, outils appelables, boucle d'exécution. Il détermine ce que l'agent sait, ce qu'il peut faire et ce qu'il n'a pas le droit de faire.
Faut-il changer de modèle ou optimiser le harness ?
Commencez par le harness : contexte, outils, automatisations et évaluations sont des leviers que vous maîtrisez immédiatement. Changer de modèle reste pertinent, mais seulement après avoir vérifié que le contexte et les accès de l'agent sont corrects. Gardez en tête que certains modèles sont entraînés avec leur harness, comme le précise Gabriel Chua pour Codex.
Comment limiter les risques liés aux identifiants d'un agent ?
Suivez la recommandation de Simon Willison : liez les identifiants visibles par l'agent à des comptes hors production avec des plafonds de dépense stricts. Laissez le harness gérer l'authentification sans jamais révéler la clé à l'agent.
Par où commencer : construire un premier harness en quatre actions
Partez de l'agent et non du scénario. Demandez-vous ce que votre agent doit savoir, pouvoir faire et déclencher seul, puis cherchez ce qui lui manque. Cette posture, qui consiste à se mettre à la place de l'agent pour connaître ses limites et adapter son environnement, améliore directement la qualité des livrables.
Les actions à lancer dans cet ordre
- Rédiger un fichier d'instructions (AGENTS.md ou CLAUDE.md) qui décrit votre rôle, votre périmètre et vos règles.
- Limiter les données accessibles au dossier de travail, puis demander à l'agent de les lister pour contrôler.
- Transformer une tâche répétitive en skill, avec son modèle et ses références.
- Brancher un seul outil à la fois, avec des droits minimaux et sans clé collée dans la conversation.
- Tester chaque automatisation par une exécution manuelle avant de l'activer.
- Ajouter une étape d'auto-évaluation, en gardant une validation humaine finale.
Si votre organisation débute avec les agents, restez au niveau 1 ou 2 et investissez dans le contexte et les skills. Si vous disposez d'une équipe technique et d'exigences de contrôle fortes, étudiez un harness sur mesure, en commençant par le harness open source de Codex.
Pour aller plus loin
- How coding agents work, Agentic Engineering Patterns (Simon Willison) : la boucle LLM + outils + prompt système qui constitue le harness.
- How I think about Codex (Simon Willison, citant Gabriel Chua) : la décomposition modèle, harness, surfaces, et l'entraînement du modèle avec son harness.
- Billets de Simon Willison sur les agents IA : des retours de terrain sur la conception de harness, dont le prompt caching.
- Copilot Studio août 2026 : GitHub Copilot harness en GA : le harness vu côté Microsoft et ses nouvelles capacités agents.
