AI Evaluation Engineer — Agentic Systems (H/F)
Qu'attendez-vous? Rejoignez l'aventure avec nos Techos !
Nous répondons généralement sous deux semaines
Dans le cadre de notre croissance et afin de renforcer notre Squad AI Quality & Evaluation, nous recherchons un.e AI Evaluation Engineer — Agentic Systems.
Intégré.e au sein de nos équipes, en télétravail avec une flexibilité sur la région parisienne, vous interviendrez sur l'un des métiers les plus stratégiques de l'IA : garantir, mesurer et fiabiliser le comportement des agents et systèmes multi-agents avant leur mise en production. Un domaine qui s'invente aujourd'hui, où vous mettrez en pratique vos acquis en QA et développerez de nouvelles compétences à la frontière de l'IA.
MISSIONS:
=> Concevoir des stratégies d'évaluation pour agents et systèmes multi-agents : trajectoires, orchestration d'outils (tool use), raisonnement multi-étapes, gestion de mémoire et de contexte
=> Évaluer au-delà du résultat final : détecter les échecs intermédiaires, la propagation d'erreurs et les dérives de comportement le long de la trajectoire
=> Concevoir et éprouver des workflows agentiques : décomposition de tâches, enchaînement d'agents (planner / executor / critic), points de contrôle et garde-fous
=> Construire des jeux de tests et scénarios de simulation d'utilisateurs : personas, cas limites, tests adversariaux
=> Exploiter le prompt engineering comme levier d'évaluation : prompts de test, LLM-as-a-judge, rubriques d'évaluation
=> Industrialiser l'évaluation dans les pipelines CI/CD : évaluation automatisée, détection de régressions, quality gates avant déploiement
=> Définir les métriques qui comptent pour un agent : réussite de tâche, fidélité, robustesse, sécurité, coût, latence, consommation de tokens
=> Combiner évaluation automatisée et évaluation humaine (human-in-the-loop), et arbitrer entre les deux
=> Documenter et diffuser les bonnes pratiques d'évaluation agentique auprès des équipes
PROFIL:
=> Idéalement une première expérience en évaluation de systèmes IA — en poste, en freelance ou même sur un projet personnel sérieux : ce métier s'invente, nous valorisons ce que vous avez déjà exploré par vous-même
=> Compréhension de ce qui rend l'évaluation d'un agent spécifique : non-déterminisme, comportement probabiliste, trajectoires multi-étapes, échecs intermédiaires, absence de vérité unique — on n'évalue pas une sortie, on score une trajectoire (chaque appel d'outil, chaque état intermédiaire devient une surface d'évaluation)
=> Familiarité avec les approches de scoring : graders à base de règles (code-based), LLM-as-a-judge pour l'ouvert, évaluation humaine — et le bon sens de savoir quand combiner les trois
=> Maîtrise réelle d'au moins un framework ou plateforme d'évaluation IA : DeepEval, Ragas, TruLens, Giskard, Maxim AI, Braintrust, Langfuse, Opik ou équivalent
=> Capacité à construire un eval harness et des jeux de tests : cas experts (goldens), minage de traces de production, scénarios adversariaux
=> Bonnes pratiques de prompt engineering appliquées au test et à l'évaluation : conception de rubriques, prompts de test, calibration du juge
=> Maîtrise de Python et de l'automatisation de tests
=> Sensibilité sécurité IA, robustesse et reproductibilité
=> Une connaissance au moins générale du cadre réglementaire IA — EU AI Act (transparence, gestion des risques, littératie IA) et RGPD — et de son impact sur l'évaluation et la mise en production
=> Idéalement certifié.e ISTQB CT-AI (v2.0) et CT-GenAI — à défaut l'une des deux, avec l'envie d'obtenir la seconde
=> Socle solide en QA / test / qualité logicielle, ou en dev/data avec une vraie envie de basculer vers l'IA agentique
=> Anglais professionnel courant
SOFT SKILLS:
=> Passionné.e par les technologies innovantes et le champ de l'IA agentique
=> Rigoureux.se et doté.e d'un fort esprit critique : un tableau de bord tout vert ne vous suffit pas
=> Désireux.se de vous investir dans des projets challengeants et de gagner rapidement en responsabilités
=> Pédagogue, empathique et "Problem Solver" : vous rendez l'évaluation lisible et actionnable pour les équipes
=> Doté.e d'un excellent relationnel, d'un sens prononcé du service et de la qualité
=> Curieux.se et en veille active : un domaine qui évolue chaque semaine, et vous suivez
=> Excellent niveau de français à l'oral et à l'écrit, l'anglais professionnel étant ici indispensable
- Department
- AI Engineering
- Poste
- AI Evaluation Engineer
- Localisations
- Neuilly-sur-Seine
- Statut à distance
- Temporairement à distance
Neuilly-sur-Seine
Nous rejoindre signifie pour toi :
-
Développement Personnel
Apprendre et te former en expérimentant par toi-même. Faire tes armes sur de nouvelles techno dans notre propre laboratoire. -
Responsabilités
Assumer des responsabilités dans tes missions, laisser s’exprimer ta créativité et monter rapidement en compétences. -
Opportunités
Prendre part à notre croissance en t'investissant dans notre développement. Travailler sur des problématiques de haut niveau. -
Convivialité
Tes nouveaux collègues seront des amis, tu apprécieras le travail d’équipe et la collaboration à toute épreuve.
Engagement & Bienveillance
- Un accompagnement individuel dans la gestion de ta carrière et de tes projets, pour répondre au mieux à tes aspirations.
- Un coaching collectif via les conseils de notre coach sportif ainsi que la prise en charge de ton abonnement sportif annuel.
- De belles rencontres entre les salariés pour vivre des moments forts et fun tous ensemble.
À propos de DHM GROUP
De l’idée à sa réalisation, DHM IT s’appuie sur ses valeurs de transparence, de bienveillance et d’innovation pour accompagner ses clients d’un bout à l’autre de leur démarche de transformation digitale : penser et designer la solution, la développer, la maintenir et la faire évoluer.
En tant que smart ESN, nous proposons une approche 360 de la transformation numérique qui va projeter le client au cœur de l’innovation dans son propre projet, le tout dans une relation de partenariat Agile et bienveillante.