Titre: Évaluation des agents de deep research : méthodes fiables et automatisées pour l'analyse de sorties longues en contexte scientifique Durée: 5 à 6 mois Date de début souhaitée: Janvier-Avril 2027 Lieu: Orange Recherche, 2 rue claude Chappe, Lannion 22300 Résumé L'IA agentique permet d'interroger de vastes ensembles de documents pour produire des synthèses structurées, recoupant des informations issues de sources diverses. Dans le domaine de la recherche scientifique, ces agents peuvent servir à établir un état de l'art, à acquérir de nouvelles compétences ou à explorer l'évolution de méthodes spécifiques. Cependant, dans le contexte scientifique, les productions longues doivent respecter des critères stricts : langage formel, sources vérifiées en double aveugle, exactitude des informations, absence d'hallucinations, style concis et précis. L'évaluation de ces sorties longues est une tâche chronophage pour les humains, tandis que les méthodes automatiques existantes ne sont pas toujours adaptées ou fiables. Face à ce constat, l'une des pistes émergentes dans la littérature scientifique actuelle est le rubric scoring : des critères d'évaluation clairs et structurés, pouvant varier en fonction de la tâche demandée. Ces rubriques sont ensuite évaluées de manière automatique, notamment via des approches LLM-as-a-judge. Le rubric scoring constituera ainsi une piste de recherche centrale à explorer. Vous serez amené à comparer différentes méthodes de construction des rubriques, qu'elles soient manuelles ou automatiques, pouvant inclure notamment le fine-tuning de petits modèles. Vous serez également amené à évaluer la fiabilité des méthodes LLM-as-a-judge à répondre à ces rubriques afin de fournir l'évaluation finale, en cherchant le meilleur compromis entre performance et frugalité des méthodes d'évaluation. Ce stage donnera lieu à la rédaction d'un rapport de stage détaillant la démarche et les résultats obtenus. Selon l'avancement et la qualité des travaux, il pourra également déboucher sur la rédaction et la soumission d'un article scientifique. Références [1] Sharma, Manasi, et al. "Researchrubrics: A benchmark of prompts and rubrics for evaluating deep research agents. https://arxiv.org/abs/2511.07685 " International Conference on Learning Representations. Vol. 2026. 2026. [2] Xu, Tianze, et al. "Researcherbench: Evaluating deep ai research systems on the frontiers of scientific inquiry. https://arxiv.org/abs/2507.16280 "arXiv preprint arXiv:2507.16280 (2025). [3] Tang, Jiaming, et al. "Quest: Query-aware sparsity for efficient long-context llm inference. https://arxiv.org/abs/2406.10774 " arXiv preprint arXiv:2406.10774 (2024). Votre profil - En dernière année de master Informatique ou d'école d'ingénieur informatique. - Avec une spécialisation en traitement automatique des langues ou en data & IA - Vous avez des compétences en deep learning - Vous avez des compétences en python et l'habitudes d'utiliser les librairies data & ML Lien pour candidater: https://orange.jobs/fr/fr/job/CTS-2026-54553/Stage-Recherche-%C3%89valuation-des-agents-de-deep-research-F-H