Offre de thèse
Évaluation et optimisation de Small Language Models (SLMs) domaine-spécifique pour les applications RH
Date limite de candidature
31-01-2027
Date de début de contrat
01-10-2026
Directeur de thèse
LAMIREL Jean-Charles
Encadrement
Co-encadrant : Takarinas Saber, University of Galway
Type de contrat
école doctorale
équipe
SYNALPcontexte
Le domaine RH cumule trois propriétés qui mettent en échec les méthodes d'évaluation existantes : les réponses attendues sont contextuelles, non factuelles, et juridiquement contraintes (droit du travail, RGPD, AI Act — systèmes RH classés à haut risque). Alors que médecine, droit et finance disposent déjà de modèles spécialisés et de benchmarks dédiés (Med-PaLM 2, LegalBench, BloombergGPT), aucun cadre d'évaluation scientifiquement fondé n'existe pour les RH. Trois verrous structurent le projet : (V1) l'absence de théorie de la mesure pour les tâches génératives à vérité faible, alors que les approches LLM-as-judge actuelles (MT-Bench, G-Eval) présentent des biais documentés et une fiabilité non établie sur les jugements normatifs ; (V2) l'absence de cadre pour arbitrer, lors de la spécialisation par PEFT/compression, entre qualité, équité et préservation de l'alignement de sécurité — un fine-tuning même bénin pouvant éroder cet alignement (Qi et al., 2024) ; (V3) la rareté et la sensibilité des données RH réelles (art. 9 RGPD), qui imposent de quantifier la substituabilité avec des données synthétiques sans amplifier les biais.spécialité
Informatiquelaboratoire
LORIA - Laboratoire Lorrain de Recherche en Informatique et ses Applications
Mots clés
Petits Modèles de Langues, Evaluation psychométrique , Optimisation multi-objectif , Equité algorithmique , Ressources humaines , Données synthétiques
Détail de l'offre
Cette thèse porte sur un problème scientifique encore largement ouvert : comment évaluer de manière fiable, puis optimiser conjointement, des modèles de langue compacts (Small Language Models, SLMs) spécialisés dans un domaine où la notion de « bonne réponse » n'est ni factuelle, ni univoque, mais contextuelle, subjective et juridiquement contrainte. Le domaine des ressources humaines (RH), retenu comme terrain d'étude, cumule ces trois propriétés : les réponses attendues dépendent du contexte organisationnel, font l'objet de désaccords légitimes entre experts, et sont encadrées par le droit du travail, le RGPD et l'AI Act européen, qui classe les systèmes d'IA appliqués aux RH parmi les systèmes à haut risque. Alors que le médical, le juridique et la finance disposent de modèles spécialisés et de benchmarks dédiés (Med-PaLM 2, LegalBench, BloombergGPT), le domaine RH ne dispose à ce jour d'aucun cadre d'évaluation scientifiquement fondé. La thèse propose (i) une théorie de la mesure pour les tâches génératives à vérité de référence faible, opérationnalisée dans un benchmark public HR-Eval doté de garanties psychométriques explicites (accord inter-annotateurs, fiabilité des juges LLM, sensibilité aux biais) ; (ii) une formalisation de la spécialisation de SLMs comme problème d'optimisation multi-objectif (qualité métier, équité, coût computationnel), résolu sur le front de Pareto plutôt que par agrégation ad hoc ; et (iii) une méthodologie de constitution de corpus sensibles combinant données réelles anonymisées et données synthétiques, avec quantification du biais introduit par la synthèse. Le cadre industriel CIFRE, fourni par la suite SaaS RH OloSuite, garantit l'accès aux données, la validation écologique des résultats et le transfert des contributions.
Keywords
Small Language Models, Psychometric evaluation, Multi-objective optimization, Algorithmic fairness, Human resources, Synthetic data
Subject details
This thesis addresses a scientific problem that remains largely open: how to reliably evaluate, and then jointly optimize, compact language models (Small Language Models, SLMs) specialized for a domain where the notion of a “good answer” is neither factual nor unequivocal, but contextual, subjective, and legally constrained. The human resources (HR) domain, chosen as the field of study, combines these three properties: expected answers depend on organizational context, are subject to legitimate disagreement among experts, and are governed by labor law, the GDPR, and the European AI Act, which classifies AI systems applied to HR among high-risk systems. While medicine, law, and finance already have specialized models and dedicated benchmarks (Med-PaLM 2, LegalBench, BloombergGPT), the HR domain currently has no scientifically grounded evaluation framework. This thesis proposes (i) a measurement theory for generative tasks with weak ground truth, operationalized in a public benchmark, HR-Eval, with explicit psychometric guarantees (inter-annotator agreement, reliability of LLM judges, bias sensitivity); (ii) a formalization of SLM specialization as a multi-objective optimization problem (business quality, fairness, computational cost), solved on the Pareto front rather than through ad hoc aggregation; and (iii) a methodology for building sensitive corpora that combines anonymized real data with synthetic data, with quantification of the bias introduced by synthesis. The CIFRE industrial framework, provided by the OloSuite HR SaaS suite, guarantees data access, the ecological validation of results, and the transfer of contributions.
Profil du candidat
Le candidat ou la candidate est titulaire d'un Master 2 ou d'un diplôme d'ingénieur en informatique, avec une spécialisation en apprentissage automatique et/ou traitement automatique des langues. Le profil recherché associe une solide formation en apprentissage automatique et en statistiques (tests d'hypothèses, mesures d'accord inter-annotateurs, estimation d'incertitude), une maîtrise de Python et de l'écosystème deep learning (PyTorch, Hugging Face Transformers/PEFT), ainsi qu'une expérience pratique du fine-tuning ou de l'évaluation de modèles de langue (projet de M2, stage ou contribution open source). Des notions d'optimisation multi-objectif, une sensibilité aux questions d'équité algorithmique et de conformité réglementaire (RGPD, AI Act), ainsi qu'un français courant utile pour l'annotation du corpus RH, seront appréciés. Rigueur expérimentale, autonomie et capacité à évoluer dans un double environnement laboratoire/entreprise sont attendues, tout comme un intérêt pour les applications à impact sociétal et l'IA responsable.
Candidate profile
The candidate holds a Master's degree (M2) or an engineering degree in computer science, with a specialization in machine learning and/or natural language processing. The sought profile combines solid training in machine learning and statistics (hypothesis testing, inter-annotator agreement measures, uncertainty estimation), proficiency in Python and the deep learning ecosystem (PyTorch, Hugging Face Transformers/PEFT), and hands-on experience with fine-tuning or evaluating language models (M2 project, internship, or open-source contribution). Notions of multi-objective optimization, sensitivity to algorithmic fairness and regulatory compliance issues (GDPR, AI Act), and fluent French — useful for the HR corpus and annotation work — are a plus. Experimental rigor, autonomy, and the ability to work across a dual laboratory/company environment are expected, along with an interest in socially impactful applications and responsible AI.
Référence biblio
Abdin et al. (2024) ; Dastin (2018) ; Dettmers et al. (2023) ; Es et al. (2023) ; Guha et al. (2023) ; Hu et al. (2021) ; Liu et al. (2023) ; Patterson et al. (2021) ; Qi et al. (2024) ; Rafailov et al. (2023) ; Raghavan et al. (2020) ; Saber et al. (2018) ; Singhal et al. (2023) ; Soudani, Kanoulas & Hasibi (2024) ; Strubell, Ganesh & McCallum (2019) ; Tambe, Cappelli & Yakubovich (2019) ; Wei et al. (2022) ; Zheng et al. (2023). (liste complète avec DOI/arXiv déjà disponible dans la proposition de thèse PDF)

