ANR : Le Petit Camion

3 septembre 2026

« Le Petit Camion » : Limiter l’occurrence de biais attentionnels dans les Centres de Traitement de l’Alerte « Vous envoyez bien un petit camion, hein ? ». Cette phrase, en apparence anodine, est relevée à plusieurs reprises dans les propos d’un appelant d’un Centre de Traitement de l’Alerte CTA-CODIS. Elle est ignorée par l’opérateur, malgré le fait qu’elle soit répétée et prononcée avec une emphase spécifique. Lorsque les secours arrivent sur place avec leur véhicule standard d’intervention, ils découvrent que l’étroitesse de la rue les empêche d’atteindre le lieu du sinistre… Cet exemple illustre l’« effet Tunnel » qui correspond à « une baisse de l’attention à un moment donné, impliquant que l’opérateur fixe un élément en oubliant son environnement ». Bien que peu fréquent, ce phénomène peut intervenir au CTA/CODIS, qui réalise environ 360.000 décrochés par an (chiffres SDIS31), avec le stress et la fatigue associée. Chaque seconde compte et les opérateurs doivent à la fois prendre soin des requérants, pour qui la situation est exceptionnelle, et diriger l’échange pour extraire en priorité les éléments nécessaires à la qualification du sinistre, puis à la distribution des secours. Ce projet vise à aider les opérateurs en mettant à leur Plus d'infos

TALK

3 septembre 2026

Translation and Learning across Languages and Knowledge TALK project centers its efforts on addressing low-resource languages as targets, aiming to produce natural, expressive, and intelligible speech in these languages. Liste des partenaires : Responsable Scientifique pour le LIA : Salima Mdhaffar (Equipe SLG ) Date Début : 2026-10-01 Date Fin : 2030-10-01

Soutenance de thèse – Ryan Whetten – 10/07/2026

9 juillet 2026

Titre : Apprentissage autosupervisé efficace pour le traitement de la parole Lieu: Amphi Blaise Pascal, CERI Date: 10 Juillet 2026 à 13h00 Le jury sera composé de : Résumé : L’un des objectifs fondamentaux de l’intelligence artificielle est le développement de systèmes capables d’interagir avec les humains par la parole, notre forme de communication la plus naturelle. Ces dernières années, des progrès considérables ont été réalisés grâce à l’apprentissage auto-supervisé (SSL, self-supervised learning) —un paradigme d’apprentissage automatique dans lequel les cibles d’entraînement d’un modèle sont dérivées directement des données d’entrée elles-mêmes, réduisant ainsi la dépendance aux données annotées par des humains. Bien que les modèles de parole auto-supervisés aient atteint des performances de pointe dans diverses tâches—notamment la reconnaissance automatique de la parole, la vérification du locuteur et la traduction parole-texte—ils sont notoirement gourmands en ressources. Leur entraînement requiert d’immenses quantités de mémoire, des centaines de milliers d’heures d’audio, ainsi qu’un temps considérable, même sur des infrastructures de calcul haute performance. Ces exigences en ressources constituent des obstacles majeurs, limitant le développement et le déploiement de tels modèles. De plus, même pour ceux disposant d’un accès suffisant à ces ressources, le coût prohibitif de l’entraînement restreint la liberté d’expérimentation et Plus d'infos

Séminaire SLG – Hugo Leguillier – 19/06/2026

16 juin 2026

Date: Friday, June 19, from 1:00 p.m. Place: room S5 Speaker: Hugo Leguillier Title: On Low-Bit Quantization Errors in Speaker Verification: Diagnostic and Mitigation Abstract: Although low-bit quantization provides practical means to deploy speaker verification on resource-constrained devices, its effects on speaker verification performance remain poorly understood. In this paper, we study uniform K-means quantization-aware training of ResNet-36 and ResNet-200 through joint layer-wise and score-level analyses. Our layer-wise analysis highlights fragile components and shows that score degradation is not fully explained by weight distortion alone. We identify a clear knee point at 2 bits, with larger score drift and harmful decision flips concentrated near the FP32 threshold. Our score-level analysis reveals where and how score errors emerge under extreme quantization. Building on these findings, we propose a calibrated multi-precision cascade that resolves most trials at 2 bits and escalates only ambiguous cases, achieving performance close to FP32 while preserving the efficiency benefits of low-bit inference with substantially lower compute and memory costs.

Séminaire SLG – Hugo Daumain – 12/06/2026

10 juin 2026

Date: Friday, June 12, from 1:00 p.m. Lieu : Salle S5 Speaker: Hugo Daumain Title: From Self-Supervised Speech Models to Mixture-of-Experts for Robust Anti-Spoofing Abstract: Recent advances in speech generation have significantly improved the naturalness of synthetic speech, making spoofing detection increasingly challenging. A key limitation of current anti-spoofing systems is their limited robustness to unseen synthesis methods. In this work, we transform a self-supervised speech representation model into a Mixture-of-Experts (MoE) architecture to improve generalization. Feed-forward blocks in selected encoder layers are replaced by multiple expert networks controlled by a layer-wise gating mechanism, allowing experts to capture complementary acoustic patterns while preserving the representations learned during self-supervised pretraining. We further analyze the architectural choices affecting the performance of this MoE conversion and investigate the activation behavior of the experts. The proposed approach is evaluated on 14 spoofing datasets and reduces the macro EER from 5.46% to 4.81%, corresponding to 11.9% relative improvement over the baseline.

Séminaire SLG – Orane Dufour – 12/06/2026

10 juin 2026

Date: Friday, June 12, from 1:00 p.m. Lieu: Salle S5 Speaker: Orane Dufour Title: A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization Abstract: Speech anonymization is commonly evaluated using average-case metrics such as the equal error rate, which can hide large disparities in re-identification risks across individuals. In this paper, we conduct a large-scale per-speaker privacy analysis using a linkability-based metric under a worst-case scenario. Nearly 5,000 speakers are evaluated across multiple anonymization systems, attacker architectures, and conversation lengths. While linkability scores are highly polarized at the speaker level, the sets of easy to re-identify and hard to re-identify speakers vary substantially across configurations. We show that no single factor explains speaker vulnerability. Instead, the re-identification risk emerges from the interaction between the attacker, the anonymizer, and the amount of available speech. These results challenge the notion of intrinsic speaker-level privacy risks and emphasize the need for evaluation protocols that are explicitly conditioned on the attacker and anonymizer.

Séminaire SLG – Matthew Wiesner – 26/03/2026

26 mars 2026

Salle 5 – 12h00 Titre: Modélisation Extensible de Langues et d’Accents Résumé: Les modèles d’identification de langue (LID) à l’état de l’art fonctionnent de manière fiable pour une centaine de langues. Cependant, derrière le concept de langue se cache de nombreuses variations émanant d’accents et de dialectes divers. Il est tout simplement impossible d’annoter les données en prenant compte de toutes ces variations. De plus, la parole accentuée engendre un comportement inattendu des modèles de LID et très peu de données annotées existent pour pallier le problème. Ce manque d’annotation empêche aussi l’augmentation de donnée via la synthèse de parole accentuée. Ce séminaire aborde ces problématiques et propose une ébauche de solution fondée sur une collecte de données à grande échelle à partir de diffusions radiophoniques. Cela permet d’associer aux données des annotations indirectes sous forme de géolocalisations. Le séminaire explore ensuite le lien entre la robustesse aux accents et la capacité à modéliser des séquences. Enfin, nous montrons comment ces modèles permettent d’améliorer les modèles de LID, en particulier sur la parole accentuée, et de faciliter l’extraction automatique de données accentuées pour entrainer des systèmes de synthèse vocale.Bio: Matthew Wiesner est un chercheur à Johns Hopkins University et chercheur  at Plus d'infos

Soutenance de thèse – Manh Tuan NGUYEN – 25/03/2026

19 mars 2026

Date: mercredi 25 mars à 14h Lieu: amphithéâtre Blaise du CERI.  La présentation se déroulera en anglais.  Le jury sera composé de:  Titre: Évaluation perceptive des troubles de la parole et de la voix et son intégration dans un système automatique d’aide à la décision.Résumé: Les jugements perceptifs sont largement utilisés dans des domaines dépourvus de critères objectifs clairs ou de méthodes de mesure fiables, ce qui nécessite le recours à l’évaluation par des experts humains. Toutefois, ces jugements sont intrinsèquement subjectifs, ce qui entraîne souvent un manque de concordance et, par conséquent, une variabilité lorsque plusieurs experts évaluent le même matériau. Cette variabilité, appelée variabilité inter-juges, est généralement traitée par l’agrégation des scores ou par un vote majoritaire afin de produire une décision consensuelle. Bien qu’e!cace pour obtenir une décision finale, cette approche laisse largement inexplorées les causes sous-jacentes de la variabilité inter-juges.Cette thèse vise à expliquer la variabilité inter-juges plutôt que de considérer les décisions consensuelles comme une référence absolue. Nous soutenons que cette variabilité peut résulter de différences systématiques entre les experts, notamment en termes de parcours professionnel, de formation, mais également de dimensions perceptives privilégiées lors de l’évaluation. En réduisant les jugements individuels à un score consensuel unique, les approches traditionnelles Plus d'infos

Séminaire SLG – Tom Labiausse – 16/03/2026

12 mars 2026

16 mars à 13h Tom présentera ses derniers travaux sur Hibiki-Zero, un modèle de traduction simultanée de la parole vers la parole. Les améliorations par rapport à ses travaux précédents, Hibiki, sont vraiment très intéressantes et s’appuient sur une technique d’apprentissage par renforcement (GRPO). Utilisée comme le propose Tom, cette technique évite d’avoir à préparer des données d’apprentissage parole-parole alignées au niveau mot comme dans la première mouture d’Hibiki. Vous êtes invités à assister à cette présentation qui pourrait vous donner des idées d’application à certains de vos travaux. Pour plus d’information, vous pouvez consulter cette page web très instructive et accessible (exemples, code, article) :

Soutenance de thèse – Ahmed Njifenjou – 19/12/2025

18 décembre 2025

Date: Friday, December 19, at 2 p.m. Lieu: Ada amphitheater at CERI. The defense will be presented in English. Title: Open-Domain Conversational Agents with Transformer-Based Language Models: Toward Multilingualism and Personality  The jury will be composed of: – Lina M. Rojas-Barahona , HDR, Orange Innovation, Reviewer – Didier Schwab, Professor, LIG/GETALP, Université de Grenoble, Reviewer – Sophie Rosset, Professor, LISN, Université Paris Saclay, Examiner – David Traum, Professor, ICT, University of Southern California, Examiner – Bassam Jabaian, Associate Professor, LIA, Université d’Avignon, Thesis Co-supervisor – Fabrice Lefèvre, Professor, LIA, Université d’Avignon,  Thesis Director Abstract: Open-Domain Dialogue (ODD) systems are conversational agents designed for natural and open-ended human interaction. The proliferation of Conversational AI tools like ChatGPT has recently reshaped user expectations; beyond grammatical correctness, users now demand agents that demonstrate contextual understanding, cultural awareness, distinct personality, factual consistency, and other human-like conversational abilities. Despite the impressive progress, ODD systems development has long faced key limitations including strong linguistic bias towards English and Chinese, and the Open-Domain Paradox (ODP) (Skantze and Doğruöz, 2023), which constrains genuine conversational diversity and openness. This dissertation tackles these challenges by exploring multilingual and personality-centric strategies for building controllable and culturally adaptive ODD systems using Transformer-based Language Models. The research progresses along the following complementary axes.  First, we investigate Plus d'infos

1 2 3 7