La professeure Mary Yazbeck, directrice de l’ETIB. Photo DR
Quel constat sur le marché du travail ou chez vos diplômés a déclenché la création de ce diplôme ?
L’essor de l’IA générative s’est considérablement accentué ces derniers temps. Les organisations ont un besoin croissant de personnes capables d’évaluer la qualité des contenus produits par ces systèmes, de préparer les données, de contrôler la terminologie, d’identifier les biais et les erreurs, de contextualiser les résultats et de garantir leur fiabilité. Nous avons donc considéré que la bonne réponse n’était pas d’apprendre simplement à nos diplômés à « utiliser l’IA », mais de leur permettre de comprendre ce qui se passe derrière l’interface. Par ailleurs, les systèmes d’IA sont alimentés par du langage et des données, mais les spécialistes du langage interviennent encore trop souvent à la fin de la chaîne lorsqu’il s’agit de corriger ou d’évaluer le résultat. Nous voulons les faire intervenir beaucoup plus tôt, dès l’identification des besoins, la constitution et l’annotation des données, la définition des critères de qualité et l’évaluation des systèmes. C’est pourquoi nous avons résumé notre démarche en quatre principes : comprendre avant d’utiliser, construire avant de consommer, évaluer avant de faire confiance et demeurer humainement responsable à chaque étape.
À qui s’adresse ce DU, et quels sont les prérequis, notamment techniques ?
Le DU s’adresse prioritairement aux professionnels et diplômés des professions langagières : traducteurs, interprètes, réviseurs, rédacteurs, spécialistes de la communication multilingue, enseignants et autres profils dont l’activité repose fortement sur le langage. Il peut également accueillir des profils provenant de disciplines connexes, pour autant qu’ils disposent des compétences linguistiques nécessaires et que leur projet soit cohérent avec les objectifs de la formation. Nous avons délibérément conçu le parcours pour qu’une formation préalable en informatique ne soit pas exigée. Ce que nous demandons avant tout, c’est une expertise ou une forte compétence linguistique, une capacité d’analyse et la volonté d’entrer progressivement dans la logique des technologies langagières.
Qu’est-ce qui distingue ce nouveau DU des formations en traitement automatique des langues ou en IA existant déjà dans la région ?
Ce sont les besoins des professionnels langagiers et la transformation de leurs métiers qui nous ont poussés à lancer ce DU. Les formations en intelligence artificielle ou en traitement automatique des langues s’adressent généralement en priorité à des ingénieurs, à des informaticiens ou à des spécialistes des données. Notre DU emprunte une autre voie : il part de l’expertise linguistique, traductionnelle, terminologique et interculturelle pour amener progressivement les participants vers la technologie.Les participants commenceront donc par comprendre les principes du traitement des langues et de la traduction automatique, puis ils apprendront à construire et à préparer les données linguistiques qui alimentent les systèmes. Ils travailleront par la suite sur les grands modèles de langage, leur intégration et surtout leur évaluation, avant d’aborder l’ingénierie des connaissances, les questions éthiques et la responsabilité professionnelle. La formation se termine par un projet accompagné où les participants seront amenés, à partir d’une problématique concrète, à concevoir une solution, mobilisant les compétences acquises pendant le DU : analyse du besoin, collecte et préparation des données, sélection et intégration d’outils ou de modèles de traitement automatique des langues, développement d’une solution adaptée, évaluation et documentation de la démarche. Ce projet accompagné va permettre au participant de parcourir une chaîne complète, depuis l’identification d’un besoin réel jusqu’à l’évaluation de la solution proposée, tout en intégrant les dimensions méthodologiques et éthiques. Il est réalisé sous la supervision d’un encadrant et donne lieu à une soutenance.
Quelles sont les modalités pratiques : coût, calendrier de la première cohorte, nombre de places, bourses éventuelles ?
Ce DU qui débutera le 20 octobre représente 20 crédits ECTS étalés sur six mois à raison d’environ cinq heures d’enseignement par semaine et se poursuit par un projet accompagné sur deux mois. Il est entièrement proposé en ligne, pour permettre d’accueillir des professionnels se trouvant au Liban mais également à l’étranger. Les séances synchrones ont lieu deux fois par semaine de 17h à 19h30, heure de Beyrouth et sont enregistrées afin de permettre aux participants, notamment ceux qui travaillent ou vivent dans d’autres fuseaux horaires, de les revoir. Le coût total de la formation est de 4 000 dollars américains. Une possibilité d’échelonnement mensuel du paiement est prévue afin de rendre la formation plus accessible.
Pourquoi avoir choisi l’anglais comme langue d’enseignement, et l’arabe comme langue de travail, plutôt que le français, langue historique de l’USJ ?
Aujourd’hui, une grande partie de la documentation scientifique et technique, des environnements de développement, des interfaces, des modèles et des ressources liés à l’intelligence artificielle et au traitement automatique des langues est disponible en anglais. Nous avons donc voulu que les participants acquièrent la terminologie professionnelle qu’ils rencontreront dans les environnements technologiques internationaux.En revanche, nous avons tenu à ce que l’arabe soit une langue de travail centrale, parce qu’il représente à la fois notre environnement linguistique et un immense champ d’innovation. Le choix anglais-arabe est donc stratégique : l’anglais donne accès à l’écosystème technologique international, tandis que l’arabe constitue un terrain d’application, d’expérimentation et de développement particulièrement pertinent pour notre région. Le français conserve naturellement toute sa place dans l’environnement plurilingue de l’USJ et de l’ETIB. Sa maîtrise constituera ainsi un atout supplémentaire venant enrichir la dimension plurilingue de la formation.
Un traducteur sans formation en informatique peut-il réellement apprendre à construire des données ou à évaluer un grand modèle de langage en six mois, entièrement en ligne ?
Un professionnel langagier sait déjà analyser le langage, repérer les ambiguïtés, comparer des formulations. Il faut lui apporter la couche technologique qui lui manque, c’est-à-dire : la collecte, le nettoyage, la documentation des données de qualité, la construction d’un protocole d’évaluation, la définition des critères pertinents, l’analyse systématique des réponses, l’identification des erreurs récurrentes et la communication des résultats à une équipe technique. Par ailleurs, le format en ligne ne signifie pas que la formation est passive. Les participants travaillent sur des exercices, des données et des projets, avec un encadrement assuré par des spécialistes des langues et de l’intelligence artificielle.
Quels métiers vise-t-on concrètement à la sortie ?
Les participants seront capables d’évoluer vers des fonctions de spécialiste des données linguistiques, annotateur ou curateur de données, évaluateur de modèles de langage, spécialiste de la qualité linguistique des systèmes d’IA, spécialiste de la localisation et de la post-édition, consultant en technologies langagières ou encore spécialiste de l’ingénierie des connaissances. Ces fonctions peuvent venir compléter le métier initial de traducteur, d’interprète, de réviseur ou de rédacteur plutôt que nécessairement s’y substituer.
Le DU ambitionne-t-il de produire des ressources ou des corpus arabes ?
La langue arabe représente un formidable terrain de recherche, d’expérimentation et d’innovation. Lors de la table ronde, les difficultés concrètes du traitement automatique de l’arabe ont d’ailleurs été illustrées à travers le développement de notre plateforme d’auto-entraînement destinée aux apprentis-interprètes. Les équipes ont notamment rencontré des problèmes liés à la capacité des systèmes à distinguer certaines productions réelles des apprenants de ce que les modèles ont tendance à « normaliser » ou à corriger automatiquement. Le DU peut donc conduire à la constitution ou à l’amélioration de ressources linguistiques en arabe dans le cadre des travaux et des projets accompagnés.
Quelle place pour les dialectes, dont le libanais ?
Le dialecte libanais représente un terrain particulièrement intéressant en raison de la variation des usages, de l’alternance entre langues, de la translittération, de la coexistence de l’arabe standard moderne et du dialecte et de la diversité des pratiques à l’oral et sur les plateformes numériques. En conclusion, nous pouvons dire que notre objectif n’est donc pas de transformer un traducteur en ingénieur informatique en six mois, mais de former un professionnel langagier capable de comprendre suffisamment les technologies pour ne plus être seulement leur utilisateur final, mais pour participer à leur conception, à leur évaluation et à leur amélioration. C’est ce dialogue entre expertise linguistique et expertise technologique qui constitue l’ADN du diplôme.