Les petits modèles de langage à l’épreuve du terrain clinique au CHUV
L’intelligence artificielle générative suscite un intérêt croissant dans le domaine de la santé. Les grands modèles de langage (Large Language Models, ou LLM), à l’origine d’outils tels que ChatGPT, sont capables de comprendre, d’analyser et de générer du texte, ouvrant ainsi de nouvelles perspectives pour exploiter les vastes quantités d’informations contenues dans les dossiers médicaux, les comptes rendus et les lettres de sortie.
Toutefois, au-delà de leurs performances impressionnantes, une question essentielle se pose pour les institutions de santé : ces outils sont-ils suffisamment sûrs, fiables et compatibles avec les exigences de confidentialité pour être utilisés en pratique clinique ?
Une équipe du CHUV a cherché à répondre à cette question dans une étude publiée récemment dans le Journal of Medical Internet Research. Les chercheurs se sont intéressés à une catégorie particulière d’outils : les petits modèles de langage open source, qui peuvent être déployés directement au sein de l’infrastructure hospitalière sans recourir à des services cloud externes.
Évaluer l’IA sur des données cliniques réelles du CHUV
L’étude a comparé six modèles de langage open source, comptant entre 8 et 24 milliards de paramètres, à partir de données cliniques francophones du CHUV préalablement dé-identifiées.
Les modèles ont été évalués sur plusieurs tâches représentatives des besoins hospitaliers, notamment : l’extraction d’informations à partir de documents cliniques, l’identification de données personnelles protégées, la détection d’effets indésirables liés à l’immunothérapie, la traduction de lettres de sortie, la génération de résumés médicaux, la rédaction de documents destinés aux patients et l’aide à la décision clinique.
Plutôt que de s’appuyer uniquement sur des tests standard utilisés pour évaluer les modèles d’IA, l’équipe a testé les modèles dans des conditions proches de la réalité clinique : sur des documents locaux, en français et avec des contraintes techniques compatibles avec un déploiement hospitalier.
Des performances prometteuses, mais des limites importantes
Les résultats montrent que les petits modèles de langage peuvent être performants lorsqu’il s’agit de tâches bien définies.
Pour l’extraction d’informations, notamment la recherche d’éléments spécifiques dans de longues lettres de sortie, les modèles Llama 3.1 et Mistral Small ont obtenu des performances proches de la perfection.
Ces résultats suggèrent que ce type d’outil pourrait, à terme, faciliter certaines tâches administratives ou de recherche d’informations dans les dossiers médicaux.
Les performances diminuent toutefois de manière significative dès que les tâches requièrent un niveau de compréhension clinique plus avancé.
Pour l’identification des données de santé protégées, les meilleurs modèles évalués se sont révélés nettement moins performants qu’un modèle spécialisé de type RoBERTa préalablement entraîné sur des documents cliniques du CHUV. De même, la détection d’effets indésirables liés à l’immunothérapie dans des lettres de sortie d’oncologie n’a pas atteint un niveau de fiabilité satisfaisant.
La traduction automatique du français vers l’anglais a montré davantage de potentiel, mais également des risques importants. L’un des modèles a introduit des informations inexistantes dans le document source dans plus de la moitié des traductions évaluées. Ce phénomène, connu sous le nom d’« hallucination », rappelle qu’un texte fluide et convaincant n’est pas nécessairement un texte correct.
Les tâches les plus complexes, telles que la synthèse de lettres de sortie, la rédaction d’explications destinées aux patients ou encore l’aide à la décision clinique, ont reçu des évaluations allant de neutres à insatisfaisantes de la part des cliniciens. Aucun modèle n’a été jugé suffisamment fiable pour être utilisé de manière autonome dans le raisonnement clinique.
Une collaboration multidisciplinaire à l’échelle du CHUV
Ce travail a mobilisé de nombreuses expertises à travers l’institution. Le Biomedical Data Science Center a coordonné le développement méthodologique, le traitement des données et l’évaluation des modèles.
Des collaborateurs des services des maladies infectieuses, d’oncologie, de médecine interne, des neurosciences cliniques et d’informatique clinique, du Service informatique, ainsi que des structures institutionnelles de recherche et d’innovation ont contribué à la définition des cas d’usage, à l’annotation des données, à la validation des résultats et à l’évaluation clinique des modèles.
Cette approche multidisciplinaire a été déterminante. L’évaluation de l’IA en santé ne peut reposer uniquement sur des critères techniques : elle nécessite l’implication directe des professionnels de santé afin de juger la pertinence clinique, d’identifier les risques potentiels et d’évaluer l’utilité réelle des outils dans la pratique.
Un message de prudence, mais aussi d’opportunité
L’étude montre que les petits modèles de langage représentent une piste prometteuse pour certaines applications ciblées, notamment lorsque les données doivent rester au sein de l’infrastructure hospitalière. En revanche, ils ne sont pas encore prêts à prendre en charge des tâches complexes nécessitant un raisonnement clinique fiable.
Au-delà de la comparaison des performances des modèles, ce travail propose surtout une méthodologie d’évaluation applicable au CHUV et à d’autres établissements de santé : partir d’un besoin clinique concret, tester les outils sur des données représentatives, impliquer les cliniciens dans l’évaluation et analyser rigoureusement les erreurs avant toute mise en production.
Pour le CHUV, cette étude rappelle que l’innovation en IA doit s’accompagner d’une évaluation rigoureuse, transparente et centrée sur la sécurité des patients. L’avenir de l’IA en santé dépendra non seulement des progrès technologiques, mais aussi de la capacité à intégrer ces outils de manière responsable, transparente et sûre dans les pratiques cliniques.
