Stéphane Guerrier & Francesco Luigi Gervasio

E-book interactif & applications web

Stéphane Guerrier & Francesco Luigi Gervasio

Ioannis Galdadas, Luca Insolia, Lionel Voirol, Yuming Zhang

Responsabiliser
Tous les projets
Responsabiliser
Projet

Ce cours se concentre sur l'application concrète des méthodes statistiques dans un contexte médical, en utilisant une approche interactive avec un site web interactif et une application Shiny intégrant GPT-3 pour la génération de code R.

Depuis :2022
Retour au catalogue

Situation de départ

Tels que dispensés actuellement, les programmes de médecine et de sciences pharmaceutiques ne préparent pas suffisamment les étudiant-es à la digitalisation et à la multiplication des données dans le milieu médical. La modélisation, l’analyse de données et l’intelligence artificielle prennent de plus en plus de place dans la future vie professionnelle des étudiant-es. Il devient essentiel qu’ils/elles soient formés à ces méthodes. À la suite de cette prise de conscience, appuyée par une demande spécifique des représentants des étudiant-es (tout en répondant à la stratégie de l’Unige), le cours de modélisation et analyse de données a été introduit dans le master de sciences pharmaceutiques en 2022. Il comprend une partie consacrée à la modélisation de molécules et une partie consacrée à l’analyse de données.

Le défi à relever pour les enseignant-es de ce nouveau cours était de le proposer sous un format attractif pour des étudiant-es manquant de compétences en matière de programmation et d’analyse de données et souvent peu motivé-es par le sujet. De plus, les enseignants ne disposant pas du temps nécessaire pour apprendre aux étudiant-es à maîtriser la programmation des logiciels d’analyse de données tels que R, il leur fallait trouver un format adapté pour le cours. L’approche choisie consiste à analyser différents jeux de données issus d’un contexte médical afin d’illustrer l’utilisation de diverses méthodes statistiques. Les étudiants peuvent notamment utiliser une application développée spécifiquement pour une utilisation dans le cadre de ce cours s’appuyant sur un modèle de deep learning permettant de générer du code R à partir d’instruction en langage naturel. La volonté ainsi assumée est de favoriser la compréhension des méthodes statistiques ainsi que de leurs applications plutôt que de la syntaxe du langage de programmation utilisé.

Mise en place et déroulement

Le cours débute par une présentation théorique qui permet aux étudiant-es d’approcher les statistiques en abordant les problèmes les plus fréquemment rencontrés dans les analyses de données. L’équipe enseignante insiste surtout sur l’intérêt pratique des analyses statistiques qui permettent d’avancer ou valider les arguments scientifiques. Elle présente également un logiciel d’analyse de donnée open source (R), le but n’étant pas de former les étudiant-es à son utilisation mais de les familiariser avec cet outil.

L’équipe enseignante a créé un site web interactif qui contient le matériel utilisé pendant les cours (diapositives dynamiques en ligne) ainsi que des exercices à choix multiples et des morceaux de code interactifs à compléter afin d’effectuer des analyses statistiques. Les étudiant-es peuvent réaliser ces exercices quand ils le souhaitent. Chaque réponse, bonne ou mauvaise, leur donne accès à une explication personnalisée.

Le but du cours étant de permettre aux étudiant-es d’apprendre autant que possible en « faisant » de l’analyse de données, les enseignant-es ont créé une application basée sur le framework Shiny (hébergée sur shinyapp.io) permettant de modéliser des données du monde réel de manière indépendante. Cette application intègre GPT-3 auquel font appel les étudiant-es pour produire du code R. Ils/elles peuvent ainsi tester autant d’analyses qu’ils le souhaitent, voir le code produit par GPT-3 et intégrer celui-ci progressivement. Les étudiant-es installent tout de même R sur leur machine pour apprendre à l’utiliser mais l’attention n’est pas focalisée sur la programmation. L’application permet également aux étudiant-es de demander la génération de graphiques. Lorsque les étudiant-es ont effectué leur analyse, ils/elles peuvent télécharger un rapport dans lequel figure le code utilisé.

Le format de l’examen, discuté en avance avec les représentants étudiant-ess est particulièrement apprécié des étudiants. En effet, l’évaluation prend place en classe tout au cours de l’année et non durant un examen final durant la session d’examens. Elle est proposée sous un format « open web/open book ». Les étudiant-es ont donc accès à toutes les ressources qu’ils/elles jugent nécessaires afin de répondre à l’exercice proposé. L’équipe enseignante leur fournit une base de données et leur présente le contexte de l’étude. Les étudiant-es doivent analyser les données seuls ou en groupe et répondre ensuite individuellement à des questions de compréhension. Ces questions, loin des considérations techniques, visent à vérifier que les étudiant-es ont compris les analyses qu’ils/elles ont faites et qu’ils/elles seraient capables de formuler des conseils avisés suite à ces analyses, à valider ou invalider des arguments scientifiques.

Retour et conseils

Le format du cours est très apprécié par les étudiant-es. L’équipe enseignante relève plusieurs centaines de requêtes sur GPT 3 par cours. Plus de la moitié du cours se déroule dans les salles informatiques. Pendant ces séances, les étudiant-es travaillent, réfléchissent ensemble et n’appellent l’assistant que lorsqu’ils/elles sont réellement bloqué-es. Les situations problématiques auxquelles les confronte l’équipe enseignante ressemblent aux situations qu’ils/eIles vont rencontrer dans leur vie professionnelle. Cela représente donc un exercice essentiel de réflexion et d’autonomisation.

L’équipe enseignante souligne que la partie du cours la plus chronophage a été de concevoir et d’implémenter les exercices sous forme de QCM ainsi que de développer les différentes ressources sur lesquelles s’appuie le cours (site web interactif, application Shiny intégrant GPT-3, package R implémentant diverses fonctions et comprenant les différents jeux de donnés documentés). Enfin, le fait que les réponses soient personnalisées afin d’expliquer en quoi celles-ci sont correctes ou incorrectes a demandé un temps considérable de rédaction lors de leur création. L’avantage d’un tel matériel c’est qu’au-delà de rendre les étudiant-es plus autonomes, il est également réutilisable dans le temps. Il est aussi hautement transférable et donc utilisable très facilement dans d’autres cours.

Avis des étudiant·es

« […] Les slides sont bien construites, et les informations présentées sont bien expliquées. Les séances d’exercices sont appropriées et le temps mis à disposition pour résoudre les exercices est adéquat. L’utilisation de Piazza est très utile, c’est un bon outil pour pouvoir poser des questions qui concernent la partie R Studio du cours. Le format des examens (QCM sur un dataset donné à l’avance pour la première partie et rapport à rendre pour la deuxième partie) est très bien, et je vous en remercie ! »

« Faire en 1er une heure de théorie et ensuite aller en Teachlab permet de mieux comprendre ce qu’on va faire en Teachlab le rapport à faire comme examen de la 2ème partie est bien car il permet de bien expliquer ce que l’on a compris l’examen sur la 1ère partie est également bien structuré, le fait de donner les données à l’avance permet de bien pouvoir se préparer, et le fait de faire des questions “écrites” nous oblige à comprendre ce que l’on faisait pendant les exercices (ce qui est très bien) »

« Très bien géré. Le forum piazza est disponible pour poser les questions et l’on y accède depuis chez nous donc cela permet de poser des questions aux assistants en live puis en réfléchissant entre les séances, les nouvelles questions peuvent être posées en ligne. »

« Les profs sont disponibles, la présence de piazza était cool. Ça rajoutait un bon côté interactif au cours. Les profs sont super sympas et à l’écoute, ce qui était adorable. »

« Pour la première partie sur R, la plateforme pour les exercices est très bien réalisée et aide à l’apprentissage. Les assistants sont top aussi, nous aident bien et à l’écoute. Pour la 2eme partie sur modélisation, les exercices au teach lab étaient intéressants. Les documents à disposition pour faire les exercices de modélisation sont très bien expliqués. »

« Ça nous permet d’être plus critique vis à vis des études statistiques faites. Ça permet de vraiment appliquer les méthodes vues en cours, ce qui est très positif selon moi »

« Le cours est intéressant, je trouve pertinent de nous montrer comment la modélisation de protéines se déroule, car c’est un aspect majeur des sciences pharmaceutiques et de la recherche des médicaments. Le fait de traduire les slides en français est toujours très apprécié. Le Prof. Gervasio est très agréable avec les étudiants. »

Observation entre pairs

Cet·te enseignant·e accepte que des collègues observent son cours. En savoir plus →