Son nouveau modèle IA va faire oublier les LLMs

Son nouveau modèle IA va faire oublier les LLMs

Progrès en IA : Un Problème Persistant

Le défi des algorithmes en IA

  • Malgré 20 ans de progrès dans l'IA, les chercheurs continuent d'utiliser des algorithmes développés au début des années 2000.
  • Ce problème est crucial car il permet de prédire des éléments tels que le chiffre d'affaires d'une entreprise ou le prix de vente d'un appartement.

Émergence d'un nouveau modèle

  • Un nouveau modèle, issu de la recherche française, commence à changer la donne dans ce domaine.
  • Bien que peu médiatisé, certains industriels investissent déjà plusieurs millions dans ce modèle.

La Réalité Cachée des Chercheurs en Tech

Anecdotes et défis

  • Les chercheurs en tech ont souvent une image idéalisée, mais la réalité est plus complexe et moins glamour.
  • L'épisode vise à partager leurs expériences authentiques, y compris les échecs et les réussites.

Introduction de l'Invité

Présentation de Marine Morvent

  • Marine Morvent se présente comme chercheuse à Inria, passionnée par les sciences et originaire de Mayenne.

Spécialisation en IA

  • Bien qu'elle ait un large éventail d'intérêts scientifiques, elle se concentre sur l'intelligence artificielle (IA).

Parcours vers la Technologie

Formation académique

  • Marine a commencé son parcours technologique après une prépa et une spécialisation en bioinformatique à Polytechnique.

Transition vers l'IA

  • Sa thèse appliquée a marqué le début de son intérêt pour le machine learning dans le domaine génomique.

Objectifs de Recherche

Personnalisation des traitements du cancer

  • L'objectif principal était de définir des sous-groupes de patients basés sur leur profil génomique pour personnaliser les traitements.

Travaux Actuels chez Inria

Modèles tabulaires

  • Marine travaille actuellement sur les modèles fondation pour les données tabulaires qui sont essentielles dans divers domaines scientifiques et commerciaux.

Gestion des données manquantes

  • Elle aborde également comment gérer efficacement les données manquantes lors des tâches prédictives pour améliorer la performance du modèle.

Quantification de l'incertitude

  • Un autre sujet clé est la quantification de l'incertitude associée aux prédictions faites par ses modèles.

Présentation d'Inria

Qu'est-ce qu'Inria ?

  • Inria est un institut public dédié à la recherche numérique, similaire au CNRS mais axé spécifiquement sur le numérique et l'informatique.

Défis avec les LLM sur Données Tabulaires

Limites des LLM

  • Bien que possible, appliquer directement un LLM aux données tabulaires ne donne pas toujours de bons résultats comparativement aux modèles spécifiques conçus pour ces types de données.

Entraînement spécifique nécessaire

  • Les LLM sont principalement entraînés pour prédire le prochain mot plutôt que pour effectuer une analyse statistique efficace sur des tables.

Modèles Traditionnels vs Nouvelles Approches

Méthodes traditionnelles efficaces

  • Avant l'émergence récente des modèles modernes, les méthodes comme XGBoost dominaient depuis plus d'une décennie dans le traitement des tâches tabulaires.

Différences entre Random Forest et Gradient Boosting

  • Contrairement aux forêts aléatoires qui utilisent plusieurs arbres indépendants, le gradient boosting construit séquentiellement chaque arbre basé sur les erreurs du précédent.

Modèles de fondation et leur impact sur les données tabulaires

Définition des modèles de fondation

  • Un modèle de fondation est un modèle préentraîné sur de grandes quantités de données, pouvant être utilisé pour diverses tâches sans nécessiter un ajustement important.
  • Les modèles open source actuels, comme les LLM (Language Models), sont considérés comme des modèles de fondation car ils sont entraînés sur une vaste quantité de données.

Évolution des modèles dans le domaine tabulaire

  • Jusqu'en 2023, il n'existait pas de grands modèles pré-entraînés pour les données tabulaires, contrairement aux avancées réalisées dans le traitement du langage naturel.
  • Traditionnellement, chaque nouveau jeu de données nécessitait un réentraînement complet d'un modèle à partir de zéro.

Introduction du TPFN

  • En 2023, le papier TPFN a introduit un modèle pré-entraîné spécifiquement pour les tables, marquant une avancée significative dans ce domaine.
  • Ce modèle permet d'effectuer des prédictions sans avoir besoin d'ajuster les paramètres après l'entraînement initial.

Paradigme d'apprentissage en contexte

  • L'apprentissage en contexte consiste à fournir quelques exemples au modèle lors du prompt afin qu'il puisse déduire la fonction sous-jacente à modéliser.
  • Cette approche est similaire à celle utilisée dans les LLM où le modèle apprend à faire des prédictions basées sur des exemples fournis plutôt que par apprentissage supervisé traditionnel.

Différences avec l'apprentissage supervisé classique

  • Dans l'apprentissage supervisé classique, on entraîne le modèle sur un ensemble d'entraînement et on valide sa performance sur un ensemble test.
  • Avec l'apprentissage en contexte, le modèle utilise simultanément plusieurs tables pour effectuer ses prédictions sans validation séparée.

Métalearning et flexibilité des architectures

  • Le métalearning permet au modèle d'apprendre efficacement à partir des données d'entraînement sans dépendre d'une fonction prédéfinie ou d'une architecture rigide.
  • La flexibilité offerte par les transformers joue un rôle crucial dans cette nouvelle approche permettant une meilleure généralisation.

Apprentissage vs. Déduction en contexte

  • Il est important de noter que lorsque le modèle reçoit des exemples dans son prompt, il ne "learn" pas au sens traditionnel; il reconnaît simplement des motifs statistiques.
  • On pourrait parler davantage de déduction en contexte plutôt que d'apprentissage en contexte pour mieux refléter ce qui se passe réellement avec ces modèles.

Problèmes liés aux données manquantes

  • La gestion des données manquantes reste un défi ouvert malgré l'utilisation croissante des transformers; aucune étude définitive n'a encore établi la meilleure stratégie à adopter.

Utilisation pratique et cas concrets

  • Les entreprises commencent à réaliser que ces nouveaux modèles nécessitent moins d'efforts pour être appliqués comparativement aux méthodes traditionnelles comme XG Boosting.

Exemples concrets

  • Des start-ups exploitent ces technologies pour divers cas tels que la prédiction du rendement agricole ou la détection de fraudes bancaires.

Limitations et Avantages des Modèles Tabulaires

Coûts d'Inference

  • Les modèles tabulaires présentent un coût d'inférence plus élevé, bien que moins important que celui des grands modèles de langage (LM).
  • L'entraînement des grands LLM coûte plusieurs millions, tandis que le modèle Tabical nécessite environ 25 jours sur un seul GPU H.

Comparaison avec les Grands Modèles de Langage

  • Les modèles tabulaires ont beaucoup moins de paramètres (dizaines de millions) comparés aux LLM qui commencent à 10 milliards.
  • Bien que l'inférence soit possible sur CPU, elle est plus lente qu'avec GPU. Par exemple, traiter 10 000 échantillons prend une seconde sur GPU.

Collaboration et Concurrence

  • La collaboration entre laboratoires est présente, mais il n'y a pas de compétition directe; chaque équipe se concentre sur ses propres objectifs.
  • Le but n'est pas de rivaliser mais d'améliorer les performances et d'adresser certaines limitations comme l'intégration de connaissances extérieures.

Évolution du Domaine et Impact des Startups

Innovations dans le Secteur

  • La startup TPFN a été rachetée par SAP, indiquant un changement significatif dans le paysage technologique.
  • Le développement d'un modèle open source à l'état de l'art permet aux chercheurs d'avoir accès à des outils pour étudier et améliorer leurs travaux.

Importance du Modèle Open Source

  • Un modèle open source permet aux entreprises de comprendre entièrement le préentraînement, ce qui favorise la transparence et la confiance.
  • Différents niveaux d'ouverture existent dans les modèles; certains permettent uniquement l'utilisation gratuite via API ou exposent leur architecture.

Rôle Crucial du Générateur Prior

Fonctionnalité du Générateur Prior

  • Le générateur prior est essentiel pour créer des données synthétiques nécessaires au préentraînement efficace d'un modèle.
  • Ce générateur constitue une partie clé du "secret sauce" pour obtenir un bon entraînement.

Applications Pratiques

  • Des équipes comme celle de Stanford utilisent le prior pour continuer le pré-entraînement des LLM afin d'améliorer leurs performances tout en maintenant la compréhension textuelle.

Perspectives Futures des Modèles Tabulaires

Adoption Croissante

  • Les modèles tabulaires ne remplaceront pas les technologies existantes mais gagneront en importance dans divers secteurs tels que l'entreprise et la santé.

Cas d'Usage Potentiel

  • De nombreux cas d'usage émergeront grâce à ces technologies, notamment en intégrant ces modèles avec des bases de données internes ou CRM pour optimiser les processus.

Réflexions Personnelles sur l'Évolution Technologique

Changements dans la Perception

  • Une évolution notable a eu lieu concernant la définition même de l'intelligence artificielle; ce qui semblait éloigné devient aujourd'hui tangible avec les avancées récentes.

Débat autour de l'Intelligence Artificielle

  • La notion même d'intelligence reste floue malgré les progrès réalisés. Les chatbots modernes soulèvent encore des questions quant à leur véritable nature intelligente.
Video description

Oubliez les LLMs. Les travaux de cette chercheuse en IA seront bientôt sur toutes les lèvres. Cela faisait 20 ans que le monde de l’IA se cassait les dents sur ce problème. Malgré les progrès fulgurants de la discipline, que ce soient les LLMs, ou même le deep learning en général, rien n’y faisait. Impossible de faire mieux que les modèles de machine learning “classiques”. On parle pourtant d’un problème qui vaut de l’or. Imaginez pouvoir prédire le chiffre d’affaire d’une entreprise. Ou bien le prix de vente de votre appartement. Voire même les risques de cancer chez un patient. Tout ça, sans aucune compétence en machine learning. Et bien, c’est la promesse des TFM. Les “Tabular Foundation Models”. (Retenez bien cet acronyme) Des modèles capables d’interpréter vos bases de données, et de prédire à peu près tout ce qui vous passerait par la tête. La promesse est folle. Et certains industriels l’ont bien compris, car sans faire de bruit, ils y ont déjà investis plusieurs millions. Au coeur de cette révolution, il y a un labo de recherche français. L’INRIA. Déjà mondialement reconnus pour leurs travaux sur scikit-learn, une des libraires de ML les plus utilisées dans le monde, Les voilà désormais leaders des TFM. Mais comment ont ils réussi à “craquer” ce problème qui résistait depuis 20 ans ? C’est la question que j’ai posé à Marine Le Morvan, chercheuse à l’INRIA et pionnière du domaine. Bonne écoute 🎧 PS : dites-moi ce que vous pensez de l'épisode en commentaire (et surtout, abonnez-vous !) Notes de l'épisode : - le modèle de l'INRIA "TabIClV2" : https://github.com/soda-inria/tabicl Chapitres : 00:00 Intro 2:51 Ses débuts dans la tech : de la bio au machine learning 8:00 Ses sujets de recherche à l'INRIA : les modèles tabulaires 16:38 Pourquoi les LLMs galèrent sur les données tabulaires 20:06 La meilleure méthode pour ces données (gradient boosting) 24:26 La nouvelle révolution IA : les modèles de fondation tabulaires 38:51 La technique contre-intuitive qui fait marcher ces modèles 47:21 Pour quoi ces modèles vont remplacer les LLM 1:00:14 Questions de fin 1:03:25 Le mot de la fin --------------------------------- Retrouvez Marine sur : - Linkedin : https://www.linkedin.com/in/marine-le-morvan-ba823a145/ - sa page : https://marinelm.github.io/ -------------------------------- Je suis Mathieu Sanchez, CTO d'Acasi, et pour me suivre, c'est principalement sur Linkedin : https://www.linkedin.com/in/matsanchez/ Vous pouvez aussi suivre Tronche de Tech, sur vos réseaux favoris : - Linkedin : https://www.linkedin.com/company/tronche-de-tech/ - Instagram : https://www.instagram.com/tronchedetech/ - TikTok : https://www.tiktok.com/@tronchedetech - Twitter : https://twitter.com/TroncheDeTech Et nous rejoindre sur le Discord : https://discord.gg/EET4MfwXKHr