Son nouveau modèle IA va faire oublier les LLMs
Progrès en IA : Un Problème Persistant
Le défi des algorithmes en IA
- Malgré 20 ans de progrès dans l'IA, les chercheurs continuent d'utiliser des algorithmes développés au début des années 2000.
- Ce problème est crucial car il permet de prédire des éléments tels que le chiffre d'affaires d'une entreprise ou le prix de vente d'un appartement.
Émergence d'un nouveau modèle
- Un nouveau modèle, issu de la recherche française, commence à changer la donne dans ce domaine.
- Bien que peu médiatisé, certains industriels investissent déjà plusieurs millions dans ce modèle.
La Réalité Cachée des Chercheurs en Tech
Anecdotes et défis
- Les chercheurs en tech ont souvent une image idéalisée, mais la réalité est plus complexe et moins glamour.
- L'épisode vise à partager leurs expériences authentiques, y compris les échecs et les réussites.
Introduction de l'Invité
Présentation de Marine Morvent
- Marine Morvent se présente comme chercheuse à Inria, passionnée par les sciences et originaire de Mayenne.
Spécialisation en IA
- Bien qu'elle ait un large éventail d'intérêts scientifiques, elle se concentre sur l'intelligence artificielle (IA).
Parcours vers la Technologie
Formation académique
- Marine a commencé son parcours technologique après une prépa et une spécialisation en bioinformatique à Polytechnique.
Transition vers l'IA
- Sa thèse appliquée a marqué le début de son intérêt pour le machine learning dans le domaine génomique.
Objectifs de Recherche
Personnalisation des traitements du cancer
- L'objectif principal était de définir des sous-groupes de patients basés sur leur profil génomique pour personnaliser les traitements.
Travaux Actuels chez Inria
Modèles tabulaires
- Marine travaille actuellement sur les modèles fondation pour les données tabulaires qui sont essentielles dans divers domaines scientifiques et commerciaux.
Gestion des données manquantes
- Elle aborde également comment gérer efficacement les données manquantes lors des tâches prédictives pour améliorer la performance du modèle.
Quantification de l'incertitude
- Un autre sujet clé est la quantification de l'incertitude associée aux prédictions faites par ses modèles.
Présentation d'Inria
Qu'est-ce qu'Inria ?
- Inria est un institut public dédié à la recherche numérique, similaire au CNRS mais axé spécifiquement sur le numérique et l'informatique.
Défis avec les LLM sur Données Tabulaires
Limites des LLM
- Bien que possible, appliquer directement un LLM aux données tabulaires ne donne pas toujours de bons résultats comparativement aux modèles spécifiques conçus pour ces types de données.
Entraînement spécifique nécessaire
- Les LLM sont principalement entraînés pour prédire le prochain mot plutôt que pour effectuer une analyse statistique efficace sur des tables.
Modèles Traditionnels vs Nouvelles Approches
Méthodes traditionnelles efficaces
- Avant l'émergence récente des modèles modernes, les méthodes comme XGBoost dominaient depuis plus d'une décennie dans le traitement des tâches tabulaires.
Différences entre Random Forest et Gradient Boosting
- Contrairement aux forêts aléatoires qui utilisent plusieurs arbres indépendants, le gradient boosting construit séquentiellement chaque arbre basé sur les erreurs du précédent.
Modèles de fondation et leur impact sur les données tabulaires
Définition des modèles de fondation
- Un modèle de fondation est un modèle préentraîné sur de grandes quantités de données, pouvant être utilisé pour diverses tâches sans nécessiter un ajustement important.
- Les modèles open source actuels, comme les LLM (Language Models), sont considérés comme des modèles de fondation car ils sont entraînés sur une vaste quantité de données.
Évolution des modèles dans le domaine tabulaire
- Jusqu'en 2023, il n'existait pas de grands modèles pré-entraînés pour les données tabulaires, contrairement aux avancées réalisées dans le traitement du langage naturel.
- Traditionnellement, chaque nouveau jeu de données nécessitait un réentraînement complet d'un modèle à partir de zéro.
Introduction du TPFN
- En 2023, le papier TPFN a introduit un modèle pré-entraîné spécifiquement pour les tables, marquant une avancée significative dans ce domaine.
- Ce modèle permet d'effectuer des prédictions sans avoir besoin d'ajuster les paramètres après l'entraînement initial.
Paradigme d'apprentissage en contexte
- L'apprentissage en contexte consiste à fournir quelques exemples au modèle lors du prompt afin qu'il puisse déduire la fonction sous-jacente à modéliser.
- Cette approche est similaire à celle utilisée dans les LLM où le modèle apprend à faire des prédictions basées sur des exemples fournis plutôt que par apprentissage supervisé traditionnel.
Différences avec l'apprentissage supervisé classique
- Dans l'apprentissage supervisé classique, on entraîne le modèle sur un ensemble d'entraînement et on valide sa performance sur un ensemble test.
- Avec l'apprentissage en contexte, le modèle utilise simultanément plusieurs tables pour effectuer ses prédictions sans validation séparée.
Métalearning et flexibilité des architectures
- Le métalearning permet au modèle d'apprendre efficacement à partir des données d'entraînement sans dépendre d'une fonction prédéfinie ou d'une architecture rigide.
- La flexibilité offerte par les transformers joue un rôle crucial dans cette nouvelle approche permettant une meilleure généralisation.
Apprentissage vs. Déduction en contexte
- Il est important de noter que lorsque le modèle reçoit des exemples dans son prompt, il ne "learn" pas au sens traditionnel; il reconnaît simplement des motifs statistiques.
- On pourrait parler davantage de déduction en contexte plutôt que d'apprentissage en contexte pour mieux refléter ce qui se passe réellement avec ces modèles.
Problèmes liés aux données manquantes
- La gestion des données manquantes reste un défi ouvert malgré l'utilisation croissante des transformers; aucune étude définitive n'a encore établi la meilleure stratégie à adopter.
Utilisation pratique et cas concrets
- Les entreprises commencent à réaliser que ces nouveaux modèles nécessitent moins d'efforts pour être appliqués comparativement aux méthodes traditionnelles comme XG Boosting.
Exemples concrets
- Des start-ups exploitent ces technologies pour divers cas tels que la prédiction du rendement agricole ou la détection de fraudes bancaires.
Limitations et Avantages des Modèles Tabulaires
Coûts d'Inference
- Les modèles tabulaires présentent un coût d'inférence plus élevé, bien que moins important que celui des grands modèles de langage (LM).
- L'entraînement des grands LLM coûte plusieurs millions, tandis que le modèle Tabical nécessite environ 25 jours sur un seul GPU H.
Comparaison avec les Grands Modèles de Langage
- Les modèles tabulaires ont beaucoup moins de paramètres (dizaines de millions) comparés aux LLM qui commencent à 10 milliards.
- Bien que l'inférence soit possible sur CPU, elle est plus lente qu'avec GPU. Par exemple, traiter 10 000 échantillons prend une seconde sur GPU.
Collaboration et Concurrence
- La collaboration entre laboratoires est présente, mais il n'y a pas de compétition directe; chaque équipe se concentre sur ses propres objectifs.
- Le but n'est pas de rivaliser mais d'améliorer les performances et d'adresser certaines limitations comme l'intégration de connaissances extérieures.
Évolution du Domaine et Impact des Startups
Innovations dans le Secteur
- La startup TPFN a été rachetée par SAP, indiquant un changement significatif dans le paysage technologique.
- Le développement d'un modèle open source à l'état de l'art permet aux chercheurs d'avoir accès à des outils pour étudier et améliorer leurs travaux.
Importance du Modèle Open Source
- Un modèle open source permet aux entreprises de comprendre entièrement le préentraînement, ce qui favorise la transparence et la confiance.
- Différents niveaux d'ouverture existent dans les modèles; certains permettent uniquement l'utilisation gratuite via API ou exposent leur architecture.
Rôle Crucial du Générateur Prior
Fonctionnalité du Générateur Prior
- Le générateur prior est essentiel pour créer des données synthétiques nécessaires au préentraînement efficace d'un modèle.
- Ce générateur constitue une partie clé du "secret sauce" pour obtenir un bon entraînement.
Applications Pratiques
- Des équipes comme celle de Stanford utilisent le prior pour continuer le pré-entraînement des LLM afin d'améliorer leurs performances tout en maintenant la compréhension textuelle.
Perspectives Futures des Modèles Tabulaires
Adoption Croissante
- Les modèles tabulaires ne remplaceront pas les technologies existantes mais gagneront en importance dans divers secteurs tels que l'entreprise et la santé.
Cas d'Usage Potentiel
- De nombreux cas d'usage émergeront grâce à ces technologies, notamment en intégrant ces modèles avec des bases de données internes ou CRM pour optimiser les processus.
Réflexions Personnelles sur l'Évolution Technologique
Changements dans la Perception
- Une évolution notable a eu lieu concernant la définition même de l'intelligence artificielle; ce qui semblait éloigné devient aujourd'hui tangible avec les avancées récentes.
Débat autour de l'Intelligence Artificielle
- La notion même d'intelligence reste floue malgré les progrès réalisés. Les chatbots modernes soulèvent encore des questions quant à leur véritable nature intelligente.