TGDCContact
REF-01 / IntroductionTGDC

Qu'est-ce qu'un environnement RL pour l'entraînement des LLM ?

Un environnement RL pour l'entraînement d'un LLM est un monde de tâches empaqueté : une spécification de tâche, l'état de travail et les documents avec lesquels le modèle interagit, et un vérificateur programmatique qui note chaque tentative. L'apprentissage par renforcement optimise ensuite le modèle contre cette note.

Trois parties
Une tâche, un état d'environnement réaliste, un vérificateur programmatique
Récompense
Calculée par le vérificateur, non déduite d'une préférence humaine
Ressource rare
Des tâches vérifiables tirées de travail réellement effectué

Les trois composants

Pourquoi les laboratoires sont passés des corpus aux environnements

Le pré-entraînement sur du texte statique apprend à un modèle à quoi ressemble le travail. Il ne lui apprend pas à faire ce travail, faute de boucle de rétroaction. La génération actuelle de modèles de raisonnement est fortement entraînée par apprentissage par renforcement sur des tâches vérifiables : le modèle tente une tâche de nombreuses fois, le vérificateur note chaque tentative, et le modèle se déplace vers les stratégies qui réussissent.

Cela change ce que signifient les données d'entraînement. Le goulot d'étranglement n'est plus le nombre de jetons, mais les instances de tâches vérifiables. Les mathématiques et le code sont venus en premier parce que leurs vérificateurs sont triviaux : une preuve tient ou non, une suite de tests passe ou non. La frontière est désormais tout le reste : le travail dense en documents et en jugement qui remplit les opérations réelles.

Ce qui fait un bon environnement RL

Comment TGDC les construit

The General Data Company construit des environnements RL à partir de sources d'entreprise consenties et vérifiées sur le plan des droits (fonds documentaires de procédures collectives, flux de travail experts rejoués et documents personnels apportés), anonymisés et contrôlés lot par lot. Comme le matériau source n'a jamais été en ligne, les tâches sont réellement inédites. Chaque tâche est livrée avec son propre vérificateur programmatique et une partition d'évaluation réservée, afin qu'un laboratoire mesure de vrais gains de capacité plutôt que de la mémorisation. Voir environnements RL pour le contenu d'une livraison, ou licences de données pour les corpus sous-jacents.