AWS Machine Learning Blog→ original

AWS a démontré l'infrastructure pour l'entraînement multi-turn RL du modèle Amazon Nova

AWS Machine Learning Blog a publié des instructions pour le déploiement d'une infrastructure à deux phases pour l'entraînement multi-turn reinforcement learning du modèle Amazon Nova sur SageMaker HyperPod. Le pipeline lance automatiquement l'entraînement lors du téléchargement de données sur Amazon S3, et comme tâche de démonstration, le modèle est entraîné à jouer au jeu de mots Wordle.

Traité par IA depuis AWS Machine Learning Blog ; édité par Hamidun News
AWS a démontré l'infrastructure pour l'entraînement multi-turn RL du modèle Amazon Nova
Source : AWS Machine Learning Blog. Collage: Hamidun News.
◐ Écouter l'article

AWS démontre l'infrastructure pour l'entraînement multi-turn RL du modèle Amazon Nova

Le blog AWS Machine Learning a publié des instructions pour déployer une infrastructure en deux phases pour l'apprentissage par renforcement multi-tour (RL) du modèle Amazon Nova utilisant Amazon Nova Forge sur la plateforme Amazon SageMaker HyperPod.

Comment fonctionne le pipeline d'entraînement

Après le déploiement, le résultat est un pipeline piloté par les événements : l'entraînement est lancé automatiquement au moment où un utilisateur charge des données dans un bucket Amazon S3. Comme tâche de démonstration, le modèle s'entraîne à jouer au jeu de mots Wordle — les auteurs l'appellent explicitement un "espace réservé" que le lecteur peut remplacer par sa propre tâche de RL. Wordle est pratique comme exemple éducatif précisément parce qu'il s'agit d'un jeu simple avec des résultats clairs, facilement vérifiables à chaque coup — le mot est deviné ou non — ce qui signifie qu'il est facile de construire un signal de récompense clair pour le modèle basé sur lui.

  • L'infrastructure se compose de deux phases et se lance automatiquement par événement
  • Le déclencheur est le téléchargement de données vers un bucket Amazon S3
  • L'entraînement se déploie sur Amazon SageMaker HyperPod en utilisant Amazon Nova Forge
  • La tâche de démonstration consiste à entraîner le modèle à jouer à Wordle, qui ne sert que d'exemple et peut être remplacé par n'importe quelle autre tâche de RL

Pourquoi le RL multi-tour est nécessaire

L'apprentissage par renforcement multi-tour consiste à entraîner un modèle à travers une série de mouvements ou d'échanges séquentiels avec rétroaction, plutôt que par la génération d'une seule réponse isolée. Cette approche est particulièrement importante pour les systèmes d'IA agentifs : les modèles qui doivent planifier plusieurs étapes à l'avance, changer de stratégie au cours du dialogue ou du jeu, et apprendre du résultat d'une séquence entière d'actions plutôt que d'un seul échange — par exemple, les assistants d'assistance client, les agents commerciaux ou de jeu, et les outils qui invoquent des API externes.

Amazon Nova est une famille de modèles de base qu'AWS a introduite dans le cadre de la plateforme Bedrock; Amazon Nova Forge dans ce contexte sert d'outil pour leur entraînement supplémentaire. Amazon SageMaker HyperPod, à son tour, est l'infrastructure gérée d'AWS pour l'entraînement distribué résilient sur de grands clusters GPU, conçue pour la récupération automatique des défaillances de nœuds individuels sans perdre la progression de l'ensemble de l'exécution d'entraînement.

L'architecture pilotée par les événements est importante en soi ici : plutôt que de lancer manuellement l'entraînement chaque fois que de nouvelles données apparaissent, le pipeline répond au simple fait du téléchargement de fichier vers S3 et démarre l'entraînement automatiquement. Cela simplifie l'organisation de la réentraînement continu du modèle à mesure que de nouvelles données arrivent et réduit le nombre d'opérations manuelles nécessaires pour qu'une équipe lance le prochain cycle de RL. La récupération automatique du cluster HyperPod après les défaillances de nœuds individuels, à son tour, réduit le risque qu'une exécution d'entraînement de nombreuses heures ou de nombreux jours doive être redémarrée à partir de zéro en raison d'une seule défaillance matérielle.

Ce que cela signifie

La publication montre qu'AWS continue à élargir la boîte à outils pour l'ajustement fin de ses propres modèles Nova par apprentissage par renforcement directement sur l'infrastructure gérée — ce qui concurrence les offres d'ajustement fin RL similaires pour les modèles d'OpenAI, Google et Anthropic et facilite la création par les clients de leurs propres systèmes d'IA agentifs sur Nova. L'utilisation de jeux intentionnellement simplifiés comme Wordle comme exemple d'entraînement montre également qu'AWS dirige le matériel non seulement vers les équipes de recherche mais aussi vers les ingénieurs qui ont besoin d'un exemple de démarrage clair pour leurs propres projets.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…