MarkTechPost→ original

Ajustement fin de Gemma-3 en mathématiques à l'aide de GRPO et d'adaptateurs LoRA

Les chercheurs ont publié un flux de travail d'ajustement fin pour Gemma-3 de Google utilisant l'algorithme GRPO : le modèle apprend à résoudre les problèmes mathématiques étape par étape à partir de l'ensemble de données GSM8K. La méthode utilise des adaptateurs LoRA pour économiser la mémoire vidéo et définit des fonctions de récompense pour un formatage correct et des réponses numériques. En conséquence, Gemma-3 commence à raisonner structurellement—et sans data center.

Traité par IA depuis MarkTechPost ; édité par Hamidun News
Ajustement fin de Gemma-3 en mathématiques à l'aide de GRPO et d'adaptateurs LoRA
Source : MarkTechPost. Collage: Hamidun News.
◐ Écouter l'article

Les chercheurs ont publié le 5 juillet 2026 un flux de travail détaillé pour l'ajustement fin de Gemma-3 de Google sur l'ensemble de données mathématique GSM8K en utilisant l'algorithme GRPO, les adaptateurs LoRA et le framework Tunix.

Qu'est-ce que GRPO et comment diffère-t-il des méthodes classiques

GRPO (Group Relative Policy Optimization) est un algorithme de la famille de l'apprentissage par renforcement, spécialement adapté aux modèles de langage. Contrairement au PPO classique, qui nécessite un modèle critique de référence séparé, GRPO compare plusieurs variantes de réponse générées au sein d'un seul groupe et met à jour la politique en faveur de solutions plus réussies. Cela réduit la consommation de mémoire et rend l'entraînement plus stable.

Pour les tâches mathématiques, cette approche est particulièrement pratique : la réponse est correcte ou non — le signal de récompense est calculé automatiquement et sans ambiguïté. GSM8K (Grade School Math 8K) est un benchmark standard avec 8 500 problèmes de mathématiques scolaires nécessitant un raisonnement multi-étapes. Il nécessite que le modèle non seulement génère un nombre, mais reproduise une chaîne de raisonnement, ce qui en fait un terrain d'essai idéal pour GRPO.

  • Modèle de base — Gemma-3 de Google
  • Ensemble de données — GSM8K (8 500 problèmes scolaires)
  • Algorithme — GRPO (Group Relative Policy Optimization)
  • Framework — Tunix sur Hugging Face Transformers
  • Ajustement fin — adaptateurs LoRA sans modifier les poids de base

Comment le pipeline est construit étape par étape

Le flux de travail est divisé en étapes logiques. Premièrement, l'environnement est configuré et l'authentification est effectuée sur Hugging Face Hub — c'est d'où les poids de Gemma-3 sont chargés. Ensuite, chaque exemple du GSM8K est enveloppé dans un modèle "raisonnement + réponse" : le modèle voit la structure de sortie attendue dès les premières étapes d'entraînement et apprend à la suivre.

L'élément central se compose de deux fonctions de récompense. La première vérifie la conformité du format : y a-t-il des blocs de raisonnement et des résultats numériques dans la réponse ? La deuxième évalue la précision numérique — le nombre final correspond-il au benchmark ? GRPO optimise les deux signaux simultanément, en générant des groupes de variantes et en sélectionnant les meilleures.

Pour éviter d'ajuster le modèle entier, des adaptateurs LoRA sont connectés à Gemma-3 — des matrices compactes de bas rang qui sont entraînées à la place des poids de base "gelés". Le résultat : le nombre de paramètres entraînables chute fortement, et les exigences en mémoire vidéo diminuent tellement que le flux de travail devient réalisable sur du matériel grand public.

Après l'entraînement, les auteurs suggèrent de mesurer la précision avec les adaptateurs et de la comparer au checkpoint de base. Optionnellement, fusionner les adaptateurs avec les poids de base et exporter le modèle final pour le déploiement.

Pourquoi cela compte pour les développeurs

"Les adaptateurs

LoRA rendent l'ensemble du processus réalisable sans centre de données", selon la description du flux de travail.

Il y a seulement quelques années, l'ajustement fin des grands modèles nécessitait des dizaines de gigaoctets de mémoire vidéo et l'accès à des clusters professionnels. La combinaison GRPO + LoRA change cela : l'algorithme est déjà plus efficace en mémoire que le PPO classique, et LoRA réduit davantage le nombre de paramètres entraînables de 10 à 100 fois selon le rang de l'adaptateur.

Conséquence pratique : un développeur avec une carte graphique moderne peut prendre un modèle ouvert comme Gemma-3, l'adapter à un domaine spécifique — mathématiques, droit, médecine — et obtenir un modèle spécialisé avec une amélioration mesurable sur le benchmark cible. Tunix sert de wrapper pratique qui automatise la configuration de GRPO et la gestion des adaptateurs ; une approche similaire est applicable à tout ensemble de données avec des réponses vérifiables.

Ce que cela signifie

L'ajustement fin GRPO avec LoRA sur les ensembles de données de domaine passe des articles académiques aux guides pratiques. Les auteurs ont montré le cycle complet — du chargement à l'exportation — sur un modèle réel et un benchmark public, réduisant la barrière d'entrée pour les développeurs qui souhaitent améliorer un modèle ouvert pour une tâche spécifique sans infrastructure coûteuse.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…