Apple Foundation Models SDK for Python: локальная Apple Intelligence в агенте Hermes
Команда Сбера собрала нативный провайдер, который подключает локальную модель Apple Intelligence к автономному Python-агенту Hermes через Foundation Models SDK. Модель грузится прямо в процесс и работает на Apple Silicon без облака: среднее время ответа на короткие запросы — 2,8 секунды, а на бенчмарке из 50 вопросов (MMLU, GSM8K, HellaSwag и др.) адаптер дал 46 правильных ответов.
Traité par IA depuis Habr: Сбер ; édité par Hamidun News
Des ingénieurs de Sber ont présenté, dans un billet de blog sur Habr, un fournisseur natif qui connecte le modèle local Apple Intelligence à l'agent Python autonome Hermes via le Apple Foundation Models SDK for Python. Selon leurs mesures, le temps de réponse moyen pour les requêtes courtes était de 2,8 secondes, et sur un benchmark de 50 questions, l'adaptateur a fourni 46 bonnes réponses.
Qu'est-ce que le Foundation Models SDK for Python
Apple Foundation Models SDK for Python est une bibliothèque qui donne un accès direct au modèle local Apple Intelligence directement depuis du code Python. Apple l'a publiée en février 2026 : le modèle se charge dans le processus, le cache KV est maintenu en mémoire vive, et l'inférence s'exécute sur les puces Apple Silicon sans faire appel au cloud.
La bibliothèque a rapidement gagné en popularité auprès des développeurs. Selon GitHub, elle compte déjà 1,2 k étoiles, et Apple a présenté la dernière version, la 0.2.0, avec prise en charge des images, lors de la conférence WWDC26.
- Sortie de la bibliothèque — février 2026
- 1,2 k étoiles sur GitHub
- Version 0.2.0 avec prise en charge des images — à la WWDC26
- L'inférence est entièrement locale, sur Apple Silicon
- Le cache KV est stocké dans la mémoire du processus
Pourquoi Hermes avait besoin d'un adaptateur
Il n'existait auparavant aucun fournisseur natif prêt à l'emploi pour les agents Python. Les surcouches placées au-dessus de Foundation Models émulent l'interface d'OpenAI, mais ne permettent pas au modèle local de fonctionner comme moteur principal de l'agent — avec tous ses mécanismes : limiteur de débit, repli (fallback) vers d'autres modèles et audit. L'utilisation directe de Foundation Models existait déjà dans l'agent Swift iClaw, mais pour des agents Python plus généralistes, cette possibilité restait fermée.
L'adaptateur pour Hermes comble cet écart : le modèle local d'Apple devient le moteur d'inférence habituel de l'agent, et non un service externe caché derrière une surcouche HTTP. Cela signifie que les requêtes qui lui sont adressées passent par la même logique de limites, de repli et de journalisation que les appels aux modèles cloud.
Quels résultats les benchmarks ont-ils montrés
Sur un jeu de test de 50 questions, le fournisseur a obtenu 46 bonnes réponses. Les questions provenaient de cinq jeux de référence connus — MMLU, BoolQ, GSM8K, BIG-Bench et HellaSwag —, ce qui signifie qu'elles testaient à la fois les connaissances, la logique et le calcul. Le temps de réaction moyen pour les requêtes courtes était de 2,8 secondes — pour une inférence entièrement locale sur un ordinateur portable, c'est sensiblement rapide.
L'association de la vitesse et de la précision est le principal argument de ce cas d'usage : l'agent répond sans latence réseau et sans consommer de tokens sur des appels API.
«
Pourquoi ne pas essayer d'ajouter à Hermes un adaptateur basé sur le Foundation Models SDK for Python, et obtenir un temps de réaction moyen de 2,8 secondes pour les requêtes courtes, tout en décrochant 46 bonnes réponses sur un benchmark de 50 questions ? » — extrait de l'article de l'équipe de Sber sur Habr.
Ce que cela signifie
Les modèles locaux se rapprochent nettement du rôle de moteur principal des agents autonomes : sans cloud, sans frais d'API et avec une latence acceptable. Pour les scénarios où la confidentialité et le fonctionnement hors ligne comptent, le duo Apple Silicon et Python cesse d'être une curiosité exotique pour devenir un outil de travail.
Questions fréquentes
Qu'est-ce que l'Apple Foundation Models SDK for Python ?
Il s'agit d'une bibliothèque Python publiée par Apple en février 2026, qui donne un accès direct au modèle local Apple Intelligence : le modèle se charge dans le processus et s'exécute sur Apple Silicon sans passer par le cloud. Sur GitHub, elle compte 1,2 k étoiles, et la version actuelle est la 0.2.0, avec prise en charge des images.
Quels résultats l'adaptateur pour Hermes a-t-il montrés ?
Sur un benchmark de 50 questions (MMLU, BoolQ, GSM8K, BIG-Bench, HellaSwag), le fournisseur a fourni 46 bonnes réponses, et le temps de réponse moyen pour les requêtes courtes était de 2,8 secondes, avec une inférence entièrement locale.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.