Apple Foundation Models SDK for Python: локальная Apple Intelligence в агенте Hermes
Команда Сбера собрала нативный провайдер, который подключает локальную модель Apple Intelligence к автономному Python-агенту Hermes через Foundation Models SDK. Модель грузится прямо в процесс и работает на Apple Silicon без облака: среднее время ответа на короткие запросы — 2,8 секунды, а на бенчмарке из 50 вопросов (MMLU, GSM8K, HellaSwag и др.) адаптер дал 46 правильных ответов.
Procesado por IA desde Habr: Сбер; editado por Hamidun News
Ingenieros de Sber mostraron, en una entrada de blog en Habr, un proveedor nativo que conecta el modelo local de Apple Intelligence con el agente autónomo de Python Hermes a través del Apple Foundation Models SDK for Python. Según sus mediciones, el tiempo de respuesta promedio para consultas cortas fue de 2,8 segundos, y en un benchmark de 50 preguntas el adaptador acertó 46 respuestas.
Qué es Foundation Models SDK for Python
Apple Foundation Models SDK for Python es una biblioteca que da acceso directo al modelo local de Apple Intelligence directamente desde código Python. Apple la lanzó en febrero de 2026: el modelo se carga en el proceso, la caché KV se mantiene en la memoria RAM, y la inferencia se ejecuta en chips Apple Silicon sin recurrir a la nube.
La biblioteca ganó audiencia rápidamente entre los desarrolladores. Según GitHub, ya tiene 1,2 mil estrellas, y Apple presentó la última versión, la 0.2.0, con soporte de imágenes, en la conferencia WWDC26.
- Lanzamiento de la biblioteca — febrero de 2026
- 1,2 mil estrellas en GitHub
- Versión 0.2.0 con soporte de imágenes — en WWDC26
- La inferencia es totalmente local, en Apple Silicon
- La caché KV se almacena en la memoria del proceso
Para qué se necesitaba un adaptador para Hermes
Antes no existía un proveedor nativo listo para agentes de Python. Los envoltorios sobre Foundation Models emulan la interfaz de OpenAI, pero no permiten que el modelo local funcione como el motor principal del agente, con todos sus mecanismos: limitador de tasa, retorno (fallback) a otros modelos y auditoría. El uso directo de Foundation Models ya existía en el agente Swift iClaw, pero para agentes de Python más generales esta posibilidad seguía cerrada.
El adaptador para Hermes cierra esa brecha: el modelo local de Apple se convierte en el motor de inferencia habitual del agente, en lugar de ser un servicio externo detrás de un envoltorio HTTP. Esto significa que las solicitudes hacia él pasan por la misma lógica de límites, respaldos y registro que las llamadas a los modelos en la nube.
Qué resultados mostraron los benchmarks
En un conjunto de prueba de 50 preguntas, el proveedor obtuvo 46 respuestas correctas. Las preguntas se tomaron de cinco conjuntos de referencia conocidos — MMLU, BoolQ, GSM8K, BIG-Bench y HellaSwag —, es decir, se evaluaron a la vez conocimientos, lógica y aritmética. El tiempo de reacción promedio para consultas cortas fue de 2,8 segundos, algo notablemente rápido para una inferencia totalmente local en una laptop.
La combinación de velocidad y precisión es el argumento principal del caso: el agente responde sin latencia de red y sin gastar tokens en llamadas a la API.
«¿Por qué no probar a añadir a
Hermes un adaptador basado en el Foundation Models SDK for Python y lograr un tiempo de reacción promedio de 2,8 segundos para consultas cortas, además de acertar 46 respuestas en un benchmark de 50 preguntas?» — del artículo del equipo de Sber en Habr.
Qué significa esto
Los modelos locales se han acercado mucho al papel de motor principal de los agentes autónomos: sin nube, sin pago por API y con una latencia aceptable. Para los escenarios en los que importan la privacidad y el funcionamiento sin conexión, la combinación de Apple Silicon y Python está dejando de ser una rareza para convertirse en una herramienta de trabajo.
Preguntas frecuentes
¿Qué es Apple Foundation Models SDK for Python?
Es una biblioteca de Python que Apple lanzó en febrero de 2026 y que da acceso directo al modelo local de Apple Intelligence: el modelo se carga en el proceso y funciona en Apple Silicon sin necesidad de la nube. En GitHub tiene 1,2 mil estrellas, y la versión actual es la 0.2.0, con soporte de imágenes.
¿Qué resultados mostró el adaptador para Hermes?
En un benchmark de 50 preguntas (MMLU, BoolQ, GSM8K, BIG-Bench, HellaSwag), el proveedor acertó 46 respuestas, y el tiempo de respuesta promedio para consultas cortas fue de 2,8 segundos con inferencia totalmente local.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.