Apple Foundation Models SDK for Python: локальная Apple Intelligence в агенте Hermes
Команда Сбера собрала нативный провайдер, который подключает локальную модель Apple Intelligence к автономному Python-агенту Hermes через Foundation Models SDK. Модель грузится прямо в процесс и работает на Apple Silicon без облака: среднее время ответа на короткие запросы — 2,8 секунды, а на бенчмарке из 50 вопросов (MMLU, GSM8K, HellaSwag и др.) адаптер дал 46 правильных ответов.
Processado por IA de Habr: Сбер; editado por Hamidun News
Engenheiros do Sber mostraram, em um post no blog do Habr, um provedor nativo que conecta o modelo local da Apple Intelligence ao agente autônomo em Python Hermes por meio do Apple Foundation Models SDK for Python. Segundo suas medições, o tempo médio de resposta para consultas curtas foi de 2,8 segundos, e em um benchmark de 50 perguntas o adaptador acertou 46 respostas.
O que é o Foundation Models SDK for Python
O Apple Foundation Models SDK for Python é uma biblioteca que dá acesso direto ao modelo local da Apple Intelligence diretamente a partir de código Python. A Apple o lançou em fevereiro de 2026: o modelo é carregado no processo, o cache KV fica na memória RAM, e a inferência roda nos chips Apple Silicon sem depender da nuvem.
A biblioteca ganhou audiência rapidamente entre os desenvolvedores. Segundo o GitHub, ela já tem 1,2 mil estrelas, e a Apple apresentou a versão mais recente, a 0.2.0, com suporte a imagens, na conferência WWDC26.
- Lançamento da biblioteca — fevereiro de 2026
- 1,2 mil estrelas no GitHub
- Versão 0.2.0 com suporte a imagens — na WWDC26
- A inferência é totalmente local, em Apple Silicon
- O cache KV fica armazenado na memória do processo
Por que o Hermes precisava de um adaptador
Antes disso, não existia um provedor nativo pronto para agentes em Python. Os wrappers sobre o Foundation Models emulam a interface da OpenAI, mas não permitem que o modelo local funcione como o motor principal do agente — com todos os seus mecanismos: limitador de taxa (rate limiter), fallback para outros modelos e auditoria. O uso direto do Foundation Models já existia no agente em Swift iClaw, mas para agentes em Python mais genéricos essa possibilidade permanecia fechada.
O adaptador para o Hermes fecha essa lacuna: o modelo local da Apple passa a ser o mecanismo de inferência padrão do agente, e não um serviço externo por trás de um wrapper HTTP. Isso significa que as requisições a ele passam pela mesma lógica de limites, fallbacks e logging que as chamadas aos modelos na nuvem.
Que resultados os benchmarks mostraram
Em um conjunto de teste com 50 perguntas, o provedor acertou 46 respostas. As perguntas foram tiradas de cinco conjuntos conhecidos — MMLU, BoolQ, GSM8K, BIG-Bench e HellaSwag —, ou seja, testaram ao mesmo tempo conhecimento, lógica e aritmética. O tempo médio de reação para consultas curtas foi de 2,8 segundos — para uma inferência totalmente local em um notebook, isso é sensivelmente rápido.
A combinação de velocidade e precisão é o principal argumento do caso: o agente responde sem latência de rede e sem gastar tokens em chamadas de API.
"Por que não tentar adicionar ao
Hermes um adaptador baseado no Foundation Models SDK for Python e obter um tempo médio de reação de 2,8 segundos para consultas curtas, além de acertar 46 respostas corretas em um benchmark de 50 perguntas?" — do artigo da equipe do Sber no Habr.
O que isso significa
Os modelos locais chegaram bem perto de assumir o papel de motor principal de agentes autônomos: sem nuvem, sem custo de API e com uma latência aceitável. Para cenários em que privacidade e operação offline importam, a combinação de Apple Silicon e Python está deixando de ser uma curiosidade exótica para se tornar uma ferramenta de trabalho.
Perguntas frequentes
O que é o Apple Foundation Models SDK for Python?
É uma biblioteca em Python lançada pela Apple em fevereiro de 2026, que dá acesso direto ao modelo local da Apple Intelligence: o modelo é carregado no processo e roda em Apple Silicon sem depender da nuvem. No GitHub ela tem 1,2 mil estrelas, e a versão atual é a 0.2.0, com suporte a imagens.
Que resultados o adaptador para o Hermes mostrou?
Em um benchmark de 50 perguntas (MMLU, BoolQ, GSM8K, BIG-Bench, HellaSwag), o provedor acertou 46 respostas, e o tempo médio de resposta para consultas curtas foi de 2,8 segundos, com inferência totalmente local.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.