Habr: Сбер→ original

Apple Foundation Models SDK for Python: локальная Apple Intelligence в агенте Hermes

Команда Сбера собрала нативный провайдер, который подключает локальную модель Apple Intelligence к автономному Python-агенту Hermes через Foundation Models SDK. Модель грузится прямо в процесс и работает на Apple Silicon без облака: среднее время ответа на короткие запросы — 2,8 секунды, а на бенчмарке из 50 вопросов (MMLU, GSM8K, HellaSwag и др.) адаптер дал 46 правильных ответов.

Processado por IA de Habr: Сбер; editado por Hamidun News
Apple Foundation Models SDK for Python: локальная Apple Intelligence в агенте Hermes
Fonte: Habr: Сбер. Colagem: Hamidun News.
◐ Ouvir artigo

Engenheiros do Sber mostraram, em um post no blog do Habr, um provedor nativo que conecta o modelo local da Apple Intelligence ao agente autônomo em Python Hermes por meio do Apple Foundation Models SDK for Python. Segundo suas medições, o tempo médio de resposta para consultas curtas foi de 2,8 segundos, e em um benchmark de 50 perguntas o adaptador acertou 46 respostas.

O que é o Foundation Models SDK for Python

O Apple Foundation Models SDK for Python é uma biblioteca que dá acesso direto ao modelo local da Apple Intelligence diretamente a partir de código Python. A Apple o lançou em fevereiro de 2026: o modelo é carregado no processo, o cache KV fica na memória RAM, e a inferência roda nos chips Apple Silicon sem depender da nuvem.

A biblioteca ganhou audiência rapidamente entre os desenvolvedores. Segundo o GitHub, ela já tem 1,2 mil estrelas, e a Apple apresentou a versão mais recente, a 0.2.0, com suporte a imagens, na conferência WWDC26.

  • Lançamento da biblioteca — fevereiro de 2026
  • 1,2 mil estrelas no GitHub
  • Versão 0.2.0 com suporte a imagens — na WWDC26
  • A inferência é totalmente local, em Apple Silicon
  • O cache KV fica armazenado na memória do processo

Por que o Hermes precisava de um adaptador

Antes disso, não existia um provedor nativo pronto para agentes em Python. Os wrappers sobre o Foundation Models emulam a interface da OpenAI, mas não permitem que o modelo local funcione como o motor principal do agente — com todos os seus mecanismos: limitador de taxa (rate limiter), fallback para outros modelos e auditoria. O uso direto do Foundation Models já existia no agente em Swift iClaw, mas para agentes em Python mais genéricos essa possibilidade permanecia fechada.

O adaptador para o Hermes fecha essa lacuna: o modelo local da Apple passa a ser o mecanismo de inferência padrão do agente, e não um serviço externo por trás de um wrapper HTTP. Isso significa que as requisições a ele passam pela mesma lógica de limites, fallbacks e logging que as chamadas aos modelos na nuvem.

Que resultados os benchmarks mostraram

Em um conjunto de teste com 50 perguntas, o provedor acertou 46 respostas. As perguntas foram tiradas de cinco conjuntos conhecidos — MMLU, BoolQ, GSM8K, BIG-Bench e HellaSwag —, ou seja, testaram ao mesmo tempo conhecimento, lógica e aritmética. O tempo médio de reação para consultas curtas foi de 2,8 segundos — para uma inferência totalmente local em um notebook, isso é sensivelmente rápido.

A combinação de velocidade e precisão é o principal argumento do caso: o agente responde sem latência de rede e sem gastar tokens em chamadas de API.

"Por que não tentar adicionar ao

Hermes um adaptador baseado no Foundation Models SDK for Python e obter um tempo médio de reação de 2,8 segundos para consultas curtas, além de acertar 46 respostas corretas em um benchmark de 50 perguntas?" — do artigo da equipe do Sber no Habr.

O que isso significa

Os modelos locais chegaram bem perto de assumir o papel de motor principal de agentes autônomos: sem nuvem, sem custo de API e com uma latência aceitável. Para cenários em que privacidade e operação offline importam, a combinação de Apple Silicon e Python está deixando de ser uma curiosidade exótica para se tornar uma ferramenta de trabalho.

Perguntas frequentes

O que é o Apple Foundation Models SDK for Python?

É uma biblioteca em Python lançada pela Apple em fevereiro de 2026, que dá acesso direto ao modelo local da Apple Intelligence: o modelo é carregado no processo e roda em Apple Silicon sem depender da nuvem. No GitHub ela tem 1,2 mil estrelas, e a versão atual é a 0.2.0, com suporte a imagens.

Que resultados o adaptador para o Hermes mostrou?

Em um benchmark de 50 perguntas (MMLU, BoolQ, GSM8K, BIG-Bench, HellaSwag), o provedor acertou 46 respostas, e o tempo médio de resposta para consultas curtas foi de 2,8 segundos, com inferência totalmente local.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…