Poolside и Laguna S: 118B MoE обходит триллионную open-weights модель Thinky
Poolside обучила Laguna S — MoE-модель на 118 млрд параметров, которая, по заявлению компании, обходит открытую модель Thinky размером около 1 трлн параметров. Co-CEO Эйсо Кант рассказал в интервью Latent Space, что модель собрала небольшая команда исследователей на внутренней «фабрике моделей» — и это лишь первая модель из серии.
Processado por IA de Latent Space; editado por Hamidun News
O laboratório de IA Poolside treinou o Laguna S — um modelo MoE com 118 bilhões de parâmetros que, segundo a empresa, supera o modelo de pesos abertos Thinky, com cerca de 1 trilhão de parâmetros. A informação foi revelada pelo cofundador e co-CEO da Poolside, Eiso Kant, em entrevista ao podcast Latent Space, no qual ele chamou a infraestrutura interna da empresa de "fábrica de modelos".
O que é uma "fábrica de modelos"
A "fábrica de modelos" da Poolside é a combinação de uma pequena equipe de pesquisadores de ponta com uma infraestrutura de treinamento voltada para o lançamento rápido de modelos. Segundo Eiso Kant, foi exatamente esse pipeline que permitiu a uma equipe enxuta treinar o Laguna S, e isso não é o ponto final, mas o primeiro resultado de um processo já bem ajustado.
A ideia central da abordagem não é correr atrás de tamanho pelo tamanho, mas construir um processo de treinamento repetível em que cada modelo seguinte saia mais barato e mais rápido que o anterior.
- Desenvolvedor — Poolside AI Lab
- Modelo — Laguna S, MoE com 118 bilhões de parâmetros
- Resultado declarado — supera o modelo de pesos abertos Thinky (~1 trilhão de parâmetros)
- Porta-voz — Eiso Kant, cofundador e co-CEO
- Fonte — entrevista ao podcast Latent Space
O que torna o Laguna S interessante
O Laguna S se destaca pela diferença de tamanho: 118 bilhões de parâmetros contra cerca de 1 trilhão do modelo de pesos abertos Thinky — quase nove vezes menor, com, segundo afirma a Poolside, qualidade superior. Isso é obtido graças à arquitetura Mixture-of-Experts (MoE): a cada requisição, apenas parte dos "especialistas" da rede é ativada, o que faz o modelo calcular mais rápido e mais barato do que um modelo denso do mesmo tamanho nominal.
Essa diferença é um argumento na antiga discussão sobre o que determina a qualidade de um modelo: o número bruto de parâmetros ou a engenharia de treinamento. A Poolside aposta na segunda opção.
Por que isso importa para o setor
O surgimento do Laguna S mostra que uma equipe pequena consegue competir com modelos uma ordem de grandeza maiores. Segundo a Latent Space, toda a "fábrica" foi construída por um grupo enxuto de pesquisadores — sem os quadros gigantescos que os líderes de mercado operam.
Para o setor, isso coloca em xeque a fórmula conhecida de que "mais GPU e mais gente resulta em um modelo mais forte". A Poolside afirma que, com um processo bem estruturado, um modelo de 118 bilhões de parâmetros supera um de 1 trilhão, o que significa que o gargalo está se deslocando da escala para a engenharia de treinamento.
"E isso é só o começo", —
Eiso Kant, cofundador e co-CEO da Poolside, sobre o lançamento do Laguna S em entrevista à Latent Space.
O que isso significa
A Poolside afirma que aprendeu a lançar modelos competitivos com poucos recursos e que o Laguna S é apenas o primeiro de uma série. Se os resultados forem confirmados por testes independentes, isso reforçará uma tendência: a eficiência do treinamento e a arquitetura MoE passam a pesar mais do que o tamanho absoluto do modelo.
Perguntas frequentes
O que é o Laguna S?
Laguna S é um modelo de linguagem da Poolside com arquitetura Mixture-of-Experts e 118 bilhões de parâmetros. Segundo a empresa, ele supera o modelo de pesos abertos Thinky, com cerca de 1 trilhão de parâmetros.
Quem é Eiso Kant?
Eiso Kant é cofundador e co-CEO da empresa Poolside. Foi ele quem, em entrevista ao podcast Latent Space, falou sobre a "fábrica de modelos" e o treinamento do Laguna S.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.