Latent Space→ оригинал

Poolside и Laguna S: 118B MoE обходит триллионную open-weights модель Thinky

Poolside обучила Laguna S — MoE-модель на 118 млрд параметров, которая, по заявлению компании, обходит открытую модель Thinky размером около 1 трлн параметров. Co-CEO Эйсо Кант рассказал в интервью Latent Space, что модель собрала небольшая команда исследователей на внутренней «фабрике моделей» — и это лишь первая модель из серии.

AI-обработка оригинала Latent Space; редакция Hamidun News
Poolside и Laguna S: 118B MoE обходит триллионную open-weights модель Thinky
Источник: Latent Space. Коллаж: Hamidun News.
◐ Слушать статью

AI-лаборатория Poolside обучила Laguna S — MoE-модель на 118 млрд параметров, которая, по заявлению компании, обходит открытую модель Thinky размером около 1 трлн параметров. Об этом сооснователь и co-CEO Poolside Эйсо Кант (Eiso Kant) рассказал в интервью подкасту Latent Space, назвав внутреннюю инфраструктуру компании «фабрикой моделей».

Что такое «фабрика моделей»

«Фабрика моделей» Poolside — это связка небольшой команды топовых исследователей и обучающей инфраструктуры, заточенной под быстрый выпуск моделей. По словам Эйсо Канта, именно этот конвейер позволил силами компактной команды обучить Laguna S, и это не финальная точка, а первый результат отлаженного процесса.

Ключевая идея подхода — не гнаться за размером ради размера, а выстроить повторяемый процесс обучения, где каждая следующая модель обходится дешевле и выходит быстрее предыдущей.

  • Разработчик — AI-лаборатория Poolside
  • Модель — Laguna S, MoE на 118 млрд параметров
  • Заявленный результат — обходит открытую модель Thinky (~1 трлн параметров)
  • Спикер — Эйсо Кант (Eiso Kant), сооснователь и co-CEO
  • Источник — интервью подкасту Latent Space

Чем интересна Laguna S

Laguna S интересна разрывом в размере: 118 млрд параметров против примерно 1 трлн у open-weights модели Thinky — почти в девять раз меньше при, как утверждает Poolside, более высоком качестве. Достигается это за счёт архитектуры Mixture-of-Experts (MoE): на каждый запрос активируется лишь часть «экспертов» сети, поэтому модель считает быстрее и дешевле, чем плотная модель того же номинального размера.

Такой разрыв — аргумент в давнем споре о том, что решает в качестве модели: сырое число параметров или инженерия обучения. Poolside ставит на второе.

Почему это важно для отрасли

Появление Laguna S показывает, что небольшая команда способна конкурировать с моделями на порядок крупнее. По данным Latent Space, вся «фабрика» построена силами компактной группы исследователей — без гигантских штатов, которыми оперируют лидеры рынка.

Для индустрии это ставит под вопрос привычную формулу «больше GPU и больше людей — сильнее модель». Poolside утверждает, что при верно выстроенном процессе 118-миллиардная модель бьёт триллионную, а значит, узкое место смещается с масштаба на инженерию обучения.

«И это только начало», —

Эйсо Кант, сооснователь и co-CEO Poolside, о выпуске Laguna S в интервью Latent Space.

Что это значит

Poolside заявляет, что научилась выпускать конкурентные модели малыми силами и что Laguna S — лишь первая из серии. Если результаты подтвердятся независимыми тестами, это усилит тренд: эффективность обучения и архитектура MoE начинают весить больше, чем абсолютный размер модели.

Частые вопросы

Что такое Laguna S?

Laguna S — это языковая модель Poolside с архитектурой Mixture-of-Experts на 118 млрд параметров. По заявлению компании, она обходит открытую модель Thinky размером около 1 трлн параметров.

Кто такой Эйсо Кант?

Эйсо Кант (Eiso Kant) — сооснователь и co-CEO компании Poolside. Именно он в интервью подкасту Latent Space рассказал о «фабрике моделей» и обучении Laguna S.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…