Google Research выпустила TabFM — foundation-модель для табличных данных с zero-shot
Google Research показала TabFM — foundation-модель для табличных данных с гибридным вниманием. Она делает zero-shot классификацию и регрессию за один forward pass через in-context learning, без обучения под конкретный датасет, подбора гиперпараметров и ручного feature engineering. Об этом 1 июля 2026 года сообщил портал MarkTechPost.
AI-обработка оригинала MarkTechPost; редакция Hamidun News
Google Research представила TabFM — foundation-модель для табличных данных, способную делать zero-shot классификацию и регрессию без обучения под конкретный датасет; об этом 1 июля 2026 года сообщил портал MarkTechPost.
Как TabFM обрабатывает таблицы
TabFM получает предсказания за один проход вперёд (forward pass), используя in-context learning — модель «на лету» опирается на примеры внутри самого запроса, без отдельного цикла обучения под каждый датасет.
- Формат — foundation-модель для табличных данных
- Возможности — zero-shot классификация и регрессия
- Метод — in-context learning, предсказание за один forward pass
- Не требует — обучения под датасет, подбора гиперпараметров, ручного feature engineering
- Архитектура — гибридное внимание (hybrid-attention)
В названии модели заявлена гибридная архитектура внимания — она позволяет одновременно учитывать связи между строками (объектами) и между столбцами (признаками) таблицы, что в классических трансформерах, заточенных под текст, не заложено по умолчанию.
Почему табличные данные — отдельная проблема для ИИ
Большая часть корпоративных данных — не текст и не картинки, а таблицы: строки клиентов, транзакций, показателей. Долгое время лучшими инструментами для такой задачи оставались градиентный бустинг и классические ML-модели вроде XGBoost и LightGBM — они точны, но каждую нужно заново обучать и настраивать под конкретный датасет и конкретную задачу, а любое изменение состава признаков означает новый цикл подготовки данных.
Идея foundation-модели для таблиц в том, чтобы одна модель подходила для многих задач: обучить одну большую модель на множестве разнородных таблиц заранее, а затем применять её к новым данным без переобучения — по аналогии с тем, как языковые модели решают новые текстовые задачи без дообучения, если их правильно попросить. Для табличных данных этот путь долго считался труднодостижимым именно из-за разнородности таблиц: у каждой свой набор столбцов, типов данных и смысловых связей между ними, в отличие от текста, где грамматика и словарь у всех документов общие.
Что это значит для дата-сайентистов
Если zero-shot-подход TabFM работает достаточно точно на реальных корпоративных данных, это меняет экономику типовых ML-задач с таблицами: вместо цикла «собрать датасет → обучить модель → подобрать гиперпараметры → задеплоить» останется один шаг — подать данные в модель и получить прогноз. Это особенно ценно для задач, где датасет маленький или быстро меняется, и обучать отдельную модель под него невыгодно.
Что это значит
Google Research в очередной раз переносит логику foundation-моделей — «обучи один раз, применяй везде» — из текста и изображений в область табличных данных, которая до сих пор оставалась вотчиной классического machine learning. Если подход подтвердится на практике на широком круге задач, конкуренция развернётся не только между foundation-моделями для таблиц разных компаний, но и между этим новым классом моделей и привычным градиентным бустингом — за то, кто станет инструментом по умолчанию для типовых ML-задач с табличными данными.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.