Т-Банк выпустил T-Search: open-source агент для многошагового поиска на русском
Т-Банк выпустил T-Search — открытый агент-ретривер для сложного многошагового поиска и часть линейки Gen-T. Модель построена на Qwen3.6-35B-A3B и обучена полностью на синтетических данных. Ключевая особенность: T-Search не пишет финальный ответ, а отдаёт ранжированный список чанков — генерацию можно доверить любой модели под конкретный продукт. Вместе с моделью в open source выложили два бенчмарка: TRuST и SynthComp.
Processado por IA de Habr: Т-Банк; editado por Hamidun News
Em julho de 2026, o T-Bank lançou o T-Search — um agente recuperador de código aberto para buscas complexas de múltiplas etapas, construído sobre o Qwen3.6-35B-A3B e treinado inteiramente com dados sintéticos. Trata-se de uma nova classe de modelos na linha aberta Gen-T, que já inclui as famílias em russo T-Lite e T-Pro.
Em que o T-Search se diferencia de uma busca comum
O T-Search não escreve a resposta final, mas entrega uma lista classificada de trechos relevantes (chunks) de texto. A geração da resposta final a partir dessa lista pode ser confiada a qualquer modelo, de acordo com os requisitos de cada produto específico. Essa é a decisão arquitetural chave: o recuperador (retriever) e o gerador são separados, e é o desenvolvedor quem escolhe qual LLM formula a resposta para o usuário.
O modelo é otimizado para busca de múltiplas etapas — quando a resposta não pode ser encontrada com uma única consulta, sendo necessário refinar sequencialmente, combinar fontes e descartar o que não é relevante.
- Modelo base — Qwen3.6-35B-A3B (arquitetura MoE)
- Treinamento — inteiramente com dados sintéticos, feitos para o harness próprio do T-Bank
- Saída do modelo — uma lista classificada de chunks, não um texto pronto
- Parte da linha aberta Gen-T (depois de T-Lite e T-Pro)
- Junto com o modelo, em open source — dois benchmarks: TRuST e SynthComp
Como o modelo foi treinado
O T-Search foi treinado em duas etapas — SFT (supervised fine-tuning) e RL (aprendizado por reforço) — com dados que o próprio T-Bank gerou. Para isso, a equipe construiu uma "fábrica" de tarefas de busca sintéticas com um ciclo de verificação adversarial: as tarefas são criadas e imediatamente verificadas quanto à qualidade, para que nenhum lixo entre no conjunto de treinamento.
A abordagem para os dados sintéticos aqui é uma questão de princípio: praticamente não existem conjuntos de dados reais rotulados para busca agêntica complexa em russo, então os dados de treinamento tiveram que ser gerados para o harness específico, em vez de coletados manualmente.
"O T-Search não escreve a resposta final, mas entrega uma lista classificada de chunks; a geração pode ser confiada a qualquer modelo de acordo com os requisitos de um produto específico", disse
Tolya Potapov, MLE no T-Bank, no blog da empresa no Habr.
Para que servem os benchmarks TRuST e SynthComp
Junto com o modelo, o T-Bank abriu dois benchmarks para medir a qualidade da busca agêntica. O TRuST, segundo a descrição da equipe, é o primeiro benchmark de busca agêntica complexa em russo. O SynthComp é um benchmark sintético em russo e inglês com índices fixos, o que permite comparar de forma reprodutível diferentes recuperadores sobre os mesmos dados.
Benchmarks abertos em russo são importantes por si só: a maioria das métricas de retrieval e RAG historicamente é voltada para o inglês, e até agora quase não havia como medir objetivamente a qualidade da busca em russo.
O que isso significa
O T-Bank continua a expandir o ecossistema aberto de IA russo: depois dos modelos de linguagem T-Lite e T-Pro, surgiu um recuperador especializado, além de ferramentas para avaliá-lo. Para equipes que constroem RAG e agentes de busca em russo, trata-se de um componente open source pronto para uso e uma forma de medir honestamente sua qualidade.
Perguntas frequentes
O que é o T-Search?
O T-Search é o agente recuperador de código aberto do T-Bank para busca complexa de múltiplas etapas, baseado no Qwen3.6-35B-A3B. Ele não gera a resposta final, mas retorna uma lista classificada de trechos de texto relevantes, sobre os quais qualquer modelo escolhido forma a resposta.
Com quais dados o T-Search foi treinado?
O modelo foi treinado inteiramente com dados sintéticos que o T-Bank gerou para seu próprio harness por meio de uma "fábrica" de tarefas de busca com um ciclo de verificação adversarial. O treinamento ocorreu em duas etapas — SFT e RL.
Quais benchmarks o T-Bank divulgou?
Junto com o modelo, foram lançados em open source dois benchmarks: TRuST — o primeiro benchmark de busca agêntica complexa em russo — e SynthComp — um benchmark sintético em russo e inglês com índices fixos.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.