Habr: Т-Банк→ original

Т-Банк выпустил T-Search: open-source агент для многошагового поиска на русском

Т-Банк выпустил T-Search — открытый агент-ретривер для сложного многошагового поиска и часть линейки Gen-T. Модель построена на Qwen3.6-35B-A3B и обучена полностью на синтетических данных. Ключевая особенность: T-Search не пишет финальный ответ, а отдаёт ранжированный список чанков — генерацию можно доверить любой модели под конкретный продукт. Вместе с моделью в open source выложили два бенчмарка: TRuST и SynthComp.

Processado por IA de Habr: Т-Банк; editado por Hamidun News
Т-Банк выпустил T-Search: open-source агент для многошагового поиска на русском
Fonte: Habr: Т-Банк. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, o T-Bank lançou o T-Search — um agente recuperador de código aberto para buscas complexas de múltiplas etapas, construído sobre o Qwen3.6-35B-A3B e treinado inteiramente com dados sintéticos. Trata-se de uma nova classe de modelos na linha aberta Gen-T, que já inclui as famílias em russo T-Lite e T-Pro.

Em que o T-Search se diferencia de uma busca comum

O T-Search não escreve a resposta final, mas entrega uma lista classificada de trechos relevantes (chunks) de texto. A geração da resposta final a partir dessa lista pode ser confiada a qualquer modelo, de acordo com os requisitos de cada produto específico. Essa é a decisão arquitetural chave: o recuperador (retriever) e o gerador são separados, e é o desenvolvedor quem escolhe qual LLM formula a resposta para o usuário.

O modelo é otimizado para busca de múltiplas etapas — quando a resposta não pode ser encontrada com uma única consulta, sendo necessário refinar sequencialmente, combinar fontes e descartar o que não é relevante.

  • Modelo base — Qwen3.6-35B-A3B (arquitetura MoE)
  • Treinamento — inteiramente com dados sintéticos, feitos para o harness próprio do T-Bank
  • Saída do modelo — uma lista classificada de chunks, não um texto pronto
  • Parte da linha aberta Gen-T (depois de T-Lite e T-Pro)
  • Junto com o modelo, em open source — dois benchmarks: TRuST e SynthComp

Como o modelo foi treinado

O T-Search foi treinado em duas etapas — SFT (supervised fine-tuning) e RL (aprendizado por reforço) — com dados que o próprio T-Bank gerou. Para isso, a equipe construiu uma "fábrica" de tarefas de busca sintéticas com um ciclo de verificação adversarial: as tarefas são criadas e imediatamente verificadas quanto à qualidade, para que nenhum lixo entre no conjunto de treinamento.

A abordagem para os dados sintéticos aqui é uma questão de princípio: praticamente não existem conjuntos de dados reais rotulados para busca agêntica complexa em russo, então os dados de treinamento tiveram que ser gerados para o harness específico, em vez de coletados manualmente.

"O T-Search não escreve a resposta final, mas entrega uma lista classificada de chunks; a geração pode ser confiada a qualquer modelo de acordo com os requisitos de um produto específico", disse

Tolya Potapov, MLE no T-Bank, no blog da empresa no Habr.

Para que servem os benchmarks TRuST e SynthComp

Junto com o modelo, o T-Bank abriu dois benchmarks para medir a qualidade da busca agêntica. O TRuST, segundo a descrição da equipe, é o primeiro benchmark de busca agêntica complexa em russo. O SynthComp é um benchmark sintético em russo e inglês com índices fixos, o que permite comparar de forma reprodutível diferentes recuperadores sobre os mesmos dados.

Benchmarks abertos em russo são importantes por si só: a maioria das métricas de retrieval e RAG historicamente é voltada para o inglês, e até agora quase não havia como medir objetivamente a qualidade da busca em russo.

O que isso significa

O T-Bank continua a expandir o ecossistema aberto de IA russo: depois dos modelos de linguagem T-Lite e T-Pro, surgiu um recuperador especializado, além de ferramentas para avaliá-lo. Para equipes que constroem RAG e agentes de busca em russo, trata-se de um componente open source pronto para uso e uma forma de medir honestamente sua qualidade.

Perguntas frequentes

O que é o T-Search?

O T-Search é o agente recuperador de código aberto do T-Bank para busca complexa de múltiplas etapas, baseado no Qwen3.6-35B-A3B. Ele não gera a resposta final, mas retorna uma lista classificada de trechos de texto relevantes, sobre os quais qualquer modelo escolhido forma a resposta.

Com quais dados o T-Search foi treinado?

O modelo foi treinado inteiramente com dados sintéticos que o T-Bank gerou para seu próprio harness por meio de uma "fábrica" de tarefas de busca com um ciclo de verificação adversarial. O treinamento ocorreu em duas etapas — SFT e RL.

Quais benchmarks o T-Bank divulgou?

Junto com o modelo, foram lançados em open source dois benchmarks: TRuST — o primeiro benchmark de busca agêntica complexa em russo — e SynthComp — um benchmark sintético em russo e inglês com índices fixos.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…