HIPE-2026: как извлечь связи «человек-место» из исторических газет без нейросетей
Команда DS@GT HIPE на научном соревновании HIPE-2026 научилась извлекать связи «человек-место» из исторических газет без больших языковых моделей. Их система размером под 847 тысяч параметров заняла 3-е место по эффективности среди 17 команд с macro recall 0,5142. Главный вывод: минимальное расстояние между упоминаниями в тексте почти полностью решает задачу, а сложные признаки часто лишь мешают.
Processado por IA de arXiv cs.CL; editado por Hamidun News
A equipe DS@GT HIPE, na competição científica HIPE-2026, mostrou que é possível extrair relações "pessoa-lugar" de jornais históricos sem modelos de linguagem pré-treinados: seu sistema, com até 847 mil parâmetros, ficou em 3º lugar no perfil de eficiência entre 17 equipes, alcançando um macro recall de 0,5142. O preprint foi publicado no arXiv (julho de 2026).
O que a pesquisa mostrou
O HIPE-2026 introduziu pela primeira vez a extração de relações "pessoa-lugar" de jornais históricos multilíngues como uma trilha de avaliação separada — em inglês, francês e alemão. A tarefa da trilha é classificar as relações at e isAt entre menções de pessoas e locais previamente rotuladas. A equipe DS@GT HIPE (team2 nos resultados oficiais) testou até onde é possível chegar com um sistema leve e interpretável que, na etapa de classificação de relações, não usa nenhum modelo de linguagem grande.
O sistema da DS@GT HIPE constrói um grafo em nível de documento a partir de análises sintáticas de dependência (dependency parses), extrai características de proximidade e de classe gramatical para cada par de entidades, e as classifica com pequenos ensembles de scikit-learn ou compactas Graph Attention Networks. Cada execução enviada para avaliação ficou abaixo de 847 mil parâmetros.
*HIPE-2026 é uma trilha nova: relações "pessoa-lugar", nos idiomas inglês, francês e alemão
*São classificadas as relações at e isAt entre menções rotuladas de pessoas e lugares
*A equipe DS@GT HIPE é a team2 nos resultados oficiais
*Melhor execução: macro recall de 0,5142 no Test A (o conjunto de jornais)
*Resultado: 3º lugar em eficiência, meio da tabela em precisão entre 17 equipes
Qual característica resolve a tarefa?
A distância mínima de caracteres entre entidades, por si só, capta a maior parte do sinal de classificação — essa é a primeira das duas principais conclusões da equipe. Adicionar outras características construídas traz ganhos desiguais e, às vezes, piora o resultado. Isso ecoa dados anteriores de que a distância entre os argumentos domina a tarefa de extração de relações.
"A distância mínima de caracteres, por si só, capta a maior parte do
sinal de classificação", afirma o artigo da equipe DS@GT HIPE no arXiv.
O sentido prático é simples: engenharia cara de características e modelos pesados não se pagam aqui. A proximidade de duas menções no texto é um sinal quase suficiente para prever uma relação entre uma pessoa e um lugar.
Por que a validação cruzada comum infla o resultado?
Dividir os dados no nível do par infla a pontuação em 25-37 pontos percentuais — porque as mesmas menções de entidades se repetem em documentos diferentes e criam vazamento de dados (data leakage). A equipe DS@GT HIPE mostrou que, nesse corpus, é fundamental aplicar validação cruzada agrupada por documento (document-grouped): ela elimina o vazamento e devolve uma estimativa honesta de qualidade.
Essa conclusão é mais importante do que a posição específica na tabela do torneio. Ela alerta outros pesquisadores de arquivos históricos: a validação cruzada aleatória padrão desenha sistematicamente um quadro otimista demais quando as menções de pessoas e lugares migram de um documento para outro.
O que isso significa
Ao digitalizar arquivos históricos, a escala e o custo do processamento importam tanto quanto a precisão. O trabalho da DS@GT HIPE mostra que métodos leves e interpretáveis com menos de um milhão de parâmetros continuam competitivos em eficiência, e que um esquema de avaliação honesto vale mais do que mais uma característica complexa.
Perguntas frequentes
O que são as relações at e isAt no HIPE-2026?
São tipos de relações "pessoa-lugar" que precisam ser classificadas entre menções previamente rotuladas de pessoas e locais em jornais históricos em inglês, francês e alemão. A trilha foi adicionada ao HIPE-2026 como uma nova tarefa de avaliação.
Por que o sistema dispensou os grandes modelos de linguagem?
A equipe DS@GT HIPE testou até onde é possível chegar com uma abordagem leve e interpretável: um grafo construído a partir de análises sintáticas de dependência mais características de proximidade, com a classificação feita por ensembles de scikit-learn ou compactas Graph Attention Networks. Todas as execuções ficaram abaixo de 847 mil parâmetros, o que garantiu o 3º lugar em eficiência.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.