arXiv cs.CL→ original

HIPE-2026: как извлечь связи «человек-место» из исторических газет без нейросетей

Команда DS@GT HIPE на научном соревновании HIPE-2026 научилась извлекать связи «человек-место» из исторических газет без больших языковых моделей. Их система размером под 847 тысяч параметров заняла 3-е место по эффективности среди 17 команд с macro recall 0,5142. Главный вывод: минимальное расстояние между упоминаниями в тексте почти полностью решает задачу, а сложные признаки часто лишь мешают.

Processado por IA de arXiv cs.CL; editado por Hamidun News
HIPE-2026: как извлечь связи «человек-место» из исторических газет без нейросетей
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

A equipe DS@GT HIPE, na competição científica HIPE-2026, mostrou que é possível extrair relações "pessoa-lugar" de jornais históricos sem modelos de linguagem pré-treinados: seu sistema, com até 847 mil parâmetros, ficou em 3º lugar no perfil de eficiência entre 17 equipes, alcançando um macro recall de 0,5142. O preprint foi publicado no arXiv (julho de 2026).

O que a pesquisa mostrou

O HIPE-2026 introduziu pela primeira vez a extração de relações "pessoa-lugar" de jornais históricos multilíngues como uma trilha de avaliação separada — em inglês, francês e alemão. A tarefa da trilha é classificar as relações at e isAt entre menções de pessoas e locais previamente rotuladas. A equipe DS@GT HIPE (team2 nos resultados oficiais) testou até onde é possível chegar com um sistema leve e interpretável que, na etapa de classificação de relações, não usa nenhum modelo de linguagem grande.

O sistema da DS@GT HIPE constrói um grafo em nível de documento a partir de análises sintáticas de dependência (dependency parses), extrai características de proximidade e de classe gramatical para cada par de entidades, e as classifica com pequenos ensembles de scikit-learn ou compactas Graph Attention Networks. Cada execução enviada para avaliação ficou abaixo de 847 mil parâmetros.

*HIPE-2026 é uma trilha nova: relações "pessoa-lugar", nos idiomas inglês, francês e alemão

*São classificadas as relações at e isAt entre menções rotuladas de pessoas e lugares

*A equipe DS@GT HIPE é a team2 nos resultados oficiais

*Melhor execução: macro recall de 0,5142 no Test A (o conjunto de jornais)

*Resultado: 3º lugar em eficiência, meio da tabela em precisão entre 17 equipes

Qual característica resolve a tarefa?

A distância mínima de caracteres entre entidades, por si só, capta a maior parte do sinal de classificação — essa é a primeira das duas principais conclusões da equipe. Adicionar outras características construídas traz ganhos desiguais e, às vezes, piora o resultado. Isso ecoa dados anteriores de que a distância entre os argumentos domina a tarefa de extração de relações.

"A distância mínima de caracteres, por si só, capta a maior parte do

sinal de classificação", afirma o artigo da equipe DS@GT HIPE no arXiv.

O sentido prático é simples: engenharia cara de características e modelos pesados não se pagam aqui. A proximidade de duas menções no texto é um sinal quase suficiente para prever uma relação entre uma pessoa e um lugar.

Por que a validação cruzada comum infla o resultado?

Dividir os dados no nível do par infla a pontuação em 25-37 pontos percentuais — porque as mesmas menções de entidades se repetem em documentos diferentes e criam vazamento de dados (data leakage). A equipe DS@GT HIPE mostrou que, nesse corpus, é fundamental aplicar validação cruzada agrupada por documento (document-grouped): ela elimina o vazamento e devolve uma estimativa honesta de qualidade.

Essa conclusão é mais importante do que a posição específica na tabela do torneio. Ela alerta outros pesquisadores de arquivos históricos: a validação cruzada aleatória padrão desenha sistematicamente um quadro otimista demais quando as menções de pessoas e lugares migram de um documento para outro.

O que isso significa

Ao digitalizar arquivos históricos, a escala e o custo do processamento importam tanto quanto a precisão. O trabalho da DS@GT HIPE mostra que métodos leves e interpretáveis com menos de um milhão de parâmetros continuam competitivos em eficiência, e que um esquema de avaliação honesto vale mais do que mais uma característica complexa.

Perguntas frequentes

O que são as relações at e isAt no HIPE-2026?

São tipos de relações "pessoa-lugar" que precisam ser classificadas entre menções previamente rotuladas de pessoas e locais em jornais históricos em inglês, francês e alemão. A trilha foi adicionada ao HIPE-2026 como uma nova tarefa de avaliação.

Por que o sistema dispensou os grandes modelos de linguagem?

A equipe DS@GT HIPE testou até onde é possível chegar com uma abordagem leve e interpretável: um grafo construído a partir de análises sintáticas de dependência mais características de proximidade, com a classificação feita por ensembles de scikit-learn ou compactas Graph Attention Networks. Todas as execuções ficaram abaixo de 847 mil parâmetros, o que garantiu o 3º lugar em eficiência.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…