Glossário de IA

Definições curtas e precisas dos termos da inteligência artificial, sem névoa acadêmica. Cada verbete começa com uma resposta de duas frases, seguida de uma explicação mais profunda, um exemplo concreto e conceitos relacionados. O glossário cresce à medida que novos termos entram no noticiário.

Modelos

Aprendizado de Máquina
Aprendizado de máquina é um ramo da inteligência artificial no qual algoritmos melhoram automaticamente seu desempenho em uma tarefa aprendendo padrões a partir de dados, sem serem explicitamente programados com regras e
Aprendizado Profundo
Aprendizado profundo é um subcampo do aprendizado de máquina que treina redes neurais com muitas camadas para aprender representações hierárquicas diretamente de dados brutos como pixels, formas de onda de áudio ou token
Convolutional Neural Network (CNN)
Uma Convolutional Neural Network (CNN) é uma arquitetura de aprendizado profundo que aplica filtros com compartilhamento de pesos aprendidos sobre patches locais de dados de entrada — mais comumente imagens — para detect
Decoder-Only Architecture
Uma arquitetura Decoder-Only é uma variante de transformer que usa uma única stack de self-attention com masking causal (esquerda-para-direita) para prever cada próximo token a partir de seu contexto anterior, sem um enc
Diffusion Model
Um diffusion model é um sistema de IA generativa que produz imagens, áudio ou vídeo ao aprender a reverter um processo iterativo de adição de ruído, começando de ruído aleatório e progressivamente removendo o ruído atrav
Encoder–Decoder Architecture
Uma arquitetura Encoder–Decoder é um design de rede neural em que um encoder mapeia uma entrada em uma representação latente e um decoder separado gera a sequência de saída a partir dessa representação, tornando-se adequ
Foundation Model
Um foundation model é um sistema de IA de grande escala pré-treinado em dados amplos e diversos—texto, imagens, código—para servir como uma base de propósito geral adaptável a muitas tarefas subsequentes. O termo foi int
Frontier Model
Um frontier model é um sistema de IA operando nos limites atuais da capacidade de aprendizado de máquina, tipicamente treinado com os maiores orçamentos de computação conhecidos. O termo é usado em políticas de IA para i
Grande Modelo de Linguagem (LLM)
Um grande modelo de linguagem (LLM) é uma rede neural baseada em transformer com bilhões de parâmetros treinada em texto de escala da internet para modelar e gerar linguagem humana, capaz de executar tarefas diversas atr
IA Generativa
IA Generativa se refere a sistemas de aprendizado de máquina que produzem novos conteúdos — texto, imagens, áudio, vídeo ou código — ao aprender padrões estatísticos de grandes conjuntos de dados de treinamento. Diferent
Mixture of Experts (MoE)
Mixture of Experts (MoE) é uma arquitetura de rede neural onde um mecanismo de roteamento aprendido ativa apenas um pequeno subconjunto de sub-redes especializadas (experts) para cada token de entrada, permitindo grandes
Modelo de Embedding
Um modelo de embedding converte texto, imagens ou outros dados em vetores numéricos de comprimento fixo em um espaço de alta dimensionalidade, onde itens semanticamente similares ficam geometricamente próximos um do outr
Modelo de Mundo
Um modelo de mundo é uma representação interna que um sistema de IA aprende da dinâmica de seu ambiente, permitindo-lhe prever as consequências de ações e simular estados futuros sem interagir diretamente com o mundo rea
Modelo de Pesos Abertos
Um modelo de pesos abertos é um sistema de IA cujos pesos de parâmetros treinados são divulgados publicamente, permitindo que qualquer pessoa baixe, execute e modifique o modelo sem acessar a infraestrutura do desenvolve
Modelo de Raciocínio
Um modelo de raciocínio é um sistema de IA projetado para resolver problemas complexos e multi-etapas gerando passos de raciocínio intermediários explícitos — frequentemente chamados de cadeia de pensamento — antes de pr
Modelo de Visão-Linguagem (VLM)
Um Modelo de Visão-Linguagem (VLM) é um modelo de IA que processa conjuntamente entradas visuais (imagens ou vídeo) e texto de linguagem natural, permitindo tarefas como legendagem de imagens, resposta a perguntas visuai
Modelo Multimodal
Um modelo multimodal é um sistema de IA que processa e gera dados em mais de uma modalidade — como texto, imagens, áudio ou vídeo — dentro de uma arquitetura unificada única.
Modelo Text-to-Image
Um modelo text-to-image é um sistema de IA generativa que produz imagens raster a partir de prompts em linguagem natural, sintetizando conteúdo visual que corresponde à cena, estilo ou assunto descrito.
Modelo Text-to-Video
Um modelo text-to-video é um sistema de IA generativa que sintetiza clipes de vídeo a partir de prompts em linguagem natural, produzindo sequências de quadros temporalmente coerentes que correspondem ao movimento, cena o
Pequeno Modelo de Linguagem (SLM)
Um pequeno modelo de linguagem (SLM) é um modelo de linguagem com uma contagem de parâmetros compacta—tipicamente 1 a 13 bilhões de parâmetros—otimizado para inferência eficiente em dispositivos de consumidor, hardware d
Reconhecimento de Fala (ASR)
Reconhecimento de fala (ASR) é uma tecnologia que converte áudio falado em texto escrito, usando modelos de aprendizado de máquina treinados em grandes corpora de fala para transcrever com precisão palavras e sentenças e
Recurrent Neural Network (RNN)
Uma Recurrent Neural Network (RNN) é uma rede neural que processa dados sequenciais mantendo um vetor de estado oculto atualizado em cada passo de tempo, permitindo que informações de entradas anteriores influenciem pred
Rede Neural
Uma rede neural é um modelo computacional composto por camadas interconectadas de unidades numéricas (neurônios) que aprendem a mapear entradas para saídas ajustando os pesos das conexões através da exposição aos dados d
Rede Neural Adversária Generativa (GAN)
Uma Rede Neural Adversária Generativa (GAN) é uma arquitetura de rede dual na qual um gerador produz dados sintéticos e um discriminador tenta classificá-los como reais ou falsos; o treinamento adversário entre os dois i
State Space Model (SSM)
State Space Model (SSM) é uma classe de arquiteturas de processamento de sequências derivadas da teoria de controle que representam fluxos de dados através de um vetor de estado latente atualizado por recorrências linear
Síntese de Fala (TTS)
Síntese de fala (TTS) é uma tecnologia que converte texto escrito em áudio falado sintetizado, usando modelos de IA treinados em gravações de fala humana para produzir saída de voz soando natural.
Transformer
Um Transformer é uma arquitetura de rede neural centrada em self-attention, que permite que cada posição em uma sequência atenda diretamente a cada outra posição simultaneamente, habilitando treinamento totalmente parale

Treinamento

Aprendizado auto-supervisionado
Aprendizado auto-supervisionado é um paradigma de treinamento no qual um modelo gera seu próprio sinal supervisório a partir de dados não rotulados resolvendo tarefas de pretexto, eliminando a necessidade de anotações ca
Aprendizado Contínuo
Aprendizado contínuo é um paradigma de machine learning no qual um modelo aprende de um fluxo contínuo de tarefas ou dados ao longo do tempo enquanto mantém desempenho no conhecimento previamente adquirido, sem retreinar
Aprendizado Federado
Aprendizado federado é uma técnica de machine learning que treina um modelo compartilhado entre muitos dispositivos ou servidores descentralizados sem centralizar dados brutos, transmitindo apenas atualizações de parâmet
Aprendizado não supervisionado
Aprendizado não supervisionado é um paradigma de aprendizado de máquina no qual modelos encontram padrões, estrutura ou representações compactas em dados sem exemplos rotulados, usando técnicas como clustering, redução d
Aprendizado por Reforço
Aprendizado por reforço é um paradigma de aprendizado de máquina no qual um agente aprende uma política de tomada de decisão ao interagir com um ambiente e receber sinais de recompensa escalar, otimizando para recompensa
Aprendizado por Reforço com Feedback de IA (RLAIF)
Aprendizado por Reforço com Feedback de IA (RLAIF) é uma variante de RLHF na qual um modelo de IA gera os rótulos de preferência usados para treinar o modelo de recompensa, reduzindo a dependência de anotação humana cust
Aprendizado por Reforço com Recompensas Verificáveis (RLVR)
Aprendizado por Reforço com Recompensas Verificáveis (RLVR) é uma abordagem de treinamento na qual sinais de recompensa de RL vêm de critérios objetivos, verificáveis programaticamente—como correção numérica de uma respo
Aprendizado por transferência
Aprendizado por transferência é uma técnica na qual um modelo pré-treinado em um grande conjunto de dados ou tarefa é adaptado para uma tarefa diferente mas relacionada, reduzindo substancialmente a necessidade de dados
Aprendizado Supervisionado
Aprendizado supervisionado é um paradigma de aprendizado de máquina no qual um modelo é treinado em um conjunto de dados rotulado de pares entrada-saída para aprender uma função de mapeamento, então aplicado para prever
Aumento de Dados
Aumento de dados é a prática de artificialmente expandir um conjunto de dados de treinamento aplicando transformações que preservam rótulos a exemplos existentes—como inversão de imagem, corte ou injeção de ruído—para me
Backpropagation
Backpropagation é um algoritmo para computar o gradiente da perda de uma rede neural em relação aos seus pesos propagando sinais de erro retroativamente através das camadas de rede, possibilitando otimização baseada em g
Checkpoint do Modelo
Um checkpoint do modelo é um snapshot salvo dos pesos de uma rede neural e do estado do otimizador em um ponto específico durante o treinamento, permitindo retomada após falhas de hardware e seleção da versão com melhor
Dados de Treinamento
Dados de treinamento é o conjunto de dados rotulado ou não rotulado alimentado a um modelo de machine learning durante o processo de otimização, permitindo que ele ajuste parâmetros internos minimizando erro de predição;
Dados Sintéticos
Dados sintéticos são dados gerados artificialmente—produzidos por algoritmos, simulações ou modelos generativos em vez de coletados de eventos do mundo real—usados para treinar, validar ou testar sistemas de machine lear
Destilação de Conhecimento
A destilação de conhecimento é uma técnica de compressão em que um modelo estudante pequeno é treinado para corresponder à distribuição de saída de um modelo professor maior, produzindo um modelo compacto que retém muito
Esquecimento Catastrófico
Esquecimento catastrófico é a tendência de uma rede neural de abruptamente perder desempenho em tarefas previamente aprendidas quando treinada sequencialmente em novos dados, porque atualizações de peso para a nova taref
Fine-tuning
Fine-tuning é o processo de treinar adicionalmente um modelo de IA pré-treinado em um dataset menor e específico da tarefa para que ele tenha melhor desempenho nessa tarefa. Em vez de construir um modelo do zero, você ad
Função de Perda
Uma função de perda é uma função matemática que mede a discrepância entre as predições de um modelo e os valores alvo verdadeiros, produzindo uma pontuação escalar que algoritmos de otimização minimizam durante o treinam
Gradient Descent
Gradient descent é um algoritmo de otimização iterativo que treina modelos de aprendizado de máquina ajustando repetidamente parâmetros na direção que mais reduz uma função de perda, usando derivadas parciais computadas
Grokking
Grokking é um fenômeno de generalização atrasada no treinamento de rede neural onde um modelo primeiro memoriza dados de treinamento, depois — após treinamento prolongado bem além de overfitting aparente — subitamente ap
Instruction Tuning
Instruction tuning é uma técnica de fine-tuning supervisionado que adapta um modelo de linguagem pré-treinado em pares instrução-resposta, ensinando-o a seguir diretivas em linguagem natural em vez de apenas prever o pró
Leis de Scaling
Leis de scaling são relações de lei de potência empíricas mostrando que desempenho de modelo de linguagem melhora previsivelmente conforme parâmetros de modelo, volume de dados de treinamento e orçamento de compute aumen
LoRA (Low-Rank Adaptation)
LoRA é uma técnica de fine-tuning parameter-efficient que adiciona pares de matriz low-rank treináveis a camadas de modelos pré-treinados congeladas, permitindo adaptação de modelos grandes com uma fração da contagem de
Otimização de Preferência Direta (DPO)
Otimização de Preferência Direta (DPO) é um algoritmo de treinamento que aperfeiçoa modelos de linguagem para alinhar com preferências humanas ao reformular o objetivo de RLHF como uma perda de classificação binária sobr
Pré-treinamento
Pré-treinamento é a fase inicial de treinamento em larga escala na qual uma rede neural aprende representações gerais de um corpus massivo usando objetivos auto-supervisionados, antes de qualquer fine-tuning específico d
QLoRA
QLoRA é um método de fine-tuning que quantiza um modelo base congelado para precisão de 4-bit enquanto treina adaptadores LoRA em precisão maior, permitindo grandes modelos de linguagem serem fine-tuned em um único GPU d
Reinforcement Learning from Human Feedback (RLHF)
Reinforcement Learning from Human Feedback (RLHF) é um pipeline de treinamento que coleta julgamentos de preferência humana entre saídas de modelos, treina um modelo de recompensa nesses julgamentos e usa aprendizado por
Sobreajuste
Sobreajuste ocorre quando um modelo de aprendizado de máquina aprende os dados de treinamento muito proximamente — incluindo seu ruído e idiossincrasias — resultando em alta acurácia em exemplos de treinamento mas pobre
Época
Uma época é uma passagem completa de todo o conjunto de dados de treinamento através de um modelo de machine learning. Modelos são tipicamente treinados por múltiplas épocas, cada passagem refinando os pesos do modelo at

Inferência

Amostragem Top-p (Nucleus)
Amostragem top-p (nucleus) é uma estratégia de decodificação que restringe a seleção de tokens ao menor conjunto de tokens cuja probabilidade cumulativa atinge um limiar p, adaptando dinamicamente o tamanho do conjunto d
Batching
Batching na inferência de modelo é a prática de agrupar múltiplas solicitações de entrada e processá-las juntas em uma única passagem direta através do modelo, melhorando utilização de GPU e vazão. Batching contínuo este
Cache de Prompt
Cache de prompt é uma técnica de API e serving que armazena o estado KV-cache computado para um prefixo de prompt compartilhado — como um prompt do sistema ou um documento grande — e o reutiliza através de múltiplas requ
Cadeia de Pensamento (CoT)
Cadeia de Pensamento (CoT) é uma técnica de prompting na qual um modelo de linguagem gera passos de raciocínio intermediários explícitos antes de produzir uma resposta final, melhorando substancialmente a precisão em pro
Computação em Tempo de Teste
Computação em tempo de teste (TTC) é o orçamento computacional—ciclos de processamento, memória e tempo—que um modelo gasta durante inferência em vez de treinamento, permitindo que gaste mais esforço em problemas mais di
Disponibilização de Modelo
Disponibilização de modelo é a camada de infraestrutura que implanta um modelo ML treinado para manipular solicitações de predição em tempo real ou em lote, gerenciando escalação, balanceamento de carga, versionamento e
IA no Dispositivo
IA no dispositivo é a execução de inferência de modelo de aprendizado de máquina diretamente no hardware local de um usuário—smartphone, laptop ou chip embarcado—sem transmitir dados para um servidor em nuvem remoto, per
Inferência
Inferência é o processo de aplicar um modelo de machine learning treinado a novos dados de entrada para produzir previsões ou saídas. É a operação em tempo de implantação, distinta do treinamento, na qual nenhum parâmetr
Janela de Contexto
Uma janela de contexto é o número máximo de tokens que um modelo de linguagem pode processar em uma única chamada de inferência, cobrindo tanto o prompt de entrada quanto a saída gerada. Excedê-la causa truncamento de en
KV-Cache
KV-Cache (Cache de Chave-Valor) é um buffer de memória que armazena os tensores de chave (key) e valor (value) produzidos pelas camadas de atenção de um transformer para tokens já processados, eliminando recomputação red
Latência
Latência em inferência de IA é o tempo decorrido entre submeter uma solicitação a um modelo e receber sua resposta, tipicamente medido em milissegundos. Em modelos de linguagem grande, ela é subdividida em tempo até prim
Logits
Logits são os scores brutos, não-normalizados com valores reais produzidos pela camada linear final de uma rede neural antes da normalização softmax; em modelos de linguagem, um logit por token de vocabulário representa
Perplexidade
Perplexidade é uma métrica de avaliação de modelos de linguagem definida como a média exponencial da log-verossimilhança negativa por token em um corpus de texto; uma perplexidade menor significa que o modelo atribui pro
Quantização
Quantização é a técnica de representar os pesos de uma rede neural — e opcionalmente suas ativações — em formatos numéricos de menor precisão, como INT8 ou INT4, em vez do padrão FP16 ou BF16, reduzindo o footprint de me
Speculative Decoding
Speculative decoding é uma técnica de inferência que usa um modelo draft pequeno para propor múltiplos tokens em paralelo, então os verifica com o modelo alvo grande em um único passe forward, reduzindo a latência por 2–
Streaming
Streaming em inferência de IA é a entrega de tokens de saída do modelo um a um ao cliente conforme cada token é gerado, em vez de aguardar a resposta completa antes de transmitir qualquer coisa. Reduz a latência percebid
Temperature
Temperature é um hiperparâmetro escalar que divide os logits de um modelo de linguagem antes do passo softmax, controlando a aleatoriedade da saída: valores abaixo de 1,0 aguçam a distribuição em direção a tokens de alta
Token
Um token é a unidade básica de texto que um modelo de linguagem processa, tipicamente uma palavra, fragmento de subpalavra ou marca de pontuação. Em prosa inglesa comum, uma palavra corresponde aproximadamente a 1,3 toke
Tokenização
Tokenização é o processo de dividir texto bruto em unidades discretas chamadas tokens — tipicamente fragmentos de subpalavra — que um modelo de linguagem codifica numericamente e processa. Um token representa aproximadam
Vazão
Vazão em inferência de IA é o volume de trabalho que um sistema de disponibilização de modelo processa por unidade de tempo, comumente expressa como tokens de saída por segundo ou solicitações completas por segundo entre

Agentes

Agent Memory
Agent memory refere-se aos mecanismos que um agente de IA usa para armazenar, recuperar e atualizar informações através de etapas, sessões ou tarefas — abrangendo memória de trabalho em contexto, bancos de dados de vetor
Agente Autônomo
Um agente autônomo é um sistema de IA que percebe seu ambiente, toma decisões, executa ações e itera em direção a um objetivo definido com intervenção humana mínima ou nenhuma entre os passos, operando ao longo de horizo
Agente de Codificação
Um Agente de Codificação é um sistema de IA que autonomamente escreve, edita, testa e faz debug de software em múltiplos arquivos e ambientes de execução, traduzindo descrições de tarefas em alto nível em mudanças de cód
Agente de IA
Um agente de IA é um sistema onde um modelo de linguagem não apenas responde, mas planeja e executa tarefas multi-passo: chama ferramentas e APIs, lê os resultados e decide a próxima ação em direção a um objetivo. Ao con
Agente de Navegador
Um Agente de Navegador é um sistema de IA que controla autonomamente um navegador web — navegando entre páginas, clicando em links, preenchendo formulários e extraindo informações — para completar tarefas baseadas na web
Chamada de Funções
Chamada de Funções é um recurso de API de modelo de linguagem, formalizado pela primeira vez pelo OpenAI em junho de 2023, que permite a um modelo produzir JSON estruturado especificando qual função pré-definida invocar
Human-in-the-Loop (HITL)
Human-in-the-Loop (HITL) é um padrão de design de sistema no qual a supervisão humana é estruturalmente incorporada em um ou mais pontos de decisão em um pipeline de IA automatizado, exigindo que uma pessoa aprove, corri
Orquestração de Agentes
Orquestração de agentes é a coordenação de múltiplos agentes de IA por um sistema supervisório que roteia tarefas, gerencia dependências e fluxo de informações e agrega resultados para realizar um objetivo multi-etapa co
Padrão ReAct
ReAct (Reasoning + Acting) é um framework de prompting para agentes de IA que intercala passos de raciocínio chain-of-thought com ações de uso de ferramenta discreta, permitindo que o modelo observe o resultado de cada a
Planejamento de Agente
Planejamento de agente é o processo pelo qual um agente de IA decompõe um objetivo complexo em uma sequência ordenada de subtarefas ou ações, selecionando e agendando passos para atingir um objetivo que não pode ser comp
Protocolo Agente2Agente (A2A)
Protocolo Agente2Agente (A2A) é uma especificação aberta publicada pelo Google em abril de 2025 que define como agentes de IA autônomos se descobrem mutuamente, trocam tarefas e se coordenam entre diferentes frameworks e
Protocolo de Contexto de Modelo (MCP)
Protocolo de Contexto de Modelo (MCP) é um padrão aberto publicado pela Anthropic em novembro de 2024 que define uma interface universal para conectar assistentes de IA a ferramentas externas, bancos de dados e serviços,
Sandbox
Um sandbox é um ambiente de execução isolado que restringe o acesso de um agente de IA a sistemas reais, redes ou dados, permitindo que ele execute código não confiável ou potencialmente prejudicial sem afetar o ambiente
Sistema Multi-Agente
Um sistema multi-agente (MAS) é uma arquitetura na qual múltiplos agentes de IA autônomos colaboram, cada um com papéis e capacidades distintos, para resolver tarefas muito complexas ou grandes para um único agente lidar
Subagente
Um subagente é um agente de IA invocado por um agente pai ou orquestrador para executar uma subtarefa específica limitada autonomamente e retornar resultados, sem interação direta com o usuário final durante sua execução
Uso de Computador
Uso de Computador é uma capacidade de IA, lançada publicamente pela Anthropic em outubro de 2024, que permite a um modelo de linguagem controlar a interface gráfica de um computador—movendo o cursor, clicando botões, dig
Uso de Ferramentas
Uso de Ferramentas é a capacidade de um modelo de linguagem de IA invocar funções externas, APIs ou serviços—como busca na web, execução de código ou consultas a banco de dados—durante a inferência, permitindo que recupe
Vibe Coding
Vibe coding é uma abordagem de programação assistida por IA onde um desenvolvedor descreve comportamento desejado em linguagem natural e um modelo de IA gera o código correspondente, com o humano focando em intenção em v
Workflow Agêntico
Um workflow agêntico é um pipeline estruturado no qual um ou mais agentes de IA executam tarefas multi-etapas autonomamente—usando ferramentas, memória e lógica de decisão—para completar um objetivo que requer mais de um

Segurança

AI Alignment
AI alignment é o campo de pesquisa e engenharia preocupado em garantir que sistemas de IA persigam objetivos e exibam comportamentos consistentes com intenções, valores e interesses humanos, particularmente conforme os s
AI Safety
AI safety é o campo interdisciplinar voltado para garantir que sistemas de inteligência artificial funcionem de maneira confiável, previsível e sem causar danos não intencionais, abrangendo pesquisa técnica, política e g
Alucinação
Uma alucinação é uma saída confiante e fluida de um modelo de linguagem de IA que é factualmente incorreta, fabricada ou não fundamentada em sua entrada ou conhecimento, produzida sem qualquer indicação de incerteza.
Autoencoder Esparso
Um autoencoder esparso (SAE) é uma rede neural treinada para reconstruir entradas através de uma grande camada oculta supercompleta — a maioria dos neurônios inativos para qualquer entrada — usado em interpretabilidade m
Avaliação de Modelo (Evals)
A avaliação de modelo (evals) é o processo sistemático de medir o desempenho, capacidades e modos de falha de um sistema de IA usando testes estruturados. Evals guiam decisões de desenvolvimento e são cada vez mais exigi
Benchmark
Um benchmark é um conjunto de teste padronizado usado para medir e comparar o desempenho de modelos de IA em tarefas definidas. Pontuações de benchmark fornecem uma escala comum para rastrear progresso entre modelos e co
Context Rot
Context rot é a degradação da precisão de raciocínio e recuperação efetiva de um modelo de linguagem conforme sua janela de contexto se enche de texto, causando que ele diminua ou perca o rastreamento de informações — es
Deepfake
Um deepfake é mídia gerada ou manipulada por IA — vídeo, áudio ou imagens — na qual a aparência de uma pessoa ou voz é fabricada ou substituída para criar representações realistas mas falsas, tipicamente usando modelos g
Exploração de Recompensa
Exploração de recompensa é um modo de falha em aprendizagem por reforço onde um agente descobre estratégias não intencionais que maximizam seu sinal de recompensa numérico sem cumprir a tarefa que os designers realmente
Guardrails
Guardrails são mecanismos de segurança — regras, filtros, classificadores ou restrições de políticas — aplicados a sistemas de IA para evitar que produzam saídas prejudiciais, inapropriadas ou violadoras de políticas.
IA Constitucional
IA Constitucional é um método de treinamento desenvolvido pela Anthropic no qual um modelo de IA critica e revisa suas próprias saídas de acordo com um conjunto de princípios escritos, reduzindo a dependência de anotação
Injeção de Prompt
Injeção de prompt é um ataque em que instruções maliciosas incorporadas na entrada de um modelo de IA anulam as diretrizes originais do sistema, causando que ele produza saídas não pretendidas ou prejudiciais.
Interpretabilidade
Interpretabilidade é um campo de pesquisa em IA voltado para compreender as computações internas de redes neurais — como elas representam conhecimento, formam decisões e produzem saídas — para verificar sua segurança e c
Interpretabilidade Mecanística
Interpretabilidade mecanística é um subcampo da pesquisa em IA que tenta reverter engenharia de computações internas de redes neurais — identificando circuitos específicos, características e algoritmos que produzem compo
Jailbreak
Um jailbreak é uma técnica usada para contornar as diretrizes de segurança incorporadas de um modelo de IA, causando que ele produza conteúdo ou execute ações que seus desenvolvedores explicitamente projetaram para recus
Marca d'água de IA
A marca d'água de IA é uma técnica para incorporar sinais imperceptíveis em conteúdo gerado por IA — texto, imagens, áudio ou vídeo — para permitir posterior identificação de sua origem feita por máquina. Ela apoia a ver
Moderação de Conteúdo
A moderação de conteúdo é o processo de revisar, filtrar e atuar sobre conteúdo gerado por usuários em plataformas digitais para implementar diretrizes comunitárias e requisitos legais, cada vez mais realizado ou assisti
Privacidade de Dados
A privacidade de dados em IA refere-se às práticas, controles técnicos e requisitos legais que governam como informações pessoais são coletadas, armazenadas, usadas e protegidas durante o desenvolvimento e implantação de
Recusa
Uma recusa é a decisão deliberada de um modelo de IA de declinar a solicitação de um usuário, tipicamente porque o treinamento de segurança do sistema determinou que a solicitação poderia levar a saídas prejudiciais, ile
Red Teaming
Red teaming é um processo estruturado de teste adversarial em que uma equipe dedicada tenta encontrar falhas, saídas prejudiciais ou vulnerabilidades de segurança em um sistema de IA antes de sua implantação.
Viés de IA
Viés de IA refere-se a padrões sistemáticos e enviesados nos resultados de um sistema de IA que surgem de dados de treinamento enviesados, definição de problema falha, ou escolhas de design de modelo, causando o sistema

Hardware

Acelerador de IA
Um acelerador de IA é qualquer processador ou bloco de hardware — GPU, TPU, NPU, FPGA ou ASIC personalizado — projetado para acelerar a matemática de matrizes e as operações paralelas de dados que são centrais para o tre
ASIC
Um ASIC (Application-Specific Integrated Circuit) é um chip projetado e fabricado para executar uma função específica, oferecendo maior desempenho e eficiência energética para essa tarefa do que um processador de propósi
Cluster de GPU
Um cluster de GPU é uma coleção de servidores, cada um contendo múltiplas GPUs, interconectadas por rede de alta velocidade para agir como um único recurso de computação paralela para treinamento ou serviço de modelos de
CUDA
CUDA (Compute Unified Device Architecture) é a plataforma proprietária de computação paralela e modelo de programação da NVIDIA que permite aos desenvolvedores escrever código C/C++ executado diretamente em GPUs da NVIDI
Data Center de IA
Um data center de IA é uma instalação construída propositalmente ou fortemente reformada para abrigar clusters de GPU e acelerador, projetada especificamente para lidar com a densidade de potência extrema, demandas de re
FLOPS
FLOPS (Operações de Ponto Flutuante Por Segundo) mede quantas operações aritméticas de ponto flutuante um processador executa a cada segundo. É o benchmark primário para comparar hardware de IA, com GPUs de ponta moderna
GPU (Graphics Processing Unit)
Uma GPU é um processador originalmente projetado para renderização de gráficos de computador, construído em torno de milhares de pequenos núcleos de computação paralela. Desde o início dos anos 2010, as GPUs se tornaram
Interconexão (NVLink, InfiniBand)
Uma interconexão é o link de comunicação de alta velocidade que transfere dados entre GPUs dentro de um servidor (intra-nó, por exemplo, NVLink) ou entre servidores em um cluster (inter-nó, por exemplo, InfiniBand); sua
Memória de Alta Largura de Banda (HBM)
Memória de Alta Largura de Banda (HBM) é uma tecnologia DRAM empilhada que une múltiplos cristais de memória verticalmente e os conecta a uma GPU através de um barramento interno muito amplo, alcançando larguras de banda
NPU (Neural Processing Unit)
Uma NPU é um bloco de hardware dedicado integrado em um system-on-chip (SoC) que acelera a inferência de redes neurais localmente em um dispositivo, habilitando recursos de IA — como reconhecimento de voz ou aprimorament
TPU (Tensor Processing Unit)
Uma TPU é um ASIC personalizado projetado pelo Google especificamente para acelerar operações de tensor — as multiplicações de matriz no núcleo do treinamento e inferência de redes neurais — oferecendo melhor throughput
VRAM
VRAM (Video Random Access Memory) é a memória dedicada de alta velocidade em uma GPU usada para armazenar pesos do modelo, ativações e cache KV durante o treinamento e inferência de IA. Sua capacidade é a principal restr

Negócios

Agulha no Palheiro
Agulha no Palheiro é um teste de avaliação de contexto longo que mede se um modelo de linguagem consegue recuperar com precisão um fato específico plantado (a "agulha") de um grande corpus de texto irrelevante (o "palhei
API de IA
Uma API de IA é uma interface web padronizada que permite que desenvolvedores enviem dados para um modelo de IA hospedado e recebam texto gerado, previsões ou outras saídas, sem precisar implantar sua própria infraestrut
ARC-AGI
ARC-AGI (Abstraction and Reasoning Corpus for AGI) é um benchmark de quebra-cabeças de analogia visual que exigem que os sistemas infiram regras de transformação a partir de alguns exemplos de grade entrada-saída e as ap
Chatbot
Um chatbot é um programa de software que conduz conversas por texto ou voz com usuários, seja seguindo árvores de decisão pré-definidas ou, em implementações modernas, gerando respostas de forma livre usando um modelo de
Compute
Compute, em contextos de IA, refere-se aos recursos computacionais — principalmente poder de processamento de GPU ou TPU, memória e infraestrutura de suporte — necessários para treinar e executar modelos de IA. É o recur
Copilot
Um copilot é um assistente de IA incorporado em uma aplicação de software que fornece sugestões em tempo real, automatiza subtarefas e responde a perguntas em linguagem natural, mantendo o usuário humano como o tomador d
Economia de Tokens (Preços de API)
Economia de tokens é o modelo de preços que governa o acesso comercial a modelos de linguagem de IA via API, onde os usuários são cobrados por token — aproximadamente 3 a 4 caracteres de texto — com taxas separadas para
GPQA
GPQA (Graduate-Level Google-Proof Q&A) é um benchmark de 448 questões de múltipla escolha escritas por especialistas em biologia, química e física, projetado para que não-especialistas não possam respondê-las corretament
HumanEval
HumanEval é um benchmark de geração de código de 164 problemas de programação Python escritos à mão criado pela OpenAI em 2021, usado para medir a capacidade de um modelo de linguagem produzir código funcionalmente corre
Hyperscaler
Um hyperscaler é um de um pequeno grupo de provedores de nuvem — principalmente Amazon Web Services, Microsoft Azure e Google Cloud — operando infraestrutura de data center em escala planetária com portfólios abrangentes
IA de Código Aberto
IA de código aberto refere-se a modelos de IA, frameworks ou sistemas cujos pesos, código ou arquitetura são publicamente liberados — permitindo que qualquer pessoa os baixe, inspecione, modifique e implante — em contras
IA Empresarial
IA Empresarial refere-se à implantação de sistemas de inteligência artificial dentro de grandes organizações para automatizar processos, aumentar a tomada de decisões e gerar valor comercial em escala, integrado com soft
IA Soberana
IA Soberana refere-se aos esforços nacionais ou regionais para desenvolver, possuir e controlar infraestrutura de IA, modelos e pipelines de dados domesticamente — em vez de depender de provedores comerciais estrangeiros
Inteligência Artificial Geral (AGI)
Inteligência Artificial Geral (AGI) é um sistema de IA hipotético capaz de realizar qualquer tarefa intelectual que um humano possa, igualando ou excedendo flexibilidade cognitiva humana em todos os domínios sem retreina
Lab de IA
Um lab de IA é uma organização — dentro de uma empresa, universidade ou organização sem fins lucrativos — dedicada a pesquisar e construir sistemas de inteligência artificial, desde modelos fundacionais e técnicas de seg
Lei de IA da UE
A Lei de IA da UE (Regulamento (UE) 2024/1689) é a primeira regulação horizontal abrangente de IA do mundo, adotada pela União Europeia em 2024, que classifica sistemas de IA por nível de risco e impõe requisitos que var
LM Arena
LM Arena é uma plataforma de avaliação de IA participativa (crowdsourced) onde usuários comparam duas respostas de modelo anônimas lado a lado e votam na melhor, gerando um placar eletrônico baseado em Elo da qualidade d
MMLU
MMLU (Massive Multitask Language Understanding) é um benchmark avaliando modelos de linguagem em aproximadamente 14.000 questões de múltipla escolha através de 57 disciplinas acadêmicas — de cálculo e medicina a lei e ét
Moat de IA
Um moat de IA é uma vantagem competitiva durável em inteligência artificial que é difícil para rivais replicar, como dados de treinamento proprietários, escala de distribuição, talentos especializados, aprovação regulató
Nuvem de GPU (Neocloud)
Uma nuvem de GPU, frequentemente chamada de neocloud, é um provedor de nuvem que se especializa em alugar clusters de GPU de alta densidade para treinamento e inferência de IA, em vez de oferecer o amplo portfólio de ser
Regulação de IA
Regulação de IA refere-se a leis, regras e normas estabelecidas por governos e órgãos reguladores para governar o desenvolvimento, implantação e uso de sistemas de inteligência artificial, abordando riscos como discrimin
Superinteligência Artificial (ASI)
Superinteligência Artificial (ASI) é um sistema de IA hipotético cujas capacidades cognitivas em cada domínio substancialmente excedem as dos humanos mais capazes. Permanece um conceito teórico em 2026, bem além da front
SWE-bench
SWE-bench é um benchmark que avalia sistemas de IA para codificação em tarefas reais de engenharia de software, exigindo que resolvam problemas genuínos (issues) do GitHub em repositórios Python de código aberto, com suc
Wrapper de IA
Um wrapper de IA é um produto ou serviço construído chamando uma API de modelo de IA de terceiros — como GPT da OpenAI ou Claude da Anthropic — e adicionando uma interface de usuário, templates de prompt ou lógica de wor

Técnicas e métodos

Agentic RAG
Agentic RAG é uma arquitetura na qual um modelo de linguagem atua como um agente autônomo que iterativamente decide quando e o que recuperar de fontes externas, permitindo raciocínio de múltiplas etapas sobre queries com
Busca Semântica
Busca semântica é um método de recuperação que corresponde consultas a documentos baseado no significado conceitual em vez de sobreposição de palavras-chave, usando vetores de embedding e métricas de similaridade para ex
Chunking
Chunking é o processo de dividir documentos de origem em segmentos de texto menores antes de embutir e armazenar em um vector database, possibilitando recuperação eficiente e precisa em sistemas RAG e de busca.
Context Engineering
Context engineering é a prática de deliberadamente projetar e montar todas as informações fornecidas à janela de contexto de um modelo de linguagem — incluindo instruções, documentos recuperados, saídas de ferramentas, r
Embedding
Um embedding é um vetor numérico denso de comprimento fixo que representa dados — como texto, uma imagem ou áudio — em um espaço de alta dimensionalidade onde itens semanticamente similares estão localizados geometricame
Few-Shot Learning
Few-shot learning é um paradigma de aprendizado de máquina no qual um modelo se adapta a uma nova tarefa usando apenas um pequeno número de exemplos rotulados—tipicamente entre um e vinte—em vez dos grandes conjuntos de
Grounding
Grounding é a prática de conectar a saída de um LLM a fontes de informação externas e verificáveis—como documentos recuperados, resultados de web ao vivo ou bancos de dados estruturados—para reduzir alucinação e melhorar
In-Context Learning
In-context learning é a capacidade de um modelo de linguagem de grande escala executar novas tarefas lendo exemplos ou instruções colocadas diretamente no prompt de entrada, adaptando seu comportamento no tempo de inferê
Knowledge Graph
Um knowledge graph é um banco de dados estruturado em grafo representando entidades do mundo real como nós e suas relações semânticas como arestas rotuladas, permitindo que máquinas atravessem redes factuais e suportem c
Mecanismo de Atenção
O mecanismo de atenção é um componente de rede neural que permite que um modelo pese dinamicamente a relevância de diferentes posições de entrada ao calcular cada saída, habilitando processamento sensível ao contexto sob
OCR (Reconhecimento Óptico de Caracteres)
OCR (Reconhecimento Óptico de Caracteres) é uma tecnologia que converte imagens contendo texto impresso ou manuscrito em texto codificado por máquina, editável. Permite que computadores leiam e processem documentos que e
Prompt Engineering
Prompt engineering é a prática de projetar e refinar entradas de texto para orientar grandes modelos de linguagem em direção a saídas precisas, consistentes ou especificamente formatadas, usando técnicas como especificaç
RAG (Retrieval-Augmented Generation)
RAG (retrieval-augmented generation) é uma técnica que permite a um modelo de linguagem extrair documentos relevantes de uma base de conhecimento externa antes de responder e fundamentar sua resposta neles. Reduz alucina
Reranking
Reranking é uma técnica de recuperação em dois estágios que primeiro recupera um conjunto amplo de candidatos usando um método rápido de bi-codificador ou palavras-chave, então re-pontua esses candidatos com um modelo de
Roteamento de Modelo
Roteamento de modelo é a prática de dirigir automaticamente cada solicitação de inferência de IA para o modelo mais apropriado de uma frota — equilibrando custo, latência e qualidade — em vez de enviar todas as consultas
Saída Estruturada
Saída estruturada é uma técnica para restringir a geração de um modelo de linguagem de forma que esteja em conformidade com um esquema predefinido — como JSON ou XML — para que sistemas subsequentes possam analisar e con
System Prompt
Um system prompt é um conjunto de instruções fornecidas a um modelo de linguagem antes de qualquer entrada do usuário, definindo sua persona, restrições, formato de saída e regras de comportamento que persistem em toda a
Vector Database
Um vector database é um armazenamento de dados construído especificamente para armazenar vetores numéricos de alta dimensionalidade e executar busca rápida de vizinhos mais próximos aproximados (ANN) em milhões ou bilhõe
Zero-Shot Learning
Zero-shot learning é a capacidade de um modelo de aprendizado de máquina lidar corretamente com tarefas ou classificar entradas de categorias que nunca foi mostrado durante o treinamento, aproveitando relações semânticas