Glosario de IA
Definiciones breves y precisas de los términos de la inteligencia artificial, sin niebla académica. Cada entrada empieza con una respuesta de dos frases, seguida de una explicación más profunda, un ejemplo concreto y conceptos relacionados. El glosario crece a medida que nuevos términos llegan a las noticias.
Modelos
Arquitectura Solo-Decodificador
Una arquitectura Solo-Decodificador es una variante de transformer que utiliza un stack único de self-attention con enmascaramiento causal (de izquierda a derecha) para predecir cada token siguiente desde su contexto pre
Deep Learning
El deep learning es un subcampo del aprendizaje automático que entrena redes neuronales con muchas capas para aprender representaciones jerárquicas directamente a partir de datos sin procesar como píxeles, formas de onda
IA Generativa
IA Generativa se refiere a sistemas de aprendizaje automático que producen nuevo contenido — texto, imágenes, audio, video o código — aprendiendo patrones estadísticos a partir de grandes conjuntos de datos de entrenamie
Machine Learning
Machine learning es una rama de la inteligencia artificial en la que los algoritmos mejoran automáticamente su desempeño en una tarea aprendiendo patrones a partir de datos, sin ser programados explícitamente con reglas
Mezcla de Expertos (MoE)
Mezcla de Expertos (MoE) es una arquitectura de red neuronal donde un mecanismo de enrutamiento aprendido activa solo un pequeño subconjunto de subredes especializadas (expertos) para cada token de entrada, permitiendo r
Modelo Codificador-Decodificador (Encoder-Decoder)
Una arquitectura Codificador-Decodificador es un diseño de red neuronal en el que un codificador mapea una entrada en una representación latente y un decodificador separado genera la secuencia de salida de esa representa
Modelo de Difusión
Un modelo de difusión es un sistema de IA generativo que produce imágenes, audio o vídeo aprendiendo a invertir un proceso iterativo de adición de ruido, comenzando desde ruido aleatorio y desruidando progresivamente a t
Modelo de Embedding
Un modelo de embedding convierte texto, imágenes u otros datos en vectores numéricos de longitud fija en un espacio de alta dimensionalidad, donde elementos semánticamente similares están geométricamente cercanos entre s
Modelo de Espacio de Estados (SSM)
Un Modelo de Espacio de Estados (SSM) es una clase de arquitecturas de procesamiento de secuencias derivadas de la teoría de control que representan flujos de datos a través de un vector de estado latente actualizado med
Modelo de Lenguaje de Visión (VLM)
Un Modelo de Lenguaje de Visión (VLM) es un modelo de IA que procesa conjuntamente entradas visuales (imágenes o video) y texto en lenguaje natural, permitiendo tareas como generación de descripciones de imágenes, respue
Modelo de lenguaje grande (LLM)
Un modelo de lenguaje grande (LLM) es una red neuronal basada en Transformer con miles de millones de parámetros entrenada en texto a escala de internet para modelar y generar lenguaje humano, capaz de realizar tareas di
Modelo de Lenguaje Pequeño (SLM)
Un modelo de lenguaje pequeño (SLM) es un modelo de lenguaje con un recuento de parámetros compacto—típicamente de 1 a 13 mil millones de parámetros—optimizado para inferencia eficiente en dispositivos de consumo, hardwa
Modelo de Razonamiento
Un modelo de razonamiento es un sistema de IA diseñado para resolver problemas complejos de múltiples pasos generando pasos de razonamiento intermedios explícitos — a menudo llamado cadena de pensamiento — antes de produ
Modelo del Mundo
Un modelo del mundo es una representación interna que un sistema de IA aprende sobre la dinámica de su entorno, permitiéndole predecir las consecuencias de las acciones y simular estados futuros sin interactuar directame
Modelo Frontera
Un modelo frontera es un sistema de IA que opera en los límites actuales de la capacidad del aprendizaje automático, típicamente entrenado con los presupuestos de cómputo más grandes conocidos. El término se utiliza en p
Modelo Fundacional
Un modelo fundacional es un sistema de IA de gran escala preentrenado en datos amplios y diversos—texto, imágenes, código—para servir como base general adaptable a muchas tareas descendentes. El término fue introducido p
Modelo Multimodal
Un modelo multimodal es un sistema de IA que procesa y genera datos en más de una modalidad — como texto, imágenes, audio o video — dentro de una arquitectura unificada única.
Modelo Texto-a-Imagen
Un modelo texto-a-imagen es un sistema de IA generativa que produce imágenes raster a partir de prompts de texto en lenguaje natural, sintetizando contenido visual que coincide con la escena, estilo o asunto descrito.
Modelo Texto-a-Video
Un modelo texto-a-video es un sistema de IA generativa que sintetiza clips de video a partir de prompts de texto en lenguaje natural, produciendo secuencias de fotogramas coherentes temporalmente que coinciden con el mov
Open-Weights Model
Un modelo de pesos abiertos es un sistema de IA cuyos pesos de parámetros entrenados se publican públicamente, permitiendo a cualquiera descargar, ejecutar y modificar el modelo sin acceder a la infraestructura del desar
Reconocimiento de Voz (ASR)
Reconocimiento de voz (ASR) es una tecnología que convierte audio hablado en texto escrito, utilizando modelos de aprendizaje automático entrenados en grandes corpus de voz para transcribir con precisión palabras y oraci
Red neuronal
Una red neuronal es un modelo computacional compuesto de capas interconectadas de unidades numéricas (neuronas) que aprenden a mapear entradas a salidas ajustando pesos de conexión mediante exposición a datos de entrenam
Red Neuronal Convolucional (CNN)
Una Red Neuronal Convolucional (CNN) es una arquitectura de deep learning que aplica filtros aprendidos con compartición de pesos sobre parches locales de datos de entrada —más comúnmente imágenes— para detectar caracter
Red Neuronal Generativa Adversarial (GAN)
Una Red Neuronal Generativa Adversarial (GAN) es una arquitectura de red dual donde un generador produce datos sintéticos y un discriminador intenta clasificarlos como reales o falsos; el entrenamiento adversarial entre
Red Neuronal Recurrente (RNN)
Una Red Neuronal Recurrente (RNN) es una red neuronal que procesa datos secuenciales manteniendo un vector de estado oculto actualizado en cada paso de tiempo, permitiendo que la información de entradas anteriores influy
Texto-a-Voz (TTS)
Texto-a-voz (TTS) es una tecnología que convierte texto escrito en audio de voz sintetizada, utilizando modelos de IA entrenados en grabaciones de voz humana para producir salida de voz de sonido natural.
Transformer
Un Transformer es una arquitectura de red neuronal centrada en auto-atención, que permite a cada posición en una secuencia atender directamente a todas las demás posiciones simultáneamente, permitiendo entrenamiento comp
Entrenamiento
Aprendizaje Autosupervisado
El aprendizaje autosupervisado es un paradigma de entrenamiento en el que un modelo genera su propia señal de supervisión a partir de datos sin etiquetar resolviendo tareas pretexto, eliminando la necesidad de anotacione
Aprendizaje Continuo
El aprendizaje continuo es un paradigma de aprendizaje automático en el que un modelo aprende de un flujo continuo de tareas o datos en el tiempo mientras mantiene el rendimiento en el conocimiento previamente adquirido,
Aprendizaje Federado
El aprendizaje federado es una técnica de aprendizaje automático que entrena un modelo compartido en muchos dispositivos o servidores descentralizados sin centralizar datos brutos, transmitiendo solo actualizaciones de p
Aprendizaje No Supervisado
El aprendizaje no supervisado es un paradigma de aprendizaje automático en el que los modelos encuentran patrones, estructura o representaciones compactas en datos sin ejemplos etiquetados, utilizando técnicas como clust
Aprendizaje por Refuerzo
Aprendizaje por refuerzo es un paradigma de aprendizaje automático en el que un agente aprende una política de toma de decisiones interactuando con un entorno y recibiendo señales de recompensa escalar, optimizando para
Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF)
Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF) es un pipeline de entrenamiento que recopila juicios de preferencia humana entre salidas del modelo, entrena un modelo de recompensa en esos juicios, y
Aprendizaje por Refuerzo con Recompensas Verificables (RLVR)
Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) es un enfoque de entrenamiento en el que las señales de recompensa de RL provienen de criterios objetivos y verificables programáticamente—como la corrección n
Aprendizaje por Refuerzo desde Retroalimentación de IA (RLAIF)
Aprendizaje por Refuerzo desde Retroalimentación de IA (RLAIF) es una variante de RLHF en la que un modelo de IA genera las etiquetas de preferencia utilizadas para entrenar el modelo de recompensa, reduciendo la depende
Aprendizaje por Transferencia
El aprendizaje por transferencia es una técnica en la que un modelo pre-entrenado en un dataset grande o una tarea se adapta a una tarea diferente pero relacionada, reduciendo sustancialmente la necesidad de datos etique
Aprendizaje Supervisado
Aprendizaje supervisado es un paradigma de aprendizaje automático en el que un modelo se entrena en un conjunto de datos etiquetado de pares entrada-salida para aprender una función de mapeo, luego se aplica para predeci
Aumento de Datos
El aumento de datos es la práctica de expandir artificialmente un conjunto de datos de entrenamiento aplicando transformaciones que preservan las etiquetas a ejemplos existentes—como volteo de imagen, recorte o inyección
Datos de Entrenamiento
Los datos de entrenamiento son el conjunto de datos etiquetados o sin etiquetar introducidos en un modelo de aprendizaje automático durante el proceso de optimización, permitiéndole ajustar parámetros internos minimizand
Datos Sintéticos
Los datos sintéticos son datos generados artificialmente—producidos por algoritmos, simulaciones o modelos generativos en lugar de recopilar de eventos del mundo real—utilizados para entrenar, validar o probar sistemas d
Descenso de Gradiente
El descenso de gradiente es un algoritmo de optimización iterativo que entrena modelos de aprendizaje automático ajustando repetidamente los parámetros en la dirección que más reduce una función de pérdida, utilizando de
Destilación de Conocimiento
La destilación de conocimiento es una técnica de compresión en la que un pequeño modelo estudiante se entrena para coincidir con la distribución de salida de un modelo maestro más grande, produciendo un modelo compacto q
Fine-tuning
Fine-tuning es el proceso de entrenar adicionalmente un modelo de IA pre-entrenado en un conjunto de datos más pequeño específico de la tarea para que tenga un mejor rendimiento en esa tarea. En lugar de construir un mod
Función de Pérdida
Una función de pérdida es una función matemática que mide la discrepancia entre las predicciones de un modelo y los valores objetivo verdaderos, produciendo una puntuación escalar que los algoritmos de optimización minim
Instruction Tuning
Instruction tuning es una técnica de fine-tuning supervisado que adapta un modelo de lenguaje pre-entrenado en pares de instrucción-respuesta, enseñándole a seguir directivas en lenguaje natural en lugar de simplemente p
Leyes de Escalado
Las leyes de escalado son relaciones de ley de potencia empíricas que muestran que el rendimiento del modelo de lenguaje mejora de manera predecible conforme aumentan los parámetros del modelo, el volumen de datos de ent
LoRA (adaptación de bajo rango)
LoRA es una técnica de fine-tuning eficiente en parámetros que añade pares de matrices de bajo rango entrenables a capas de modelos pre-entrenados congeladas, permitiendo la adaptación de modelos grandes con una fracción
Olvido Catastrófico
El olvido catastrófico es la tendencia de una red neuronal a perder abruptamente el desempeño en tareas aprendidas previamente cuando se entrena secuencialmente en nuevos datos, porque las actualizaciones de pesos para l
Optimización Directa de Preferencias (DPO)
Optimización Directa de Preferencias (DPO) es un algoritmo de entrenamiento que realiza fine-tuning de modelos de lenguaje para alinearlos con las preferencias humanas reformulando el objetivo RLHF como una pérdida de cl
Pre-training
Pre-training es la fase inicial de entrenamiento a gran escala en la que una red neuronal aprende representaciones generales de un corpus masivo usando objetivos de aprendizaje autosupervisado, antes de cualquier ajuste
Punto de Control del Modelo
Un punto de control del modelo es una captura guardada de los pesos de una red neuronal y el estado del optimizador en un punto específico durante el entrenamiento, permitiendo la reanudación después de fallas de hardwar
QLoRA
QLoRA es un método de fine-tuning que cuantiza un modelo base congelado a precisión de 4 bits mientras entrena adaptadores LoRA a precisión más alta, permitiendo que los grandes modelos de lenguaje se sometan a fine-tuni
Retropropagación
La retropropagación es un algoritmo para calcular el gradiente de la pérdida de una red neuronal con respecto a sus pesos propagando señales de error hacia atrás a través de las capas de la red, lo que permite la optimiz
Sobreajuste
El sobreajuste ocurre cuando un modelo de aprendizaje automático aprende los datos de entrenamiento demasiado estrechamente — incluyendo su ruido e idiosincrasias — resultando en alta precisión en ejemplos de entrenamien
Época
Una época es un paso completo de todo el conjunto de datos de entrenamiento a través de un modelo de aprendizaje automático. Los modelos se entrenan típicamente durante múltiples épocas, cada paso refinando los pesos del
Inferencia
Batching
Batching en inferencia de modelos es la práctica de agrupar múltiples solicitudes de entrada y procesarlas juntas en una sola pasada hacia adelante a través del modelo, mejorando la utilización de GPU y el rendimiento. E
Chain-of-Thought (CoT)
Chain-of-Thought (CoT) es una técnica de prompting en la cual un modelo de lenguaje grande genera pasos de razonamiento intermedios explícitos antes de producir una respuesta final, mejorando sustancialmente la precisión
Cuantización
La cuantización es la técnica de representar los pesos de una red neuronal — y opcionalmente sus activaciones — en formatos numéricos de menor precisión como INT8 o INT4 en lugar de los formatos predeterminados FP16 o BF
Decodificación Especulativa
La decodificación especulativa es una técnica de inferencia que utiliza un modelo borrador pequeño para proponer múltiples tokens en paralelo, luego los verifica con el modelo objetivo grande en un único pase hacia adela
Esfuerzo de Razonamiento
El esfuerzo de razonamiento es un parámetro de tiempo de inferencia que controla cuántos pasos de cálculo interno o tokens un modelo asigna al razonamiento antes de producir una respuesta, permitiendo a los usuarios inte
Inferencia
Inferencia es el proceso de aplicar un modelo de aprendizaje automático entrenado a nuevos datos de entrada para producir predicciones o resultados. Es la operación en el momento de despliegue, distinta del entrenamiento
KV-Cache
KV-Cache (Caché de Clave-Valor) es un búfer de memoria que almacena los tensores de clave y valor producidos por las capas de atención de un transformador para tokens ya procesados, eliminando la recomputación redundante
Latencia
Latencia en inferencia de IA es el tiempo transcurrido entre enviar una solicitud a un modelo y recibir su respuesta, típicamente medido en milisegundos. En modelos de lenguaje grande se subdivide en tiempo-hasta-primer-
Logits
Los logits son las puntuaciones crudas, no normalizadas, de valores reales que genera la capa lineal final de una red neuronal antes de la normalización softmax; en modelos de lenguaje, un logit por token de vocabulario
Muestreo Top-p (Nucleus)
El muestreo top-p (muestreo de núcleo) es una estrategia de decodificación que restringe la selección de tokens al conjunto más pequeño de tokens cuya probabilidad acumulada cumple un umbral p, adaptando dinámicamente el
On-Device AI
On-Device AI es la ejecución de cargas de trabajo de inferencia de aprendizaje automático directamente en el hardware local del usuario — smartphone, laptop o chip integrado — sin transmitir datos a un servidor en la nub
Perplexity
Perplexity es una métrica de evaluación de modelos de lenguaje definida como la exponencial del promedio negativo de log-likelihood por token en un corpus de texto; menor perplexity significa que el modelo asigna mayor p
Prompt Caching
Prompt caching es una técnica de API y entrega que almacena el estado de KV-cache calculado para un prefijo de prompt compartido —como un prompt del sistema o un documento grande— y lo reutiliza en múltiples solicitudes
Rendimiento
Rendimiento en inferencia de IA es el volumen de trabajo que un sistema de servicio de modelo procesa por unidad de tiempo, comúnmente expresado como tokens de salida por segundo o solicitudes completadas por segundo en
Servicio de Modelos
Servicio de Modelos es la capa de infraestructura que despliega un modelo de ML entrenado para manejar solicitudes de predicción en tiempo real o por lotes, administrando escalado, equilibrio de carga, versionamiento y c
Streaming
Streaming en la inferencia de IA es la entrega de tokens de salida del modelo uno a uno al cliente conforme cada token es generado, en lugar de esperar a la respuesta completa antes de transmitir algo. Reduce la latencia
Temperatura
Temperatura es un hiperparámetro escalar que divide los logits de un modelo de lenguaje antes del paso softmax, controlando la aleatoriedad de salida: valores por debajo de 1.0 concentran la distribución hacia tokens de
Test-Time Compute
Test-time compute (TTC) es el presupuesto computacional — ciclos de procesamiento, memoria y tiempo — que un modelo gasta durante la inferencia en lugar de durante el entrenamiento, permitiéndole dedicar más esfuerzo a p
Token
Un token es la unidad básica de texto que un modelo de lenguaje procesa, típicamente una palabra, fragmento de subpalabra o marca de puntuación. En la prosa inglesa común, una palabra corresponde aproximadamente a 1,3 to
Tokenización
La tokenización es el proceso de dividir el texto sin procesar en unidades discretas llamadas tokens —típicamente fragmentos de subpalabras— que un modelo de lenguaje codifica numéricamente y procesa. Un token promedia a
Ventana de Contexto
Una ventana de contexto es el número máximo de tokens que un modelo de lenguaje puede procesar en una única llamada de inferencia, cubriendo tanto el prompt de entrada como la salida generada. Excederla causa truncamient
Agentes
Agent Planning
La planificación de agentes es el proceso mediante el cual un agente de IA descompone un objetivo complejo en una secuencia ordenada de subtareas o acciones, seleccionando y programando pasos para lograr un objetivo que
Agent2Agent Protocol (A2A)
Agent2Agent Protocol (A2A) es una especificación abierta publicada por Google en abril de 2025 que define cómo los agentes de IA autónomos se descubren mutuamente, intercambian tareas y se coordinan en diferentes framewo
Agente autónomo
Un agente autónomo es un sistema de IA que percibe su entorno, toma decisiones, ejecuta acciones, e itera hacia un objetivo definido con intervención humana mínima o nula entre pasos, operando a lo largo de horizontes de
Agente de IA
Un agente de IA es un sistema donde un modelo de lenguaje no solo responde, sino planifica y ejecuta tareas multi-paso: llama herramientas y APIs, lee los resultados y decide la siguiente acción hacia un objetivo. A dife
Arnés de Agente
Un arnés de agente es un marco de software que envuelve un modelo de lenguaje con la infraestructura requerida para operación autónoma—invocación de herramientas, gestión de contexto, manejo de errores y bucles de ejecuc
Browser Agent
Un Browser Agent es un sistema de IA que controla autónomamente un navegador web—navegando páginas, haciendo clic en enlaces, rellenando formularios y extrayendo información—para completar tareas basadas en web en nombre
Coding Agent
Un Coding Agent es un sistema de IA que escribe, edita, prueba y depura autónomamente software en múltiples archivos y entornos de ejecución, traduciendo descripciones de tareas de alto nivel en cambios de código verific
Computer Use
Computer Use es una capacidad de IA, lanzada públicamente por primera vez por Anthropic en octubre de 2024, que permite a un modelo de lenguaje controlar la interfaz gráfica de una computadora—moviendo el cursor, haciend
Flujo de trabajo agentico
Un flujo de trabajo agentico es una tubería estructurada en la que uno o más agentes de IA ejecutan tareas de varios pasos de forma autónoma—utilizando herramientas, memoria y lógica de decisión—para completar un objetiv
Function Calling
Function calling es una característica de API de modelos de lenguaje, formalizada por primera vez por OpenAI en junio de 2023, que permite a un modelo generar JSON estructurado especificando cuál función predefinida invo
Human-in-the-Loop (HITL)
Human-in-the-Loop (HITL) es un patrón de diseño de sistema en el que la supervisión humana se integra estructuralmente en uno o más puntos de decisión en una pipeline de IA automatizada, requiriendo que una persona aprue
Investigación Profunda
La Investigación Profunda es una capacidad de IA de tipo agente en la que un modelo planifica y ejecuta autónomamente un proceso de investigación multi-paso—emitiendo consultas de búsqueda, leyendo páginas web y sintetiz
Memoria del Agente
La memoria del agente se refiere a los mecanismos que utiliza un agente de IA para almacenar, recuperar y actualizar información a lo largo de pasos, sesiones o tareas — abarcando memoria de trabajo en contexto, bases de
Model Context Protocol (MCP)
Model Context Protocol (MCP) es un estándar abierto publicado por Anthropic en noviembre de 2024 que define una interfaz universal para conectar asistentes de IA a herramientas, bases de datos y servicios externos, reemp
Orquestación de agentes
La orquestación de agentes es la coordinación de múltiples agentes de IA por un sistema supervisorio que enruta tareas, gestiona dependencias y flujo de información, y agrega resultados para lograr un objetivo complejo d
Patrón ReAct
ReAct (Reasoning + Acting) es un marco de avisos para agentes de IA que intercala pasos de razonamiento de cadena de pensamiento con acciones discretas de uso de herramientas, permitiendo que el modelo observe el resulta
Sandbox
Un sandbox es un entorno de ejecución aislado que restringe el acceso de un agente de IA a sistemas reales, redes o datos, permitiéndole ejecutar código no confiable o potencialmente dañino sin afectar el entorno anfitri
Sistema multiagente
Un sistema multiagente (MAS) es una arquitectura en la que múltiples agentes de IA autónomos colaboran, cada uno con roles y capacidades distintos, para resolver tareas demasiado complejas o grandes para que un único age
Subagente
Un subagente es un agente de IA especializado o de propósito general invocado por un agente padre u orquestador para ejecutar autónomamente una subtarea específica y acotada, y devolver resultados, sin interacción direct
Tool Use
Tool use es la capacidad de un modelo de lenguaje de IA de invocar funciones externas, APIs o servicios—como búsqueda web, ejecución de código o consultas a bases de datos—durante la inferencia, permitiéndole recuperar i
Vibe Coding
Vibe coding es un enfoque de programación asistida por IA donde un desarrollador describe el comportamiento deseado en lenguaje natural y un modelo de IA genera el código correspondiente, con el humano enfocándose en la
Seguridad
AI Slop
AI Slop es contenido de baja calidad, producido en masa generado por sistemas de IA—caracterizado por frases genéricas, errores factuales y falta de perspectiva original—que inunda sitios web, redes sociales y resultados
Alineación de IA
La alineación de IA es el campo de investigación e ingeniería dedicado a garantizar que los sistemas de IA persigan objetivos y exhiban comportamientos consistentes con las intenciones, valores e intereses humanos, parti
Alucinación
Una alucinación es una salida confiada y fluida de un modelo de lenguaje de IA que es factualmente incorrecta, fabricada o no fundamentada en su entrada o conocimiento, producida sin indicación alguna de incertidumbre.
Benchmark
Un benchmark es un conjunto de pruebas estandarizado utilizado para medir y comparar el desempeño de modelos de IA en tareas definidas. Las puntuaciones de benchmark proporcionan una escala común para hacer un seguimient
Colapso del Modelo
El colapso del modelo es la degradación progresiva de la calidad y diversidad de la salida de un modelo de IA cuando se entrena en datos generados por IA, causando que generaciones sucesivas de modelos pierdan cobertura
Deepfake
Un deepfake es contenido multimedia generado o manipulado por IA—vídeo, audio o imágenes—en el que la similitud o voz de una persona es fabricada o reemplazada para crear depictaciones realistas pero falsas, típicamente
Evaluación de modelos (Evals)
La evaluación de modelos (evals) es el proceso sistemático de medir el desempeño, capacidades y modos de falla de un modelo de IA utilizando pruebas estructuradas. Las evals guían decisiones de desarrollo y cada vez son
Explotación de Recompensas
Explotación de recompensas es un modo de fallo en el aprendizaje por refuerzo donde un agente descubre estrategias no intencionadas que maximizan su señal de recompensa numérica sin lograr la tarea que los diseñadores re
Guardrails
Los guardrails son mecanismos de seguridad—reglas, filtros, clasificadores o restricciones políticas—aplicados a sistemas de IA para evitar que produzcan salidas dañinas, inapropiadas o que violen políticas.
IA Constitucional
IA Constitucional es un método de entrenamiento desarrollado por Anthropic en el cual un modelo de IA critica y revisa sus propias salidas de acuerdo con un conjunto escrito de principios, reduciendo la dependencia de an
Interpretabilidad
Interpretabilidad es un campo de investigación en IA dirigido a entender los cálculos internos de las redes neuronales — cómo representan conocimiento, forman decisiones y producen salidas — para verificar su seguridad y
Jailbreak
Un jailbreak es una técnica utilizada para eludir las directrices de seguridad integradas de un modelo de IA, causando que produzca contenido o realice acciones que sus desarrolladores explícitamente diseñaron que rechaz
Marca de agua de IA
El watermarking de IA es una técnica para incrustar señales imperceptibles en contenido generado por IA—texto, imágenes, audio o vídeo—para permitir la identificación posterior de su origen generado por máquina. Respalda
Moderación de contenidos
La moderación de contenidos es el proceso de revisar, filtrar y tomar medidas sobre el contenido generado por usuarios en plataformas digitales para hacer cumplir las pautas de la comunidad y los requisitos legales, cada
Privacidad de datos
La privacidad de datos en IA se refiere a las prácticas, controles técnicos y requisitos legales que rigen cómo se recopila, almacena, utiliza y protege la información personal durante el desarrollo e implementación de s
Prompt Injection
Prompt injection es un ataque en el cual instrucciones maliciosas incrustadas en la entrada de un modelo de IA anulan las directivas originales del sistema, causando que produzca salidas no intencionadas o dañinas.
Rechazo
Un rechazo es la decisión deliberada de un modelo de IA de declinar una solicitud del usuario, típicamente porque el entrenamiento de seguridad del sistema determinó que la solicitud podría conducir a salidas perjudicial
Red Teaming
Red teaming es un proceso estructurado de pruebas adversariales en el cual un equipo dedicado intenta encontrar fallos, salidas dañinas o vulnerabilidades de seguridad en un sistema de IA antes de que sea desplegado.
Seguridad de IA
La seguridad de IA es el campo interdisciplinario dirigido a garantizar que los sistemas de inteligencia artificial operen de manera confiable, predecible y sin causar daño no intencional, abarcando investigación técnica
Sesgo de IA
Sesgo de IA se refiere a patrones sistemáticos y sesgados en las salidas de un sistema de IA que surgen de datos de entrenamiento sesgados, encuadre de problemas defectuoso, o elecciones de diseño del modelo, causando qu
Hardware
Acelerador de IA
Un acelerador de IA es cualquier procesador o bloque de hardware — GPU, TPU, NPU, FPGA o ASIC personalizado — diseñado para acelerar las matemáticas de matrices y operaciones data-paralelo central para el entrenamiento y
ASIC
Un ASIC (Circuito Integrado de Aplicación Específica) es un chip diseñado y fabricado para realizar una función específica, proporcionando mejor rendimiento y eficiencia energética para esa tarea que un procesador de pro
CUDA
CUDA (Arquitectura de Dispositivo Unificado de Computación) es la plataforma de computación paralela y modelo de programación propietario de NVIDIA que permite a los desarrolladores escribir código C/C++ ejecutado direct
Data center de IA
Un data center de IA es una instalación propósito-construida o fuertemente modificada para alojar clústeres de GPU y aceleradores, diseñada específicamente para manejar la densidad de potencia extrema, demandas de enfria
FLOPS
FLOPS (Operaciones de Punto Flotante por Segundo) mide cuántas operaciones aritméticas de punto flotante un procesador ejecuta cada segundo. Es el benchmark primario para comparar hardware de IA, con GPUs de gama alta mo
GPU (Unidad de Procesamiento Gráfico)
Una GPU es un procesador originalmente diseñado para renderizado de gráficos de computadora, construido alrededor de miles de pequeños núcleos de cómputo paralelo. Desde principios de la década de 2010, las GPU se han co
GPU Cluster
Un cluster GPU es una colección de servidores, cada uno conteniendo múltiples GPU, interconectadas por redes de alta velocidad para actuar como un recurso de cálculo paralelo único para entrenar o servir modelos de IA qu
High-Bandwidth Memory (HBM)
High-Bandwidth Memory (HBM) es una tecnología DRAM apilada que une múltiples matrices de memoria verticalmente y las conecta a una GPU a través de un bus interno muy amplio, logrando anchos de banda de memoria de varios
Interconnect (NVLink, InfiniBand)
Un interconnect es el enlace de comunicación de alta velocidad que transfiere datos entre GPUs dentro de un servidor (intra-nodo, p. ej., NVLink) o entre servidores en un clúster (inter-nodo, p. ej., InfiniBand); su anch
NPU (Unidad de Procesamiento Neural)
Una NPU es un bloque de hardware dedicado integrado en un system-on-chip (SoC) que acelera la inferencia de redes neuronales localmente en un dispositivo, habilitando características de IA — como reconocimiento de voz o
TPU (Unidad de Procesamiento de Tensores)
Una TPU es un ASIC personalizado diseñado por Google específicamente para acelerar operaciones tensoriales — las multiplicaciones de matrices en el núcleo del entrenamiento e inferencia de redes neuronales — ofreciendo m
VRAM
VRAM (Memoria de Acceso Aleatorio de Vídeo) es la memoria dedicada de alta velocidad en una GPU utilizada para almacenar pesos del modelo, activaciones y caché KV durante el entrenamiento e inferencia de IA. Su capacidad
Negocios
Aguja en un Pajar
Aguja en un Pajar es una prueba de evaluación para contextos largos que mide si un modelo de lenguaje puede recuperar con precisión un hecho específico plantado (la «aguja») de un gran corpus de texto irrelevante (el «pa
API de IA
Una API de IA es una interfaz web estandarizada que permite a los desarrolladores enviar datos a un modelo de IA alojado y recibir texto generado, predicciones u otras salidas como respuesta, sin necesidad de desplegar s
Chatbot
Un chatbot es un programa de software que mantiene conversaciones de texto o voz con usuarios, ya sea siguiendo árboles de decisión guionados o, en implementaciones modernas, generando respuestas de forma libre usando un
Copilot
Un copilot es un asistente de IA integrado en una aplicación de software que proporciona sugerencias en tiempo real, automatiza subtareas y responde preguntas en lenguaje natural, manteniendo al usuario humano como el pr
Economía de Tokens (Precios de API)
La economía de tokens es el modelo de precios que rige el acceso comercial a modelos de lenguaje de IA a través de API, donde a los usuarios se les cobra por token — aproximadamente 3–4 caracteres de texto — con tasas se
Enterprise AI
Enterprise AI se refiere al despliegue de sistemas de inteligencia artificial dentro de organizaciones grandes para automatizar procesos, aumentar la toma de decisiones y generar valor empresarial a escala, integrado con
EU AI Act
La EU AI Act (Reglamento (UE) 2024/1689) es la primera regulación integral de IA horizontalmente aplicable a nivel mundial, adoptada por la Unión Europea en 2024, que clasifica sistemas de IA por nivel de riesgo e impone
Foso de IA
Un foso de IA es una ventaja competitiva duradera en inteligencia artificial que es difícil para rivales replicar, como datos de entrenamiento propietarios, escala de distribución, talento especializado, aprobación regul
Inteligencia Artificial de Código Abierto
Inteligencia Artificial de Código Abierto se refiere a modelos, frameworks o sistemas de IA cuyas ponderaciones, código o arquitectura son liberados públicamente, permitiendo que cualquiera los descargue, inspeccione, mo
Inteligencia Artificial General (AGI)
Inteligencia Artificial General (AGI) es un sistema de IA hipotético capaz de realizar cualquier tarea intelectual que un humano pueda, igualando o excediendo la flexibilidad cognitiva humana en todos los dominios sin re
Inteligencia Artificial Soberana
Inteligencia Artificial Soberana se refiere a los esfuerzos nacionales o regionales para desarrollar, poseer y controlar la infraestructura, modelos y pipelines de datos de IA en el ámbito doméstico, en lugar de depender
Laboratorio de IA
Un Laboratorio de IA es una organización (dentro de una empresa, universidad o entidad sin ánimo de lucro) dedicada a investigar y construir sistemas de inteligencia artificial, desde modelos fundacionales y técnicas de
Nube GPU (Neocloud)
Una nube GPU, a menudo llamada neocloud, es un proveedor de nube que se especializa en alquilar clusters de GPU de alta densidad para entrenamiento e inferencia de IA, en lugar de ofrecer la amplia cartera de servicios a
Poder de Computación
El poder de computación, en contextos de IA, se refiere a los recursos computacionales — principalmente potencia de procesamiento GPU o TPU, memoria e infraestructura de apoyo — requeridos para entrenar y ejecutar modelo
Proveedor en Hiperescala
Un proveedor en hiperescala es uno de un pequeño grupo de proveedores de nube — principalmente Amazon Web Services, Microsoft Azure y Google Cloud — que operan infraestructura de centros de datos a escala planetaria con
Regulación de IA
La regulación de IA se refiere a las leyes, reglas y estándares establecidos por gobiernos y organismos reguladores para gobernar el desarrollo, despliegue y uso de sistemas de inteligencia artificial, abordando riesgos
Superinteligencia Artificial (ASI)
Superinteligencia Artificial (ASI) es un sistema de IA hipotético cuyas capacidades cognitivas a través de cada dominio sustancialmente exceden a las de los humanos más capaces. Permanece como un concepto teórico a parti
Wrapper de IA
Un wrapper de IA es un producto o servicio construido llamando a una API de modelo de IA de terceros, como GPT de OpenAI o Claude de Anthropic, y añadiendo una interfaz de usuario, templates de prompts o lógica de flujo
Técnicas y métodos
Agentic RAG
Agentic RAG es una arquitectura en la cual un modelo de lenguaje actúa como un agente autónomo que iterativamente decide cuándo y qué recuperar de fuentes externas, permitiendo razonamiento multi-paso sobre consultas com
Base de datos vectorial
Una base de datos vectorial es un almacén de datos construido específicamente para almacenar vectores numéricos de alta dimensionalidad y realizar búsqueda rápida de vecinos más cercanos aproximados (ANN) en millones o m
Búsqueda semántica
La búsqueda semántica es un método de recuperación que coincide consultas con documentos basándose en significado conceptual en lugar de superposición de palabras clave, utilizando vectores de embedding y métricas de sim
Chunking
El chunking es el proceso de dividir documentos fuente en segmentos de texto más pequeños antes de incorporarlos y almacenarlos en una base de datos vectorial, habilitando recuperación eficiente y precisa en sistemas RAG
Context Engineering
Context engineering es la práctica de diseñar deliberadamente y ensamblar toda la información suministrada a la ventana de contexto de un modelo de lenguaje — incluyendo instrucciones, documentos recuperados, outputs de
Embedding
Un embedding es un vector numérico denso de longitud fija que representa datos — como texto, una imagen o audio — en un espacio de alta dimensionalidad donde los elementos semánticamente similares se encuentran geométric
Enrutamiento de Modelos
El enrutamiento de modelos es la práctica de dirigir automáticamente cada solicitud de inferencia de IA al modelo más apropiado de una flota — equilibrando costo, latencia y calidad — en lugar de enviar todas las consult
Few-shot learning
Few-shot learning es un paradigma de aprendizaje automático en el cual un modelo se adapta a una nueva tarea utilizando solo un pequeño número de ejemplos etiquetados—típicamente entre uno y veinte—en lugar de los grande
Grounding
Grounding es la práctica de conectar la salida de un LLM a fuentes de información externas y verificables—como documentos recuperados, resultados web en directo o bases de datos estructuradas—para reducir las alucinacion
In-context learning
In-context learning es la capacidad de un modelo de lenguaje grande de realizar nuevas tareas al leer ejemplos o instrucciones colocados directamente en el prompt de entrada, adaptando su comportamiento en tiempo de infe
Knowledge Graph
Un knowledge graph es una base de datos estructurada que representa entidades del mundo real como nodos y sus relaciones semánticas como aristas etiquetadas, permitiendo a las máquinas recorrer redes de hechos y admitir
Mecanismo de Atención
El mecanismo de atención es un componente de red neuronal que permite que un modelo asigne dinámicamente pesos a la relevancia de diferentes posiciones de entrada al calcular cada salida, permitiendo el procesamiento sen
OCR (Reconocimiento Óptico de Caracteres)
OCR (Reconocimiento Óptico de Caracteres) es una tecnología que convierte imágenes que contienen texto impreso o manuscrito en texto codificado por máquina, editable. Permite que las computadoras lean y procesen document
Prompt Engineering
Prompt engineering es la práctica de diseñar y refinar inputs de texto para guiar a modelos de lenguaje grandes hacia salidas precisas, consistentes o con formato específico, utilizando técnicas como especificación de in
RAG (Retrieval-Augmented Generation)
RAG (retrieval-augmented generation) es una técnica que permite que un modelo de lenguaje extraiga documentos relevantes de una base de conocimiento externa antes de responder y fundamentar su respuesta en ellos. Reduce
Reranking
El reranking es una técnica de recuperación en dos etapas que primero recupera un conjunto amplio de candidatos utilizando un método rápido de bi-encoder o palabras clave, luego re-califica esos candidatos con un modelo
Salida Estructurada
La salida estructurada es una técnica para limitar la generación de un modelo de lenguaje a modo que se conforme a un esquema predefinido — como JSON o XML — permitiendo que los sistemas posteriores analicen y consuman e
System Prompt
Un system prompt es un conjunto de instrucciones proporcionadas a un modelo de lenguaje antes de cualquier input del usuario, que define su persona, restricciones, formato de salida y reglas de comportamiento que persist
Zero-shot learning
Zero-shot learning es la capacidad de un modelo de aprendizaje automático de manejar correctamente tareas o clasificar entradas de categorías que nunca vio durante el entrenamiento, aprovechando relaciones semánticas apr