Habr AI→ original

Por dentro de un agente de AI: siete herramientas que convierten a una LLM en ejecutora

¿Qué ocurre cuando un modelo de lenguaje obtiene acceso a un terminal, a un sistema de archivos y a internet? Así es exactamente como funcionan Claude Code y Codex: el agente lee código por sí mismo, edita archivos y ejecuta comandos. En la segunda parte del tutorial, cubrimos siete herramientas básicas y el mecanismo de selección: cómo el modelo decide en cada situación qué herramienta invocar.

Procesado por IA desde Habr AI; editado por Hamidun News
Por dentro de un agente de AI: siete herramientas que convierten a una LLM en ejecutora
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Si le das a un modelo de lenguaje una terminal, sistema de archivos y acceso a internet, deja de ser un asistente parlanchín y se convierte en un agente — así es como funcionan bajo el capó Claude Code, Codex y otras herramientas para desarrolladores. La segunda parte del tutorial explica cómo agregar siete herramientas básicas a un modelo y enseñarle a elegir independientemente la correcta según la tarea.

Qué son las herramientas de agente

Un modelo de lenguaje por sí solo solo puede hacer una cosa — generar texto basado en el contexto de entrada. Para convertirse en un agente, necesita herramientas: funciones específicas que el marco del agente ejecuta por orden del modelo y devuelve el resultado al contexto. El principio es simple: el modelo recibe un prompt con descripciones de herramientas disponibles — nombre, parámetros, qué hace. Mientras funciona, evalúa la tarea y decide por sí solo si algo necesita ser llamado, y si es así — qué exactamente y con qué argumentos. El desarrollador define el conjunto de funciones disponibles; elegir la herramienta específica para una situación específica depende del modelo.

En el tutorial, al agente se le dan siete herramientas básicas:

  • Leer archivos del sistema de archivos
  • Escribir y editar archivos
  • Ejecutar comandos en la terminal
  • Navegar por directorios y listar contenidos
  • Ejecutar scripts de Python sobre la marcha
  • Buscar información en internet
  • Obtener información sobre el sistema y el entorno

Este conjunto ya permite que el agente lea independientemente código ajeno, haga ediciones, ejecute pruebas y verifique sus resultados — sin participación humana en cada paso.

Cómo elige el modelo una herramienta

El momento clave no es el conjunto de herramientas en sí, sino el mecanismo de selección. Esto se llama tool calling o function calling, y aquí es donde los LLM modernos difieren fundamentalmente de los chatbots de la generación anterior. Cuando un modelo decide que necesita una herramienta para una tarea, devuelve no solo texto, sino JSON estructurado: nombre de función y argumentos. El marco del agente intercepta este JSON, ejecuta la operación real — ejecuta un comando, lee un archivo, hace una solicitud HTTP — y devuelve el resultado al contexto. El modelo mira el resultado, piensa de nuevo, y llama a la siguiente herramienta o termina el trabajo.

Este bucle — pensar, llamar una herramienta, obtener un resultado, pensar de nuevo — es lo que convierte un modelo de lenguaje estático en un sistema dinámico. Al mismo tiempo, el modelo no sigue un guión rígido: cada vez re-analiza la situación teniendo en cuenta todo el contexto acumulado — pasos anteriores, resultados intermedios, tarea original. Esto es lo que hace que el agente sea flexible: puede corregir el plan sobre la marcha si un resultado intermedio resulta ser inesperado.

El bucle y el problema de detención

El agente funciona en un ciclo: genera una respuesta → si se necesita una herramienta, la llama → obtiene un resultado → genera de nuevo. El ciclo continúa hasta que la tarea se completa o el agente decide que no se necesitan más llamadas. Aquí reside la principal complejidad de ingeniería: ¿cómo entiende el modelo que es hora de completar el bucle?

En implementaciones simples, se utiliza uno de dos enfoques. Primero — límite de iteraciones: si después de N pasos la tarea no se completa, el agente se detiene forzadamente. Segundo — señal de finalización especial: el modelo devuelve un marcador "hecho", y el marco sale del bucle.

Claude Code y Codex lo resuelven mucho más sofisticadamente: teniendo en cuenta el contexto de la tarea, el costo de cada llamada y el análisis de resultados intermedios. Pero el principio fundamental es el mismo — un bucle con una condición de salida explícita. Esta condición determina si el agente será una herramienta útil o se colgará en un bucle infinito.

Qué significa esto

El tutorial muestra claramente: la diferencia entre un simple chatbot y una herramienta poderosa como Claude Code — no está en el tamaño del modelo ni en la magia, sino en la arquitectura. Agrega un bucle, varias funciones y una regla de parada — obtienes un sistema que puede trabajar con el mundo real: leer código, editar archivos, ejecutar pruebas y buscar información en la web. Esto es lo que hace que los agentes de IA modernos sean prácticamente útiles para desarrolladores, en lugar de solo impresionantes en demostraciones.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…