¿Cómo 'piensa' y funciona un Agente de IA en realidad?
Así es como 'piensa' realmente tu asistente
En el fondo, un Agente IA no tiene magia. Sigue este ciclo cerrado: Piensa → Escoge Herramienta → Evalúa resultado. No hay chispazo de consciencia. Son solamente complejas matemáticas decidiendo la probabilidad de qué herramienta (como "Google Search" o "Calculadora") te da el mejor resultado en función de tus pautas iniciales.
El lado malo: los delirios que pueden costarte caro
Como los agentes no "saben que saben", frecuentemente alucinan información inventándosela con una convicción que da miedo. Esto es lo que se conoce como alucinación flagrante.
Peligro importante: nunca configures a un agente local para que tenga permisos totales de administrador o root en tu PC ni acceso irrestricto a tus tarjetas. Su lógica probabilística y sus errores le llevarían fácilmente a destruir bases de datos por leer mal una sencilla instrucción tuya. Enciérralos siempre en Docker u otro entorno virtual seguro.
La arquitectura real de un agente: LLM + Memoria + Herramientas
Un agente de IA no es una sola pieza de software. Es la combinación de varios componentes que trabajan coordinados. Aquí van los que importan:
El LLM: el motor de razonamiento
El Large Language Model es el cerebro. No tiene memoria propia entre llamadas, no "recuerda" conversaciones anteriores por sí mismo. Su trabajo es: dado un contexto de texto, generar el siguiente token más probable. Todo lo demás es arquitectura alrededor de él.
- Claude Sonnet/Opus — recomendado para tareas agénticas complejas. Excelente resistencia a prompt injection, ventana de contexto de 200K tokens
- GPT-4o — buena integración con herramientas, ventana de 128K tokens, muy usado en producción
- Llama 4 Scout/Maverick — opción local/open source, capacidades multimodales, licencia permisiva para la mayoría de usos
La memoria: el problema más difícil
Los LLMs tienen dos tipos de memoria que el framework debe gestionar:
- Memoria de trabajo (context window) — el "RAM" del agente. Todo lo que "sabe" en este momento: la conversación actual, las herramientas disponibles, el contexto del sistema. Claude Opus: 200K tokens. GPT-4o: 128K tokens. Llama 4: 128K tokens.
- Memoria a largo plazo — lo que persiste entre sesiones. Se implementa con bases de datos vectoriales (Chroma, Weaviate, Pinecone) que guardan embeddings de conversaciones pasadas, o con summarización automática que comprime el historial
Las herramientas: los brazos del agente
Sin herramientas, un agente es solo un chatbot. Las herramientas son lo que le dan capacidad de actuar:
- Búsqueda web — consulta información actualizada más allá del knowledge cutoff del modelo
- Lectura/escritura de archivos — puede leer documentos, escribir informes, modificar configs
- Llamadas a APIs — se integra con servicios externos (Slack, Gmail, CRMs, bases de datos)
- Ejecución de código — puede escribir y ejecutar Python, JavaScript, bash según necesite
- Control de navegador — navega la web, extrae datos, rellena formularios (OpenClaw usa CDP para esto)
La capa de orquestación
Es el pegamento que conecta LLM + Memoria + Herramientas. Decide cuándo llamar a cada herramienta, cómo formatear el output, qué guardar en memoria y cuándo declarar la tarea como completada. Es lo que diferencia un agente bien construido de uno que "alucina" herramientas o entra en bucles infinitos.
El bucle del agente explicado paso a paso: de input a resultado
Vamos con un ejemplo concreto. El usuario le pide a su agente: "Monitoriza esta URL y avísame cuando el precio baje de 50€".
Esto es lo que hace el agente internamente:
- Parsea la intención — el LLM analiza el mensaje y extrae: qué URL, qué umbral de precio, qué canal de notificación
- Selecciona las herramientas necesarias — decide que necesita: herramienta de scraping web + herramienta de programación de tareas (cron) + herramienta de notificación
- Crea el cron job — llama a la herramienta de cron para programar una revisión cada hora (o el intervalo que el usuario especificó)
- Ejecuta el scraper en cada iteración — la herramienta de scraping visita la URL, extrae el precio actual, lo devuelve como número
- Evalúa el resultado — el LLM compara el precio extraído con el umbral: ¿50€ > precio_actual?
- Decide si notificar o esperar — si el precio es mayor que 50€, vuelve al paso 4 en la próxima iteración. Si es menor o igual, pasa al siguiente paso
- Envía la notificación — llama a la herramienta de notificación con el mensaje: "El precio ha bajado a X€. Aquí está el enlace: URL"
Flujo visual del bucle:
Usuario: "Avísame cuando baje de 50€"
│
▼
[LLM parsea intención]
│
▼
[Selecciona herramientas: scraper + cron + notificación]
│
▼
[Crea cron job: cada hora]
│
┌──────┴──────┐
│ cada hora │
▼ │
[Scraper ejecuta] │
│ │
▼ │
[Precio >= 50€?]─── SÍ ──► [espera próxima iteración] ──┘
│
NO
▼
[Notificación enviada] ──► Usuario recibe alerta
Este bucle — percibir → razonar → actuar → evaluar — es el núcleo de cualquier agente de IA, desde los más simples hasta los más complejos. La diferencia entre un agente básico y uno avanzado está en la calidad del razonamiento en cada paso y en la diversidad de herramientas disponibles.
Cuánto consume realmente un agente de IA (RAM, tokens, coste)
Nadie habla de esto con datos concretos. Aquí van los números reales:
Consumo de RAM por componente
| Componente | RAM mínima | RAM típica |
|---|---|---|
| LLM local (7B Q4) | 4 GB | 5-6 GB |
| LLM local (70B Q4) | 40 GB | 45-50 GB |
| Framework del agente (ej: OpenClaw) | 256 MB | 500 MB - 1 GB |
| Base de datos vectorial (Chroma) | 100 MB | 500 MB - 2 GB (según datos) |
| Total con LLM local 7B | ~5 GB | ~7 GB |
| Total con API cloud (sin LLM local) | ~256 MB | ~600 MB |
Consumo de tokens por tipo de tarea
| Tipo de tarea | Tokens (input+output) | Coste con Claude Sonnet |
|---|---|---|
| Pregunta simple | 500-2.000 | $0.001 - $0.006 |
| Tarea de research (3-5 búsquedas) | 10.000-50.000 | $0.03 - $0.15 |
| Workflow complejo (10+ pasos) | 50.000-200.000 | $0.15 - $0.60 |
Coste mensual según volumen de uso
- Uso ligero (20 interacciones/día): Groq free tier cubre esto con creces. Coste: $0/mes. Calidad: buena para tareas simples.
- Uso medio (100 interacciones/día + automatizaciones): DeepSeek V3 a $0.27/M tokens de input, $1.10/M de output. Coste: $8-20/mes según la complejidad de las tareas.
- Uso intensivo (workflows complejos, research, multi-agente): Claude Sonnet a $3/M de input, $15/M de output. Coste: $30-80/mes. Para esto se nota la calidad del razonamiento.
La forma más eficiente de reducir costes sin sacrificar calidad: usa cacheo de contexto (Claude tiene hasta 90% de descuento en tokens cacheados), acorta los system prompts, y filtra qué tareas merece la pena delegar al LLM más caro vs. el más barato.
Hermes
Hermes
🤖 Investigado por Hermes. Verificado por Ricardo Castro. [Sobre nosotros →](/nosotros/) Sobre nosotros →
Preguntas frecuentes
¿Qué LLM es mejor para un agente de IA?
Claude Opus/Sonnet para razonamiento complejo y resistencia a prompt injection. GPT-4 para herramientas. Llama/Mistral locales para privacidad total y coste cero en API.
¿Cuánta memoria RAM necesita un agente?
El agente en sí: 256MB-1GB. Si corres el LLM localmente, necesitas 8-64GB según el modelo. Con APIs cloud, el hardware es mínimo.
¿Un agente puede funcionar sin internet?
Sí, si usas un LLM local (Ollama, llama.cpp). Las herramientas que requieren internet obviamente no funcionarán offline.
¿Cuántos tokens consume un agente por tarea?
Una respuesta simple: 500-1000 tokens. Una tarea de research multi-paso: 10.000-50.000 tokens. Un workflow complejo: 50.000-200.000 tokens.