Conceptos básicos de los agentes de IA

Los agentes de IA evolucionaron de chatbots pasivos a sistemas autónomos capaces de razonar, usar herramientas corporativas y ejecutar flujos de trabajo complejos.

Para aprovechar su enorme potencial y pasar de casos de uso experimentales y prototipos a sistemas sólidos de nivel empresarial que generen un ROI medible, es útil comprender los componentes básicos. Aquí, desglosamos los conceptos básicos de los agentes de IA, incluidos los siguientes:

  • Modelos: El motor de razonamiento que usa el agente para pensar
  • Fundamentación: La base de conocimiento, que se convierte en el mecanismo para la exactitud factual y la recuperación de conocimiento
  • Herramientas: Capacidades definidas para realizar tareas, que determinan lo que un agente puede hacer
  • Arquitectura de datos: Dónde el agente almacena su memoria y datos
  • Organización: Cómo el agente planifica y conecta todas las partes en una tarea de varios pasos
  • Entorno de ejecución: Es donde el agente reside y se ejecuta a gran escala

Modelos

Piensa en el modelo como el cerebro de tu agente. Lee y comprende tus solicitudes, determina lo que debe suceder y genera respuestas inteligentes.

Elegir el modelo adecuado es una cuestión de equilibrar la capacidad, la velocidad y el costo para tu caso de uso. El objetivo no es maximizar la potencia bruta, sino optimizar la eficiencia. El error más común es invertir demasiado en una capacidad cuando un caso de uso no la necesita, lo que lleva a un gasto ineficiente y un rendimiento más lento.

Las arquitecturas cognitivas sólidas emplean múltiples agentes especializados que seleccionan de forma dinámica el modelo más eficiente para su subtarea específica. Es como tener un equipo de especialistas a mano, con trabajos que se enrutan de forma inteligente a diferentes especialistas según la tarea. Por ejemplo, un modelo potente se reserva para el trabajo pesado de la planificación y el razonamiento complejos, mientras que las tareas más simples y de gran volumen, como la clasificación de la intención del usuario, se enrutan a un modelo más rápido y rentable. Este enrutamiento dinámico de modelos es clave para optimizar tanto el rendimiento como el costo.

Al ofrecer un amplio conjunto de modelos para elegir, junto con modos de razonamiento configurables, los desarrolladores obtienen un conjunto dinámico de palancas para una optimización sofisticada. Todo esto los ayuda a calibrar el costo y el rendimiento de un sistema multiagente completo para satisfacer necesidades empresariales y técnicas específicas.

Una vez que selecciones un modelo que se ajuste a tus necesidades de costo, latencia y calidad, es posible que tengas la opción de ajustarlo. Esto especializa su conocimiento y estilo para tus necesidades empresariales específicas, y se hace con un conjunto de datos seleccionado de tus propios ejemplos de alta calidad. Para saber si un modelo permite y admite el ajuste, revisa su documentación y el contrato de licencia.

Profundiza: Crea agentes empresariales

¿Todo listo para poner en práctica la selección de tu modelo? Descubre cómo equilibrar la seguridad, la confiabilidad y la eficiencia en una arquitectura cognitiva sólida.

Obtén la guía técnica para crear sistemas multiagente empresariales.


Consejo útil

Usa una plataforma centralizada para descubrir, personalizar e implementar modelos de base. Busca una que ofrezca una selección altamente seleccionada de los mejores modelos del mundo, te permita implementar con un solo clic y brinde seguridad de nivel empresarial desde el principio.

Fundamentos

La credibilidad y utilidad de un agente dependen de su capacidad para proporcionar respuestas precisas y confiables basadas en hechos verificables. Aquí es donde entra en juego la fundamentación. Transforma a los agentes en verdaderos automatizadores de flujos de trabajo que se basan de forma precisa y profunda en los datos de tu empresa.

Cuando se trata de la fundamentación, hay tres capas que se deben considerar.

1. RAG: Un primer paso fundamental

La credibilidad de un agente está vinculada a su capacidad de proporcionar respuestas basadas en hechos verificables. La generación mejorada por recuperación (RAG) conecta un agente a una fuente de datos verificables y en tiempo real, lo que garantiza que el agente actúe en función de la verdad y no de alucinaciones.

Este sencillo proceso de recuperación y generación se puede aplicar a texto, imágenes y otros tipos de datos. Permite búsquedas ultrarrápidas de conjuntos de datos masivos, lo que lleva a decisiones oportunas y con capacidad de respuesta.

Sin embargo, aunque la RAG ayuda a responder preguntas, no es suficiente para las consultas complejas que requieren una comprensión más profunda de las relaciones entre los datos.

2. GraphRAG: Fundamentación más inteligente

GraphRAG enriquece la fundamentación comprendiendo las relaciones explícitas entre los datos en un gráfico de conocimiento y recuperando datos contextuales que reflejan mejor sus interconexiones con otras fuentes de datos. Por lo tanto, en lugar de solo hacer coincidir frases similares, tu agente comprende cómo se relacionan los conceptos.

Es importante destacar que los gráficos de conocimiento te dan control directo sobre tu lógica empresarial. Mientras que la RAG estándar se basa en patrones generados por el modelo, un gráfico de conocimiento te permite definir y administrar las relaciones específicas entre entidades, lo que garantiza que el agente respete la taxonomía y las reglas únicas de tu organización. Para lograr la máxima confiabilidad, las organizaciones líderes usan un enfoque híbrido que combina la recuperación amplia de RAG estándar con la precisión y el control de GraphRAG.

Caso de uso

Una vista estructurada de datos de fuentes dispares

Las empresas de servicios financieros usan gráficos de conocimiento para darles a los analistas una vista unificada de los informes de analistas, las conferencias de ganancias, las evaluaciones de riesgos y más. Esta red de datos interconectada y rica ayuda a los analistas a descubrir información previamente oculta, como dependencias complejas de la cadena de suministro, membresías de la junta que se superponen entre competidores y exposición a riesgos geopolíticos complejos.

3. Agentic RAG: Razonamiento y recuperación dinámicos

El enfoque más potente para la fundamentación es Agentic RAG, en el que el agente ya no es un receptor pasivo de información, sino un participante activo y razonador en el proceso de recuperación en sí. Con Agentic RAG, un agente puede analizar una consulta compleja, formular un plan de varios pasos y ejecutar varias llamadas a herramientas en secuencia para encontrar la mejor información posible. Esto no reemplaza la búsqueda tradicional, sino que agrega un razonamiento avanzado a tu infraestructura existente de RAG y gráficos de conocimiento para resolver consultas de múltiples saltos.

Esta capacidad de percibir y razonar con diferentes tipos de datos transforma al agente de un encargado del tratamiento de datos en una herramienta de resolución de problemas que comprende el mundo y se relaciona con él de una manera más completa. Cuando se le permite al agente ser un participante activo y razonador, los desarrolladores pueden crear sistemas capaces de ejecutar las consultas complejas de varios pasos y las tareas de largo plazo que definen las capacidades de los agentes de nueva generación.

Consejo útil

Usa el enfoque de recuperación y reclasificación

Abordar la compensación entre la recuperación (encontrar todos los documentos pertinentes) y la precisión (garantizar que los documentos recuperados sean pertinentes) con el enfoque de “recuperar y reclasificar”, que amplía la apertura de recuperación para recuperar un conjunto de documentos más grande de lo necesario. Este conjunto más grande se pasa al LLM o a un servicio especializado de clasificación, que identifica los documentos más pertinentes y descarta los que no lo son o son semánticamente opuestos.

Nota

El ajuste no es fundamentación. El ajuste adapta el estilo de un modelo y define mejor su conocimiento sobre una tarea específica. La fundamentación conecta el modelo a fuentes de datos verificables en tiempo real para garantizar que sus respuestas sean precisas.

Herramientas

Las herramientas son capacidades definidas que permiten que un agente haga más que las funciones nativas de su modelo de razonamiento principal. Desde realizar un cálculo interno simple hasta interactuar con sistemas externos usando llamadas a la API, las herramientas acortan la brecha entre el razonamiento del agente y su capacidad de actuar. Debido a que la fundamentación es la forma principal en que un agente recupera información nueva, técnicamente es la herramienta más fundamental en el kit de herramientas de un agente.

Las herramientas pueden incluir:

  • Funciones y servicios internos: Lógica propietaria o código especializado escrito por tu propio equipo para resolver problemas específicos de la empresa
  • APIs externas: Conexiones seguras a servicios de terceros que permiten que un agente ejecute tareas en el mundo real
  • Recuperación y fundamentación de datos: La capacidad de consultar bases de datos de forma dinámica (incluido el lenguaje natural a SQL), buscar almacenes de vectores o acceder a bases de conocimiento empresarial. Ya sea una búsqueda simple o una consulta compleja de base de datos, estas herramientas garantizan que las acciones del agente se basen en datos verificables
  • Colaboración entre agentes: En sistemas más sofisticados, un agente puede colaborar con otro agente especializado para resolver un problema. Si bien un agente puede usarse como una “herramienta” para una tarea específica, los sistemas empresariales más potentes los tratan como colaboradores que coordinan acciones de forma segura en diferentes dominios

Arquitectura de datos

Los agentes usan diferentes tipos de memoria para diferentes tareas. Una arquitectura de datos empresarial sólida debe abordar tres necesidades distintas: almacenamiento persistente para la recuperación de conocimiento a largo plazo, acceso de baja latencia para el contexto conversacional a corto plazo y un libro de contabilidad duradero para la auditoría transaccional.

1. Base de conocimiento a largo plazo (fundamentación y memoria)

La memoria a largo plazo es la base de la inteligencia, la fundamentación y la personalización de un agente, y se diferencia del contexto rápido y a corto plazo de una conversación en vivo. Su arquitectura tiene tres componentes principales:

  • Una base de conocimiento estructurada para la generación mejorada por recuperación (RAG) basada en hechos
  • Un almacenamiento persistente para la memoria sintetizada del usuario. En lugar de almacenar cada interacción histórica, el agente genera y almacena datos importantes sobre el usuario, el equipo o la tarea para permitir una experiencia continua y personalizada
  • Un data lake operativo para material sin procesar, como transcripciones de conversaciones y estados de flujo de trabajo, que permite procesos cognitivos más complejos y análisis futuros

Caso de uso

Obtén acceso a toda la información pertinente

Un agente legal recupera al instante jurisprudencia, documentos de políticas internas y manuales de capacitación para generar un primer borrador de un contrato que cumpla con los requisitos legales.

2. Memoria de trabajo (contexto conversacional y estado a corto plazo)

Esta capa administra la información transitoria (la ventana de contexto del LLM) necesaria para una tarea o conversación en curso. Para mantener una experiencia del usuario responsiva, debe proporcionar acceso de latencia extremadamente baja para la secuencia iterativa de acciones y observaciones que se realizan.

Caso de uso

Ten una conversación útil

Un agente de asistencia al cliente mantiene el estado de un flujo de solución de problemas de varios pasos recordando los números de serie o los pasos de diagnóstico proporcionados anteriormente por el usuario para evitar la repetición.

3. Memoria transaccional (administración de estados y auditoría de acciones)

Esta capa es responsable de registrar acciones y cambios de estado con una coherencia e integridad sólidas. Sirve como el sistema de registro duradero, lo que es esencial desde el punto de vista de la seguridad y para entregar un registro de auditoría no repudiable para cada acción impulsada por el agente.

Caso de uso

Mantén un libro de contabilidad duradero

Un agente de la cadena de suministro registra la ejecución exitosa de una orden de compra compleja de varias partes, lo que garantiza que la transacción se rastree y verifique de forma permanente en los sistemas financieros.

Organización

La organización es el núcleo operativo que guía a un agente a través de una tarea de varios pasos. Para cualquier proceso que requiera más de una acción, determina qué herramientas se necesitan, en qué secuencia y cómo se deben combinar sus resultados para lograr un objetivo final.

Como función ejecutiva del agente, la organización es la clave para crear sistemas sofisticados que automatizan procesos empresariales complejos. Te permite abordar problemas que, antes, no eran técnicamente factibles, lo que, en última instancia, desbloquea una nueva clase de aplicaciones y experiencias del usuario.

Un patrón de organización común y eficaz es ReAct (razonamiento + acción). Este marco de trabajo combina las capacidades de razonamiento y acción de los modelos de lenguaje grandes, y establece un bucle dinámico de varios turnos en que el modelo genera tanto rastros de razonamiento (pensamientos) como acciones específicas de tareas de forma intercalada.

Con ReAct, el razonamiento ayuda al modelo a hacer un seguimiento de los planes de acción y actualizarlos, mientras que las acciones recopilan información de herramientas externas para informar el proceso de razonamiento. Funciona de la siguiente manera:

  1. Razonamiento: El agente evalúa el objetivo y el estado actual, y formula una hipótesis sobre el siguiente mejor paso y si se requiere una herramienta.
  2. Acción: El agente selecciona y llama a la herramienta adecuada.
  3. Observación: El agente recibe el resultado de la herramienta. Esta nueva información se integra en el contexto del agente y alimenta el siguiente paso de razonamiento del ciclo.

Casos de uso

Automatización de RR.HH. interdepartamental

Para incorporar a un nuevo empleado, el agente inicia acciones de forma secuencial en varios sistemas. Primero, crea un registro de empleado en el sistema; luego, activa una llamada a la API del agente de TI para aprovisionar hardware y credenciales de red; y, por último, inscribe al empleado en los módulos de capacitación de cumplimiento regional requeridos.

Corrección proactiva de la cadena de suministro

Para detectar y solucionar automáticamente las interrupciones en los envíos, se coordina un agente para que siga los pasos clave. Primero, una alerta de supervisión activa una herramienta para consultar a proveedores alternativos. Luego, ejecuta una herramienta de simulación para calcular el costo-beneficio de cambiar de proveedor en comparación con el envío retrasado. Por último, si se aprueba con una interacción humana, ejecuta la acción para enviar una nueva orden de compra al agente de logística.

Entorno de ejecución

Para implementar un prototipo de agente funcional en un entorno de producción a gran escala, necesitas una infraestructura de entorno de ejecución sólida integrada en un sistema coherente de servicios para fundamentación, herramientas, memoria, sesiones y el resto. Esto garantiza que tus agentes puedan operar en un ecosistema seguro y de alto rendimiento capaz de manejar las demandas complejas del crecimiento empresarial global.

Un entorno de ejecución de nivel de producción requiere lo siguiente:

Escalabilidad: La infraestructura debe realizar escalado automático para manejar cargas variables, desde cero hasta millones de solicitudes. Esto incluye tanto el balanceo de cargas basado en solicitudes como el escalado automático basado en recursos para administrar las demandas computacionales de manera eficiente.

Seguridad y control: La plataforma debe ofrecer un entorno de ejecución seguro, administrar la identidad de los usuarios y agentes, las políticas de la organización, los registros de herramientas y agentes, los controles de acceso a la red y los canales de comunicación seguros (como TLS) para proteger al agente y los datos a los que accede.

Confiabilidad y observabilidad: El sistema debe incluir mecanismos para el manejo de errores y la supervisión continua. Para una depuración compleja, el entorno de ejecución debe capturar seguimientos de ejecución de alta fidelidad, es decir, un registro paso a paso del razonamiento del agente y las llamadas a herramientas. Esto expone toda la trayectoria de una decisión, lo que permite a tus equipos responder de manera definitiva a la pregunta “¿Por qué?” si se produce una falla inesperada. Para una supervisión de alto nivel, el sistema debe incluir métricas de finalización de tareas y comentarios de los usuarios. La automatización con simulaciones y evaluaciones permite tener confianza antes y después de la implementación en producción.

Aprende a crear, escalar y administrar agentes de IA.

Nuestra guía empresarial para sistemas multiagente te muestra cómo crear soluciones eficientes, escalables y seguras basadas en IA sin sacrificar la solidez empresarial.

Logotipo de Cloud
Google Cloud