InicioCarreraProyectosServiciosStackBlogContacto
Iniciar sesión
InicioCarreraProyectosServiciosStackBlogContacto

Hecho con café, código y curiosidad, desde Colombia ☕

japalacio-08jeyson-anibal-palacio-palma

Hoja de vida

Descargar CV
¿Despliego hoy?juevesNo¡Llama a tu pareja!

© 2026 Jeyson Palacio. Todos los derechos reservados.

Política de privacidadTérminos del servicioCréditos
Todos los servicios

Integración de IA & Automatización

Los modelos y los agentes entran en el producto que ya tienes con la misma disciplina que cualquier otro servicio: contrato propio, límites de coste y registro de lo que hicieron.

La mayoría de los proyectos de IA que se atascan no fallan por el modelo. Fallan porque nadie definió qué tarea concreta se estaba automatizando, ni cómo se iba a saber si funcionaba.

Aquí el orden se invierte: primero la tarea y su medida, después el modelo. Y lo que se integre entra al producto como un servicio más, con su contrato, su coste y su registro.

Frentes de trabajo

La tarea antes que el modelo

Empezamos eligiendo una tarea que hoy hace una persona, que se repite y que se puede medir. Eso da un criterio de éxito antes de escribir el primer prompt, y evita construir una plataforma para un problema que nadie tenía.

Herramientas con MCP

Un modelo es más útil cuando puede consultar y actuar sobre datos reales. Con MCP eso se expone como herramientas con permisos explícitos, así que se sabe exactamente a qué tiene acceso y queda registrado cada uso.

Agentes fiables

Un agente que encadena pasos falla a mitad tarde o temprano. Orquestado con Temporal, cada paso es reintentable y el estado sobrevive a un reinicio, así que un fallo no obliga a repetir toda la tarea desde cero.

Coste bajo control

El coste por tarea se mide desde el principio y se ataca con lo de siempre: caché de lo repetido, modelo pequeño para lo fácil y grande solo para lo difícil, y límites por usuario para que un caso raro no se lleve el presupuesto del mes.

Cómo encaja

Los dos tiempos de un RAG

La ingesta ocurre antes y sin prisa. La consulta ocurre mientras alguien espera. Mezclarlas es la razón más común de que un RAG vaya lento.

Ingesta, fuera de línea

DocumentoTroceado con solapeEmbeddingspgvector / Pinecone

Consulta, en línea

PreguntaRecuperación y rerankingContexto acotadoRespuesta con citas

↳ Los dos caminos se encuentran en el índice: si la ingesta no está al día, la respuesta será correcta sobre datos viejos.

La vuelta que da un agente

Un agente no improvisa. Cada herramienta es una función con permisos, cada llamada queda registrada y hay un tope de vueltas y de gasto.

Tope de vueltas, presupuesto y registro de todo lo que hizo

01

Objetivo

Una tarea concreta del negocio, no una instrucción abierta.

02

El modelo decide

Elige qué herramienta usar, o responde que no hace falta ninguna.

03

Herramienta (MCP)

Consultar una API, escribir en la base, agendar. Con los permisos del usuario.

04

Evaluación

Casos de prueba que corren en cada cambio de prompt o de modelo.

  1. 01

    Objetivo

    Una tarea concreta del negocio, no una instrucción abierta.

  2. 02

    El modelo decide

    Elige qué herramienta usar, o responde que no hace falta ninguna.

  3. 03

    Herramienta (MCP)

    Consultar una API, escribir en la base, agendar. Con los permisos del usuario.

  4. 04

    Evaluación

    Casos de prueba que corren en cada cambio de prompt o de modelo.

  5. Tope de vueltas, presupuesto y registro de todo lo que hizo

Qué incluye

  • Integración de APIs de modelos (Claude, GPT, Gemini) detrás de un contrato propio, para que puedas cambiar de proveedor sin tocar el producto.
  • Servidores y clientes MCP para dar a un modelo acceso controlado a herramientas y datos.
  • Agentes que ejecutan tareas de varios pasos, orquestados con Temporal cuando deben ser fiables.
  • Pipelines RAG: preparación de documentos, chunking, embeddings y búsqueda semántica con pgvector o Pinecone.
  • Evaluación: conjuntos de casos, comparación entre versiones de prompt y revisión humana donde hace falta.
  • Control de coste y de latencia: caché, límites por usuario, streaming y elección de modelo por tarea.
  • Manejo de datos sensibles antes de que salgan hacia un modelo.
  • Interfaces de producto para lo anterior, en React o Next.js, con estados de espera y de error pensados.

Cómo avanza el proyecto

  1. 01Empezamos por una tarea concreta y medible, no por una plataforma de IA.
  2. 02El modelo va detrás de una interfaz propia, así que cambiar de proveedor no obliga a reescribir el producto.
  3. 03Queda registro de entradas y salidas, que es lo único que permite mejorar un prompt con datos y no con intuiciones.
  4. 04Se define contigo qué decide el modelo y qué sigue decidiendo una persona.

Qué te llevas

  • La integración en producción, con su registro y sus límites.
  • Prompts, herramientas y evaluaciones versionados en el repositorio.
  • Informe de coste por tarea y de qué se midió.

Stack habitual

Modelos
Claude APIOpenAI APIGoogle GeminiHugging Face
Integración
Anthropic MCPLangChainFunction callingStreaming
Recuperación
pgvectorPineconeNeo4jRAG
Orquestación
TemporalCeleryPythonNestJS
Producto
ReactNext.jsTypeScript

Dónde se ha hecho esto

  • MoverisMoverisAntifraude · Liveness con IA
  • MastercardMastercardInfraestructura de pagos · vía BairesDev
  • StyleSeatStyleSeatMarketplace de belleza y bienestar · vía Revelo

Preguntas frecuentes

¿Cómo se sabe si la IA sirve para este producto?

Eligiendo primero una tarea que hoy hace una persona, que se repite y que se puede medir. Con eso hay un criterio de éxito antes de escribir el primer prompt, y se sabe en semanas si la cosa funciona o no.

¿Qué pasa con los datos sensibles?

Se decide qué sale y qué no antes de conectar nada. Los datos personales se recortan o se sustituyen antes de la llamada, el acceso a herramientas va con permisos explícitos y cada uso queda registrado.

¿Se puede cambiar de proveedor después?

Sí, si el modelo entra detrás de una interfaz propia en vez de esparcido por el producto. Así cambiar de Claude a GPT o a Gemini es cambiar una implementación, no reescribir funcionalidades.

¿Cuánto cuesta operarlo?

Se mide por tarea desde el primer día, porque es lo único que permite decidir. Después se ataca con lo de siempre: caché de lo repetido, modelo pequeño para lo fácil y límites por usuario para que un caso raro no se lleve el presupuesto del mes.

¿Tienes otra pregunta?Escríbeme y te respondo, sin necesidad de agendar nada.
Hablemos de tu proyecto