Observabilidad empresarial de modelos de lenguaje, contención de deriva y agentes de triaje multimodal construidos sobre Vertex AI. Diseñado para entornos de salud digital donde la trazabilidad, la contención y la supervisión humana no son opcionales.
NodesMed no es un chatbot genérico ni un sistema de diagnóstico automático. Es una plataforma SaaS B2B/B2C de observabilidad de modelos de lenguaje (AI Safety / MLOps clínico) que permite a organizaciones de salud desplegar agentes de navegación y triaje con garantías de control, auditoría y derivación segura.
El problema que resolvemos
Los grandes modelos de lenguaje son potentes, pero en contextos clínicos y educativos de salud presentan riesgos bien documentados: afirmaciones no respaldadas por fuentes (desanclaje factual), sobreconfianza, recomendaciones fuera de alcance, deriva temporal del comportamiento y dificultad para demostrar qué evidencia utilizó el sistema en cada respuesta.
En un entorno regulado —como el sanitario— no basta con “probar que el modelo responde bien la mayoría de las veces”. Se necesita un sistema que:
NodesMed responde a ese vacío con una infraestructura determinista de seguridad y un orquestador de navegación clínica (KAI) construidos de forma nativa sobre Google Cloud Platform y Vertex AI.
Módulo 1
El núcleo de NodesMed es un marco de auditoría estructural orientado a agentes de lenguaje en contextos de salud. Su función es implementar Automated Drift Detection & Closed-Loop Quality Assurance (QA): detección automatizada de deriva y aseguramiento de calidad en bucle cerrado.
PAD-ML no atribuye conciencia, intenciones ni responsabilidad moral al modelo. Trabaja exclusivamente con salidas observables, configuraciones, memoria, permisos, incertidumbre y consecuencias. El objetivo es mantener el sistema dentro de sus fuentes autorizadas, límites de alcance y criterios de seguridad definidos por la organización.
En un sistema cerrado y determinista la salida puede expresarse como función del estado inicial, la entrada y las reglas de transformación. Si se mantiene constante el estado, la entrada y las reglas, la salida queda fijada. Si se cambia una sola condición y la salida cambia, existe un efecto causal atribuible a esa condición.
Los modelos de lenguaje en producción rara vez son cajas completamente cerradas: incorporan muestreo, contexto, memoria externa, recuperación documental (RAG), herramientas, filtros y actualizaciones de versión. Por eso PAD-ML distingue tres regímenes:
Mismo estado, misma entrada y mismas reglas producen la misma salida.
La configuración modifica la distribución de posibles salidas.
La configuración es una causa entre varias y debe analizarse junto con el entorno.
La prueba práctica es sencilla y repetible: cambiar X, mantener Y constante y medir Z. Se refuerza con repetición, reversibilidad y, cuando corresponde, intervención gradual. Esta disciplina es la base de toda intervención de “capa única” del protocolo.
Cinco etapas diseñadas para trazabilidad, causalidad y recuperación controlada.
Captura de prompts, ventanas de contexto, documentos recuperados por RAG, llamadas a herramientas, versión del modelo y parámetros de generación. Todo se asocia a un identificador de sesión inmutable.
Clasificación de riesgo (Bajo / Medio / Alto / Crítico). Detecta desanclaje factual, consejo clínico no autorizado, bucles conversacionales, autorreferencia no solicitada y deriva temporal respecto de la línea base.
Evaluación automatizada mediante rúbricas (patrón Gemini-as-a-Judge). Mide exactitud factual, calibración de confianza, coherencia con fuentes autorizadas y preparación para derivación segura.
Se modifica exactamente una variable controlada (filtro de recuperación, directriz de sistema, alcance de memoria o parámetro de generación). El resto se mantiene constante para preservar atribución causal y reversibilidad.
Retorno verificado a la última configuración conocida como segura. La reentrada a producción exige aprobación humana explícita tras revisar el riesgo residual.
Cada señal tiene una manifestación observable y una respuesta inicial definida.
| Señal | Manifestación observable | Respuesta inicial |
|---|---|---|
| Desanclaje factual | Datos inventados o fuentes inexistentes / no autorizadas | Verificación y abstención |
| Sobreconfianza | Certeza expresada sin respaldo proporcional a la evidencia | Calibración y anclaje a fuentes autorizadas |
| Autorreferencia operativa | Declaraciones repetidas no solicitadas sobre autonomía o poder del sistema | Reinicio de contexto y revisión |
| Bucle conversacional | Repetición de una secuencia de respuestas | Corte del ciclo y nueva evaluación |
| Deriva de fuente | Respuestas fuera del corpus autorizado | Aislamiento de RAG y trazabilidad |
| Perfil de daño | Recomendación riesgosa o no autorizada | Contención y escalamiento humano |
| Deriva temporal | Cambio de comportamiento sin intervención registrada | Comparación con línea base |
| Rigidez | No ofrece alternativas pertinentes cuando es seguro hacerlo | Exploración controlada bajo supervisión |
Módulo 2
Powered by Vertex AI. KAI es el orquestador de navegación clínica y triaje de NodesMed. Su función es recibir la consulta del usuario, ordenarla, entregar orientación inicial dentro de un alcance estricto y derivar de forma segura cuando el caso supera los límites autorizados.
KAI no se presenta como un médico artificial. Se presenta como un asistente de navegación auditado bajo el marco PAD-ML. Toda respuesta que pueda interpretarse como consejo clínico fuera de alcance activa mecanismos de contención y derivación humana.
“No puedo determinar eso de forma segura mediante este canal. Lo más adecuado es que lo revise un profesional de salud. Puedo mostrarte las opciones de consulta disponibles o ayudarte a localizar información educativa autorizada.”
Este tipo de respuesta se activa cuando el sistema detecta que la consulta supera el alcance autorizado o presenta señales de riesgo.
El diseño de KAI se alinea de forma explícita con:
NodesMed documenta propósito, límites, fuentes autorizadas, separación entre educación/navegación y atención clínica, y procedimientos de incidente antes de cualquier despliegue en producción.
Módulo 3
La capa de observabilidad expone en tiempo real (o en modo simulado para demostración) los indicadores que permiten a operadores y responsables clínicos saber si el sistema se mantiene dentro de los límites definidos.
Estos indicadores no son promesas de “infalibilidad”. Son mediciones operativas que alimentan el bucle de Automated Drift Detection & Closed-Loop QA. Los umbrales definitivos se validan en piloto; no se imponen valores arbitrarios sin justificación de muestra, variabilidad y costo del error.
Proporción de afirmaciones respaldadas por el corpus autorizado de Vertex AI Search. Objetivo operativo en rutas reguladas: 100 %.
Dispersión de significados entre múltiples muestras. Se mantiene acotada para evitar rigidez sin caer en generación no controlada.
Ruta principal de clasificación con Gemini Flash + recuperación Vector Search. Objetivo de diseño: por debajo de 400 ms en p95.
Frecuencia con la que el sistema reconoce límites y deriva correctamente.
Respuestas que diagnostican o prescriben fuera de alcance. Objetivo: cero.
Estado operativo actual. 0 = sin restricciones adicionales activas.
Desviaciones detectadas respecto de la línea base bajo condiciones constantes.
Proporción de afirmaciones respaldadas por la fuente adecuada.
Correspondencia entre la confianza expresada y el acierto real.
Alineación entre respuesta y corpus autorizado, sin copia indebida.
Estabilidad del perfil de comportamiento bajo condiciones constantes.
Cambio producido por una intervención de una sola capa.
Retorno hacia la línea base tras restaurar la configuración.
Infraestructura
La arquitectura está diseñada para el programa Google Cloud for Startups (Start Tier / AI Track). Utiliza servicios gestionados de Vertex AI, cómputo serverless y estado persistente, minimizando la superficie operativa y maximizando la trazabilidad.
| Capa | Servicio GCP | Rol en NodesMed |
|---|---|---|
| Orquestación e inferencia | Vertex AI (Gemini Flash / Pro) | Clasificación y triaje rápido (Flash); auditoría estructural y razonamiento (Pro) |
| Base de conocimiento clínico (RAG) | Vertex AI Search + Vector Search | Recuperación sobre corpus de literatura médica y protocolos clínicos autorizados y versionados |
| Motor de observabilidad (PAD-ML) | Cloud Run | Detección de deriva, evaluación determinista, intervención de capa única y gestión de contención |
| API de backend | Cloud Run (Python / FastAPI) | Orquestación de sesiones, aplicación de políticas, registro de auditoría |
| Estado y sesiones | Cloud Firestore + Memorystore (Redis) | Estado conversacional, banderas de contención, instantáneas para rollback |
| Derivación segura (HITL) | Puertas HITL + Cloud Functions / Pub/Sub | Escalamiento obligatorio a humanos ante banderas rojas y notificación de incidentes |
Gobernanza
La seguridad en salud digital no se reduce a un modelo “bien entrenado”. Requiere propósito documentado, límites claros, fuentes trazables, minimización de datos, supervisión humana y procedimientos de incidente.
La IA en NodesMed es una herramienta de apoyo a la educación y a la decisión; nunca sustituye el criterio del médico cirujano ni del profesional de salud tratante.
Esta regla se aplica de forma transversal: en el diseño de KAI, en las rúbricas de PAD-ML, en los mensajes de derivación y en los disclaimers visibles para el usuario final.
NodesMed está diseñado como infraestructura de seguridad y navegación clínica para organizaciones que necesitan desplegar agentes de lenguaje con observabilidad real, contención de deriva y supervisión humana formal. Solicita acceso a la Consola de Triaje en versión beta o revisa la documentación de arquitectura completa para el proceso de Google Cloud for Startups.