Ingeniero de Inteligencia Artificial
hace 5 días
Madrid
ppEstamos buscando un/a Ingeniero/a Senior Full-Stack dedicado/a al desarrollo de nuestra plataforma MarIA: una aplicación web que permite a los profesionales de la salud configurar, supervisar y gestionar nuestro agente de IA de voz a voz en tiempo real. /p pTrabajará con nuestro equipo central, asegurándose de que la aplicación se adapte sin problemas a decenas de miles de conversaciones simultáneas de IA. /p h3Funciones /h3 ul liDiseñar y mantener el harness de nuestros agentes clínicos: bucle agéntico, registro de tools, gestión del presupuesto de tokens, condiciones de parada, compactación de contexto y política de reintentos. /li liDefinir la topología multiagente adecuada a cada problema (subagentes con contexto aislado, skills, handoffs, router) y justificar por qué esa y no otra. /li liConstruir loops de planificación de horizonte largo con estado persistido en filesystem: ficheros de plan, checkpoints de reanudación y puntos de control humano antes de acciones irreversibles sobre datos de paciente. /li liEmpaquetar conocimiento procedimental clínico como Skills (SKILL.md, divulgación progresiva) y capacidades externas como servidores MCP propios sobre HIS/EHR, con permisos por nivel de riesgo (lectura / escritura / destructivo). /li liMontar y hacer crecer nuestra capa de evaluación de agentes: datasets de regresión, LLM-as-a-judge con criterios auditables, evals automáticas que bloqueen cambios en el harness y evals de seguridad del propio harness (inyección indirecta vía contenido clínico, timeouts, sobre-uso de tools), usando LangSmith, Braintrust, Langfuse, promptfoo, DeepEval, Inspect o similares. /li liIntegrar de forma segura nuestros sistemas con hospitales y plataformas de historias clínicas electrónicas (EHR), incluyendo el modelo de permisos y trazabilidad de lo que el agente lee y escribe. /li liInstrumentar los agentes con trazas por span (Langsmith, OpenTelemetry, Sentry, o similares): coste, latencia por tool, tasa de éxito por paso, calidad de transcripción y hit rate de cache de prompt. /li liDesarrollar y evolucionar la aplicación web sobre la que los profesionales de salud interactúan con nuestros agentes, con criterio para dirigir y revisar código generado. /li liMejorar la infraestructura del backend y automatizar despliegues con Docker y GitHub Actions, cuidando la experiencia del desarrollador y los entornos aislados donde corren los agentes. /li liParticipar en decisiones clave de arquitectura: qué se resuelve con modelo, qué con harness determinista y qué con código plano. /li /ul h3Requisitos mínimos /h3 ul libLo que buscamos: /b /li li3+ años desarrollando software en producción, con al menos 1 año llevando sistemas basados en LLM más allá de la demo: no wrappers de chat, sino sistemas con tools, estado y fallos reales. /li liExperiencia demostrable diseñando tool interfaces para agentes: esquemas tipados, validación de entradas, idempotencia y errores que el modelo pueda usar para corregirse. /li liEntendimiento profundo de gestión de contexto: qué entra en la ventana y por qué, compactación, memoria externa en filesystem, ordenación cache‑aware. /li liConocimiento de MCP a nivel de implementación, no de usuario: haber escrito un servidor, entender tools/resources/prompts, transportes y autorización. /li liMentalidad de evaluación antes que de intuición: experiencia definiendo métricas y datasets de evaluación para sistemas no deterministas con LangSmith, Braintrust, Langfuse, Ragas, DeepEval, OpenAI Evals o similares. Si no sabes medir si un cambio mejoró algo, no es un cambio. /li liDominio de Python y TypeScript, y capacidad de leer con criterio código que no has escrito —propio o generado— para revisarlo y rechazarlo. /li liExperiencia diseñando esquemas relacionales y flujos de autenticación y autorización (IE: Supabase). /li liCriterio de seguridad en sistemas agénticos: superficie de inyección indirecta, mínimo privilegio, aislamiento de ejecución, manejo de datos sensibles. /li liConocimientos sólidos de Docker y pipelines de CI. /li liNivel fluido de español e inglés (oral y escrito). /li liResidir en Valencia o Madrid /li /ul pExcelente comunicación y alto sentido de responsabilidad y autonomía. /p h3Será un plus si: /h3 ul liExperiencia con fine‑tuning aplicado (LoRA/QLoRA, SFT, destilación) y, sobre todo, evidencia de haber evaluado si merecía la pena frente a ajustar el harness. /li liExperiencia sirviendo inferencia propia: vLLM, SGLang, TensorRT‑LLM o similares; batching continuo, cuantización, dimensionado de GPU y coste por token frente a API. /li liExperiencia con ASR y modelos de voz aplicados a dominio clínico. /li liConocimiento de comunicaciones en tiempo real (WebSockets, WebRTC) y APIs de streaming. /li liContribuciones públicas: servidores MCP, skills, herramientas de agentes, papers o benchmarks. /li liConocimiento del sector salud y de normativas como GDPR, MDR o HIPAA. /li /ul /p #J-18808-Ljbffr