Mapear a OMOP lo que no encaja: medicación, escalas y texto libre
Los casos fáciles de OMOP se resuelven solos: un diagnóstico CIE-10 tiene su mapeo a SNOMED y una analítica tiene su LOINC. El trabajo real empieza en lo que no encaja, y ahí las decisiones se toman una vez y se heredan durante años. Estas son cinco situaciones que aparecen en casi todo proyecto español y la postura que defendemos en cada una.
El tronco CIE-10 mapea bien; las extensiones nacionales, a mano
El problema no es el analito, son las unidades y los cualitativos
RxNorm no cubre el nomenclátor español
Escalas de enfermería y valoraciones sin concepto estándar
Texto libre: no se mapea, se procesa y se marca como extraído
El principio del que salen las cinco respuestas
Antes de los casos concretos, la regla que aplicamos y que explica todas las
decisiones de abajo: el dato de origen nunca se pierde y el mapeo nunca se
inventa. El modelo común guarda siempre el valor original en su campo
_source_value y el _source_concept_id correspondiente. Cuando no existe un
concepto estándar adecuado, el campo estándar queda en 0.
Un 0 es información, no un fallo. Dice “esto no tiene equivalencia y lo
sabemos”. Lo que sí es un fallo es colocar ahí el concepto más parecido para
que la cifra de cobertura quede bonita: eso convierte un dato ausente en un
dato incorrecto, que es mucho peor porque ya no se puede detectar.
1 · Medicación: RxNorm no conoce el nomenclátor español
Es el caso más incómodo. El vocabulario estándar del dominio Drug es RxNorm, construido sobre el mercado estadounidense. Los medicamentos españoles, con sus códigos nacionales y sus presentaciones propias, no están ahí. RxNorm Extension cubre parte del hueco, pero no todo, y la correspondencia entre una presentación comercial española y un concepto de ingrediente o producto clínico rara vez es uno a uno.
Nuestra postura. Mapear a nivel de ingrediente y forma farmacéutica, no de presentación comercial, salvo que la pregunta de investigación exija esa granularidad. La mayoría de los estudios que se hacen con estos datos preguntan por exposición a un principio activo, no por el envase concreto. Ese mapeo es estable, existe, y se puede validar.
Y cuando hace falta la presentación exacta —estudios de intercambiabilidad,
farmacovigilancia de un lote— se conserva el código nacional en
drug_source_value y se documenta que ese análisis requiere volver al origen.
Es más honesto que fabricar un concepto que no existe.
Usar ATC como puente es tentador y a veces inevitable, pero conviene saber lo que se pierde: ATC clasifica, no identifica, y dos productos con el mismo código ATC pueden no ser equivalentes clínicamente.
2 · CIE-10-ES: las extensiones nacionales no tienen mapeo oficial
Los mapeos de CIE-10-CM a SNOMED que distribuye OHDSI cubren bien el tronco común, pero las versiones nacionales añaden códigos propios. En España, además, conviven históricos en CIE-9-MC en sistemas que llevan décadas funcionando.
Nuestra postura. Tratar la extensión nacional como un vocabulario de origen más y construir su tabla de equivalencias explícita, revisada por perfil clínico, no por el equipo técnico en solitario. Es trabajo manual y no hay atajo: son unos cientos de códigos, no decenas de miles, y se hace una vez.
Lo que no hacemos es mapear por descripción textual automática. La similitud de cadena entre “otras formas de…” lleva a errores que nadie detecta después. Herramientas como Usagi sirven para proponer candidatos, y ese es su papel: proponer. La decisión la firma una persona.
3 · Episodios: el concepto español no encaja con visit_occurrence
visit_occurrence modela contactos asistenciales: consulta, urgencias, ingreso.
El episodio tal como se entiende en muchos hospitales españoles —un proceso que
agrupa contactos a lo largo del tiempo, a veces meses— no es eso. Forzarlo
produce visitas de duración absurda o pérdida de la agrupación.
Nuestra postura. Modelar los contactos en visit_occurrence, el detalle
intraingreso en visit_detail y el episodio como tal en episode y
episode_event, que es exactamente para lo que se añadieron esas tablas. La
tentación de meterlo todo en visitas viene de que muchas herramientas del
ecosistema aún no explotan episode; ese es un argumento para adaptar la
herramienta, no para deformar el dato.
4 · Escalas de enfermería: Barthel, Braden, Norton
Aparecen en todos los sistemas españoles, tienen valor clínico enorme y su representación en vocabularios estándar es desigual. Algunas escalas tienen concepto LOINC; otras solo tienen el total, no los ítems; otras no tienen nada.
Nuestra postura. Mapear el resultado total cuando existe concepto, y
conservar los ítems individuales como observaciones con observation_concept_id
en 0 y su observation_source_value completo. Esto permite dos cosas:
consultar el total desde el día uno y recuperar el detalle si algún día aparece
un concepto adecuado o si un estudio concreto lo necesita.
Y proponerlo. Si una escala de uso masivo en un país no tiene representación estándar, eso es material para llevar al foro de la comunidad, no para resolverlo en silencio en cada organización por separado.
5 · Texto libre: la tabla NOTE no es un cajón de sastre
Informes de alta, evolutivos, hojas de enfermería. En OMOP van a note, y lo
que se extrae de ellos, a note_nlp. La trampa es tratar note_nlp como si
fuera equivalente a un dato estructurado de origen.
Nuestra postura. Todo lo extraído por procesamiento de lenguaje va marcado como tal, con el fragmento de origen y el método que lo produjo, y no se mezcla con lo registrado estructuradamente salvo que un análisis lo pida de forma explícita y consciente. Un diagnóstico extraído de un texto y uno codificado por el facultativo no tienen la misma fiabilidad, y un estudio que los suma sin distinguirlos está midiendo dos cosas distintas.
Lo que publicamos con cada mapeo
Tres artefactos, siempre:
La tabla de equivalencias, versionada, con quién decidió cada línea y en qué fecha. Un mapeo sin autoría no se puede revisar.
La cobertura por dominio, con el porcentaje de registros que quedan en 0
en cada uno. Sin esa cifra, cualquier análisis posterior parte de una base
desconocida.
Las decisiones discutibles, escritas. Las cinco de este artículo lo son: otro equipo podría resolverlas de otra manera con buenos argumentos. Lo que no es defendible es que la decisión no esté escrita en ningún sitio y haya que deducirla del código tres años después.
Una invitación
Estas posturas están abiertas a discusión, y el sitio natural para discutirlas son los foros de OHDSI, donde estos casos se debaten con gente que los ha resuelto de otras formas. Si trabajas con datos sanitarios españoles y has llegado a conclusiones distintas —sobre todo en medicación, que es donde menos consenso hay— nos interesa conocerlas.
- OHDSI · Common Data Model
- The Book of OHDSI
- Athena · navegador de vocabularios estandarizados
- Usagi · herramienta de mapeo a conceptos estándar
- Foros de la comunidad OHDSI
Este texto resume normativa vigente en su fecha de publicación y no sustituye a asesoramiento jurídico. Si vas a tomar una decisión a partir de él, contrasta con la fuente original.
AI Act: qué cambia el 2 de agosto de 2026 para la IA sanitaria
El Reglamento europeo de IA aplica sus obligaciones de alto riesgo desde el 2 de agosto de 2026. Qué sistemas entran, qué exige a hospitales que los usan y por qué el software sanitario tiene un año más.
EHDS: el calendario del Espacio Europeo de Datos Sanitarios
El Reglamento del Espacio Europeo de Datos Sanitarios obliga a que la historia clínica sea intercambiable y a ceder datos para uso secundario. Qué plazos hay y qué conviene preparar desde ahora.