Saltar al contenido

Mapear a OMOP lo que no encaja: medicación, escalas y texto libre

Los casos fáciles de OMOP se resuelven solos: un diagnóstico CIE-10 tiene su mapeo a SNOMED y una analítica tiene su LOINC. El trabajo real empieza en lo que no encaja, y ahí las decisiones se toman una vez y se heredan durante años. Estas son cinco situaciones que aparecen en casi todo proyecto español y la postura que defendemos en cada una.

Publicado 9 min
Dónde se atasca el mapeo, por dominio Patrón habitual · no es una medición
Condition SNOMED
4 % sin equivalencia

El tronco CIE-10 mapea bien; las extensiones nacionales, a mano

Measurement LOINC
7 % sin equivalencia

El problema no es el analito, son las unidades y los cualitativos

Drug RxNorm
21 % sin equivalencia

RxNorm no cubre el nomenclátor español

Observation Varios
23 % sin equivalencia

Escalas de enfermería y valoraciones sin concepto estándar

Note
100 % sin equivalencia

Texto libre: no se mapea, se procesa y se marca como extraído

Mapeo directo Requiere tabla propia Sin concepto estándar

El principio del que salen las cinco respuestas

Antes de los casos concretos, la regla que aplicamos y que explica todas las decisiones de abajo: el dato de origen nunca se pierde y el mapeo nunca se inventa. El modelo común guarda siempre el valor original en su campo _source_value y el _source_concept_id correspondiente. Cuando no existe un concepto estándar adecuado, el campo estándar queda en 0.

Un 0 es información, no un fallo. Dice “esto no tiene equivalencia y lo sabemos”. Lo que sí es un fallo es colocar ahí el concepto más parecido para que la cifra de cobertura quede bonita: eso convierte un dato ausente en un dato incorrecto, que es mucho peor porque ya no se puede detectar.

1 · Medicación: RxNorm no conoce el nomenclátor español

Es el caso más incómodo. El vocabulario estándar del dominio Drug es RxNorm, construido sobre el mercado estadounidense. Los medicamentos españoles, con sus códigos nacionales y sus presentaciones propias, no están ahí. RxNorm Extension cubre parte del hueco, pero no todo, y la correspondencia entre una presentación comercial española y un concepto de ingrediente o producto clínico rara vez es uno a uno.

Nuestra postura. Mapear a nivel de ingrediente y forma farmacéutica, no de presentación comercial, salvo que la pregunta de investigación exija esa granularidad. La mayoría de los estudios que se hacen con estos datos preguntan por exposición a un principio activo, no por el envase concreto. Ese mapeo es estable, existe, y se puede validar.

Y cuando hace falta la presentación exacta —estudios de intercambiabilidad, farmacovigilancia de un lote— se conserva el código nacional en drug_source_value y se documenta que ese análisis requiere volver al origen. Es más honesto que fabricar un concepto que no existe.

Usar ATC como puente es tentador y a veces inevitable, pero conviene saber lo que se pierde: ATC clasifica, no identifica, y dos productos con el mismo código ATC pueden no ser equivalentes clínicamente.

2 · CIE-10-ES: las extensiones nacionales no tienen mapeo oficial

Los mapeos de CIE-10-CM a SNOMED que distribuye OHDSI cubren bien el tronco común, pero las versiones nacionales añaden códigos propios. En España, además, conviven históricos en CIE-9-MC en sistemas que llevan décadas funcionando.

Nuestra postura. Tratar la extensión nacional como un vocabulario de origen más y construir su tabla de equivalencias explícita, revisada por perfil clínico, no por el equipo técnico en solitario. Es trabajo manual y no hay atajo: son unos cientos de códigos, no decenas de miles, y se hace una vez.

Lo que no hacemos es mapear por descripción textual automática. La similitud de cadena entre “otras formas de…” lleva a errores que nadie detecta después. Herramientas como Usagi sirven para proponer candidatos, y ese es su papel: proponer. La decisión la firma una persona.

3 · Episodios: el concepto español no encaja con visit_occurrence

visit_occurrence modela contactos asistenciales: consulta, urgencias, ingreso. El episodio tal como se entiende en muchos hospitales españoles —un proceso que agrupa contactos a lo largo del tiempo, a veces meses— no es eso. Forzarlo produce visitas de duración absurda o pérdida de la agrupación.

Nuestra postura. Modelar los contactos en visit_occurrence, el detalle intraingreso en visit_detail y el episodio como tal en episode y episode_event, que es exactamente para lo que se añadieron esas tablas. La tentación de meterlo todo en visitas viene de que muchas herramientas del ecosistema aún no explotan episode; ese es un argumento para adaptar la herramienta, no para deformar el dato.

4 · Escalas de enfermería: Barthel, Braden, Norton

Aparecen en todos los sistemas españoles, tienen valor clínico enorme y su representación en vocabularios estándar es desigual. Algunas escalas tienen concepto LOINC; otras solo tienen el total, no los ítems; otras no tienen nada.

Nuestra postura. Mapear el resultado total cuando existe concepto, y conservar los ítems individuales como observaciones con observation_concept_id en 0 y su observation_source_value completo. Esto permite dos cosas: consultar el total desde el día uno y recuperar el detalle si algún día aparece un concepto adecuado o si un estudio concreto lo necesita.

Y proponerlo. Si una escala de uso masivo en un país no tiene representación estándar, eso es material para llevar al foro de la comunidad, no para resolverlo en silencio en cada organización por separado.

5 · Texto libre: la tabla NOTE no es un cajón de sastre

Informes de alta, evolutivos, hojas de enfermería. En OMOP van a note, y lo que se extrae de ellos, a note_nlp. La trampa es tratar note_nlp como si fuera equivalente a un dato estructurado de origen.

Nuestra postura. Todo lo extraído por procesamiento de lenguaje va marcado como tal, con el fragmento de origen y el método que lo produjo, y no se mezcla con lo registrado estructuradamente salvo que un análisis lo pida de forma explícita y consciente. Un diagnóstico extraído de un texto y uno codificado por el facultativo no tienen la misma fiabilidad, y un estudio que los suma sin distinguirlos está midiendo dos cosas distintas.

Lo que publicamos con cada mapeo

Tres artefactos, siempre:

La tabla de equivalencias, versionada, con quién decidió cada línea y en qué fecha. Un mapeo sin autoría no se puede revisar.

La cobertura por dominio, con el porcentaje de registros que quedan en 0 en cada uno. Sin esa cifra, cualquier análisis posterior parte de una base desconocida.

Las decisiones discutibles, escritas. Las cinco de este artículo lo son: otro equipo podría resolverlas de otra manera con buenos argumentos. Lo que no es defendible es que la decisión no esté escrita en ningún sitio y haya que deducirla del código tres años después.

Una invitación

Estas posturas están abiertas a discusión, y el sitio natural para discutirlas son los foros de OHDSI, donde estos casos se debaten con gente que los ha resuelto de otras formas. Si trabajas con datos sanitarios españoles y has llegado a conclusiones distintas —sobre todo en medicación, que es donde menos consenso hay— nos interesa conocerlas.

Fuentes

Este texto resume normativa vigente en su fecha de publicación y no sustituye a asesoramiento jurídico. Si vas a tomar una decisión a partir de él, contrasta con la fuente original.