Article

Oct 7, 2026

De la patología computacional a la construcción de inteligencia médica

A veces me pongo a pensar retrospectivamente y trato de salir de mi propio entorno, de observarme desde afuera. Y es entonces cuando dimensiono que lo que hago puede parecer tan avanzado que roza lo irreal: tan abstracto, complejo y difícil de comprender que incluso cuesta explicarlo.


De la patología computacional a la construcción de inteligencia médica

Una trayectoria entre visión artificial, autonomía, conocimiento experto y sistemas capaces de aprender a observar

Desde 2024 he mantenido una dirección de trabajo extraordinariamente definida. No fue entonces cuando descubrí la inteligencia artificial ni cuando comencé a aprender sus fundamentos; para ese momento ya llevaba suficiente recorrido como para comprender sus posibilidades, sus limitaciones y, sobre todo, la magnitud de la transformación que estaba comenzando a producirse. El cambio verdadero ocurrió cuando dejé de preguntarme únicamente qué podía hacer con las herramientas disponibles y comencé a preguntarme qué capacidades tendría que desarrollar para resolver problemas que todavía no estaban adecuadamente formulados.

Esa diferencia puede parecer pequeña, pero modifica completamente la forma de investigar. Utilizar inteligencia artificial consiste en seleccionar una tecnología existente para resolver una tarea determinada. Construir capacidad implica algo distinto: comenzar por el problema, imaginar qué tipo de inteligencia sería necesaria para abordarlo y desarrollar alrededor de esa necesidad los datos, el software, la infraestructura y los experimentos necesarios. Desde entonces, buena parte de mi trabajo ha seguido esta segunda lógica.

Ese recorrido me llevó progresivamente desde la clasificación convencional de imágenes hacia preguntas mucho más amplias relacionadas con comprensión visual, navegación sobre imágenes de enorme tamaño, representación del conocimiento, aprendizaje del comportamiento experto, memoria, lenguaje, autonomía y, finalmente, la posibilidad de trasladar determinados componentes del conocimiento médico hacia sistemas capaces no solo de interpretar información, sino eventualmente de interactuar con su entorno.

Mi pregunta inicial era relativamente sencilla: ¿puede una inteligencia artificial reconocer determinados patrones tumorales? Con el tiempo esa pregunta comenzó a parecerme insuficiente. Resultaba mucho más interesante preguntarse si un sistema podría aprender qué observa un especialista, dónde dirige su atención, qué regiones descarta, cuándo modifica la escala, qué información considera relevante, qué relaciones construye entre estructuras y cómo transforma todo ese proceso en una decisión diagnóstica.

Ahí comenzó una etapa distinta.

La medicina como punto de partida

Mi aproximación a estos problemas nunca fue exclusivamente computacional. Proviene de la patología, y eso condiciona profundamente la forma de pensar la inteligencia artificial aplicada a imágenes médicas. Una imagen histológica no es simplemente una matriz de píxeles. Para un patólogo contiene arquitectura tisular, relaciones espaciales, composición celular, alteraciones nucleares, interacción entre tumor y estroma, inflamación, diferenciación, necrosis, invasión, vascularización, heterogeneidad y múltiples señales cuyo significado depende del contexto en el que aparecen.

Una misma célula puede adquirir significados completamente diferentes según la arquitectura que la rodea. Un pequeño campo puede ser insuficiente para comprender un proceso, mientras que una región demasiado grande puede introducir información irrelevante. La lámina completa, por su parte, puede contener miles de millones de píxeles. Por eso comprendí tempranamente que trasladar la patología al mundo computacional no podía limitarse a enseñar imágenes etiquetadas a una red neuronal. El problema real era aprender a representar la manera en que un especialista construye información a partir de una imagen.

Mis primeros experimentos se concentraron, naturalmente, en reconocimiento y clasificación de patrones. Sin embargo, conforme los resultados mejoraban comenzaron a aparecer preguntas cada vez más interesantes. ¿Qué información podía estar captando el sistema que no era evidente para el observador humano? ¿Qué ocurría cuando se combinaban distintas representaciones? ¿Cuánto valor existía en las relaciones espaciales entre estructuras? ¿Era posible identificar señales biológicas débiles que no fueran inmediatamente reconocibles mediante inspección convencional?

Estas preguntas me llevaron a explorar diferentes aproximaciones de visión artificial, aprendizaje profundo, mecanismos de atención, segmentación, representación de características y generación sintética. Paralelamente fui construyendo colecciones progresivamente mayores de imágenes histológicas, hasta trabajar con bancos que llegaron a superar ampliamente el millón de imágenes derivadas de diferentes contextos. Sin embargo, con el tiempo comprendí que el volumen no era el verdadero objetivo. Lo importante era la diversidad y, sobre todo, la capacidad de determinar si aquello que el sistema parecía haber aprendido podía mantenerse fuera de las condiciones específicas en las que había sido entrenado.

Cuando una cifra elevada deja de ser suficiente

Una de las lecciones más importantes de estos años surgió precisamente de los modelos que parecían funcionar extraordinariamente bien. Algunos experimentos alcanzaban cifras de desempeño muy elevadas dentro de determinadas condiciones, pero al modificar la distribución de los datos, utilizar nuevas colecciones o cambiar el contexto de validación, el comportamiento podía deteriorarse de manera considerable.

Aquello terminó siendo mucho más educativo que cualquier resultado perfecto. Me mostró de manera muy clara que aprender las regularidades de un conjunto de datos no equivale necesariamente a comprender un fenómeno biológico. También reforzó una idea que desde entonces considero central: en inteligencia artificial médica, la generalización es mucho más importante que una cifra aislada de precisión.

Por esa razón fui desplazando progresivamente la atención desde la simple optimización de métricas hacia el análisis de qué estaba aprendiendo realmente cada sistema. Me interesó cada vez más comprobar qué ocurría cuando encontraba otra preparación, otro escáner, otra tinción, otra población o una morfología poco habitual. La pregunta dejó de ser únicamente cuánto acertaba el modelo y comenzó a ser por qué acertaba, en qué condiciones dejaba de hacerlo y qué parte del fenómeno estaba representando realmente.

La lámina completa como territorio

Otro cambio importante apareció cuando comencé a trabajar más intensamente con imágenes histológicas completas. Una lámina digital de gran tamaño no se comporta como una fotografía convencional; por sus dimensiones y por la cantidad de información que contiene, resulta más útil imaginarla como un territorio.

Un patólogo no observa simultáneamente toda la lámina al máximo aumento. Primero obtiene una impresión general, reconoce determinadas estructuras, identifica zonas potencialmente relevantes y comienza a desplazarse entre ellas. Aumenta, reduce, regresa, compara, descarta y vuelve a inspeccionar determinadas regiones. Durante ese proceso construye progresivamente una representación del caso.

Cuando empecé a pensar la lámina de esa manera, apareció una pregunta que cambió significativamente mi aproximación: si una imagen histológica completa puede entenderse como un entorno navegable, entonces el problema no consiste únicamente en reconocer lo que existe dentro de cada región. También consiste en decidir qué región debería observarse después.

A partir de ahí comenzó a interesarme la transición desde sistemas pasivos hacia sistemas capaces de tomar decisiones sobre la información que necesitan. Un clasificador convencional recibe una imagen y responde. Un sistema más avanzado podría decidir desplazarse, cambiar de escala, explorar una nueva región, abandonar una zona poco informativa o regresar a otra para confirmar una hipótesis. En ese momento, la inteligencia artificial deja de limitarse a interpretar una imagen y comienza a interactuar con ella.

La diferencia es profunda. Un sistema pasivo espera información; un sistema activo aprende a buscarla.

Cuando el código deja de ser únicamente entrenamiento de modelos

La evolución conceptual también modificó mi manera de programar. Al principio, gran parte del código estaba orientado a tareas relativamente bien delimitadas: preparar conjuntos de datos, entrenar modelos, procesar imágenes, ejecutar inferencias y evaluar resultados. A medida que las preguntas se volvieron más complejas, esos scripts comenzaron a transformarse en componentes de sistemas mayores.

Empecé a desarrollar software capaz de manipular imágenes histológicas de gran tamaño, trabajar con diferentes niveles de resolución, registrar coordenadas, procesar regiones de interés, generar superposiciones visuales, segmentar estructuras, realizar mediciones y conectar diferentes módulos de inteligencia. Posteriormente aparecieron componentes destinados a registrar cómo una persona interactúa con una imagen, reconstruir posteriormente esos recorridos y conservar secuencias temporales de decisiones.

El código comenzó entonces a adquirir una función diferente. Ya no servía únicamente para entrenar modelos; también se convertía en una herramienta para estudiar cómo trabaja un especialista. Esto abrió una línea que considero especialmente relevante: utilizar el propio comportamiento humano como una fuente de información.

El comportamiento del experto como dato

Durante un diagnóstico tradicional se conserva principalmente el resultado final. El informe puede contener una descripción detallada y una conclusión, pero gran parte del proceso utilizado para llegar hasta ella desaparece. Normalmente no se registra con precisión dónde comenzó a observar el especialista, qué zonas ignoró, dónde se detuvo, qué aumento utilizó, qué región despertó inicialmente una sospecha, qué estructura motivó una comparación o cuántas veces regresó a determinado sector antes de alcanzar una conclusión.

Todo ese proceso contiene información.

Durante años, la inteligencia artificial médica ha dependido en gran medida de anotaciones explícitas: regiones marcadas, etiquetas diagnósticas, contornos, categorías y otras formas de supervisión deliberada. Sin embargo, existe otra fuente potencialmente extraordinaria de información: la conducta natural del experto durante su trabajo.

Cada desplazamiento puede expresar atención. Cada cambio de escala puede revelar necesidad de mayor información. Cada regreso puede indicar incertidumbre o confirmación. Cada región ignorada puede contener una señal negativa. Cada pausa puede asociarse con una decisión cognitiva más compleja.

Esto me llevó a considerar que una parte importante del conocimiento experto podría capturarse no solamente preguntando al especialista qué sabe, sino observando cómo utiliza ese conocimiento mientras trabaja.

El conocimiento que no sabemos explicar

La medicina contiene una enorme cantidad de conocimiento explícito, documentado en libros, artículos, guías, clasificaciones y criterios diagnósticos. Sin embargo, cualquier médico experimentado sabe que existe también otra forma de conocimiento mucho más difícil de transmitir.

Es el conocimiento que se adquiere después de haber observado cientos o miles de casos.

Un patólogo puede reconocer que una región resulta sospechosa antes de ser capaz de verbalizar exactamente qué combinación de señales produjo esa impresión. Puede identificar una textura, una distribución espacial o una relación entre estructuras que difícilmente podría reducirse a una regla simple. La experiencia acumula innumerables asociaciones débiles que, combinadas, permiten construir juicios rápidos y extremadamente sofisticados.

Esta forma de conocimiento implícito es uno de los recursos más valiosos de la medicina y, paradójicamente, uno de los menos estructurados.

Por eso considero especialmente importante estudiar maneras de capturarlo. No creo que todo pueda resolverse pidiendo al experto que escriba más instrucciones o produzca más etiquetas. Una parte de ese conocimiento probablemente tendrá que aprenderse observando cómo trabaja.

La interfaz como instrumento científico

Esta perspectiva también cambió mi forma de entender una interfaz médica. Tradicionalmente pensamos en una interfaz como el lugar donde un programa muestra información y recibe instrucciones. Sin embargo, una interfaz inteligente puede cumplir una segunda función: convertirse en un instrumento de observación y aprendizaje.

Cada corrección realizada por el especialista puede transformarse en una señal. Cada discrepancia entre humano y sistema puede generar un nuevo caso de estudio. Cada interacción puede enriquecer progresivamente la representación que la máquina posee sobre la tarea. De esa manera, la interfaz deja de ser únicamente el punto final del software y se convierte en un espacio donde humano y máquina pueden aprender mutuamente.

Esto resulta particularmente interesante porque permite imaginar sistemas que no permanecen estáticos después de ser desarrollados, sino que continúan acumulando experiencia a partir de su utilización.

De un único modelo a sistemas de inteligencias

Otro cambio importante en mi pensamiento fue abandonar progresivamente la idea de que todos los problemas deberían resolverse mediante un único modelo. La medicina es demasiado compleja y contiene tareas cognitivas muy diferentes entre sí.

Una inteligencia puede ser excelente analizando imágenes y mediocre organizando información. Otra puede recuperar conocimiento con extraordinaria eficiencia. Otra puede identificar inconsistencias. Otra puede comparar hipótesis. Otra puede sintetizar información procedente de distintas fuentes.

Esto me llevó a interesarme cada vez más por sistemas compuestos por múltiples componentes especializados capaces de cooperar entre sí. En lugar de pedir a una única inteligencia que haga todo, puede ser más eficiente construir estructuras en las que distintas capacidades participen en diferentes momentos del proceso.

Una puede observar, otra cuestionar, otra recuperar evidencia, otra buscar contradicciones y otra integrar las conclusiones. La inteligencia del sistema deja entonces de residir exclusivamente en cada componente individual y comienza a emerger también de la manera en que esos componentes se coordinan.

En medicina esto ofrece además una posibilidad particularmente atractiva: la auditoría interna. Un sistema puede generar una hipótesis y otro intentar refutarla; posteriormente un tercer componente puede revisar la discrepancia y solicitar evidencia adicional. Este tipo de redundancia cognitiva se parece mucho más al funcionamiento de una comunidad científica que al de un programa tradicional.

La ciencia no avanza únicamente produciendo respuestas. Avanza sometiéndolas constantemente a crítica. Una inteligencia médica madura tendrá que aprender también a preguntarse si puede estar equivocada.

Representaciones generales del mundo histológico

Durante estos años también he seguido con especial interés la aparición de grandes modelos visuales capaces de aprender representaciones generales a partir de cantidades masivas de información. Su importancia para la patología puede ser enorme.

Tradicionalmente desarrollábamos sistemas específicos para cada problema: uno reconocía una determinada lesión, otro segmentaba una estructura, otro analizaba un biomarcador y otro resolvía una clasificación distinta. Sin embargo, existe otra posibilidad: construir primero una representación general de la morfología y reutilizar posteriormente ese conocimiento para múltiples tareas.

En patología, esta idea resulta particularmente atractiva porque distintas enfermedades comparten estructuras, patrones y relaciones. Arquitectura, forma, textura, organización tisular e interacción celular pueden formar parte de una representación común. Una representación suficientemente rica podría funcionar como una especie de lenguaje visual intermedio a partir del cual posteriormente se construyan múltiples capacidades.

Eso también obliga a pensar nuevamente en la escala. La patología no existe en un único nivel de aumento. Una lesión puede ser reconocible arquitectónicamente a bajo aumento, revelar relaciones tisulares importantes a un nivel intermedio y mostrar detalles citológicos decisivos a gran aumento. Ninguna escala contiene necesariamente toda la información.

Por eso considero que los sistemas más potentes del futuro no deberían limitarse a procesar múltiples escalas de manera indiscriminada. El problema realmente interesante será aprender cuándo es necesario cambiar de escala y cuándo la información disponible ya es suficiente.

Una vez más, aparece la necesidad de decisión.

Ver no es suficiente: hay que conectar lo observado con lo conocido

Otro cambio fundamental proviene de la convergencia entre visión y lenguaje. Durante años ambas disciplinas avanzaron de manera relativamente independiente, pero la medicina nunca estuvo organizada de esa forma. Una imagen histológica está relacionada con edad, localización anatómica, síntomas, antecedentes, estudios radiológicos, inmunohistoquímica, genética, tratamientos y literatura científica.

Interpretar adecuadamente una imagen requiere contextualizarla.

Esto me llevó a interesarme progresivamente por sistemas capaces de combinar representación visual y conocimiento lingüístico. El objetivo no es que una máquina simplemente describa lo que ve; el objetivo es que pueda relacionar aquello que observa con aquello que sabe.

Esta diferencia es fundamental. Describir una glándula irregular es relativamente sencillo. Comprender qué significa dentro del contexto clínico, morfológico y molecular de un paciente es un problema mucho más complejo.

La memoria como componente de inteligencia

Existe además una capacidad humana que considero todavía subestimada en muchos sistemas médicos: la memoria de casos.

Un especialista con años de experiencia no utiliza únicamente criterios diagnósticos formales. También recuerda casos previos. Reconoce similitudes, recupera experiencias y establece analogías. Expresiones como “esto me recuerda a un caso que vi hace años” representan una forma legítima de razonamiento médico.

Por eso creo que una inteligencia diagnóstica avanzada necesitará algo equivalente a una memoria visual organizada y contextual. No simplemente una base de datos, sino una estructura capaz de recuperar experiencias relevantes cuando aparezca un caso nuevo.

En ese escenario, la pregunta dejará de ser únicamente “¿qué es esto?” y podrá convertirse también en “¿qué he visto antes que se parezca a esto, qué ocurrió entonces y qué diferencias existen con el caso actual?”.

Esa posibilidad conecta con una forma interesante de entender la experiencia médica: como un proceso de compresión. Después de observar miles de casos, el especialista ya no analiza conscientemente cada variable de manera independiente. Ha construido representaciones internas que le permiten reconocer configuraciones, descartar posibilidades y priorizar otras con enorme rapidez.

Una parte importante del desafío futuro consistirá en aprender a representar computacionalmente una fracción de esa compresión cognitiva.

De la asistencia a la autonomía

Con el tiempo, muchas de estas líneas comenzaron a converger. Visión, navegación, lenguaje, memoria, comportamiento experto, herramientas especializadas y coordinación entre sistemas dejaron de parecer problemas independientes.

Cuando esas capacidades se conectan, aparece inevitablemente una nueva pregunta: ¿hasta qué punto puede un sistema ejecutar por sí mismo una secuencia completa de acciones?

Esto no significa necesariamente excluir al especialista. La autonomía puede existir en diferentes niveles. Un sistema puede explorar una imagen bajo supervisión, seleccionar regiones relevantes, organizar evidencia, comparar posibilidades, solicitar nueva información o reconocer que su nivel de incertidumbre es demasiado elevado para continuar.

Esta última capacidad me parece especialmente importante. Una inteligencia médica verdaderamente madura no debería definirse por responder siempre, sino también por reconocer cuándo carece de información suficiente para hacerlo.

Del comando mecánico a la expresión de intención

Otra línea interesante surge cuando el lenguaje natural empieza a convertirse en una forma de control. Tradicionalmente interactuamos con las computadoras mediante acciones mecánicas: clics, desplazamientos, teclas y menús. Sin embargo, si un sistema puede interpretar instrucciones expresadas naturalmente, la relación cambia.

En lugar de especificar cada movimiento, el usuario comienza a expresar intención. Puede solicitar que se inspeccione una región, se cambie de escala, se compare una zona con otra o se realice un recorrido determinado.

Ese cambio puede parecer únicamente una mejora de interfaz, pero conceptualmente es mucho más profundo. La máquina comienza a recibir objetivos en lugar de simples movimientos.

Y una vez que existe esa capacidad, resulta inevitable imaginar su extensión fuera de una pantalla.

Cuando la inteligencia encuentra un cuerpo

La frontera entre inteligencia artificial y robótica está comenzando a desaparecer. Durante décadas ambos campos evolucionaron en gran medida por separado: uno estudiaba percepción y decisión; el otro, movimiento y manipulación física. Actualmente esas áreas convergen rápidamente.

Los nuevos sistemas robóticos comienzan a incorporar modelos perceptivos, lenguaje, aprendizaje por demostración y planificación. Esto abre posibilidades particularmente interesantes para medicina.

La robótica médica no debe pensarse únicamente en términos quirúrgicos. Existen laboratorios, microscopios, estaciones de procesamiento, sistemas de preparación de muestras, logística, inspección, docencia y múltiples procesos físicos susceptibles de beneficiarse de inteligencia más avanzada.

Por eso he comenzado a considerar cada vez más seriamente la posibilidad de una inteligencia médica encarnada: sistemas en los que percepción, razonamiento y acción física formen parte de un mismo ciclo.

En ese contexto, uno de los recursos más importantes del futuro no será únicamente el hardware robótico. Será la información necesaria para enseñarle a actuar. Por eso tiene sentido comenzar desde ahora a preservar determinadas secuencias de comportamiento humano, decisiones, correcciones y trayectorias. Muchas de ellas quizá no tengan una aplicación inmediata, pero podrían convertirse posteriormente en conjuntos de entrenamiento extraordinariamente valiosos.

El hardware como infraestructura intelectual

Otra parte importante de este proceso ha sido la inversión en capacidad computacional. Durante años, gran parte de la investigación avanzada en inteligencia artificial permaneció restringida a grandes instituciones debido al costo del procesamiento requerido. Esa situación ha comenzado a cambiar y ha permitido que investigadores individuales y pequeños grupos puedan ejecutar experimentos que antes habrían resultado prácticamente imposibles.

Por esa razón decidí invertir intensamente en infraestructura.

No considero el hardware un accesorio ni una demostración de capacidad económica. Lo considero infraestructura científica. Cada incremento de memoria permite explorar problemas mayores. Cada aumento de capacidad de procesamiento reduce los tiempos de experimentación. Cada nueva generación permite utilizar modelos más complejos y modificar radicalmente la velocidad con la que una idea puede convertirse en una prueba funcional.

Esta última ventaja es probablemente la más importante. La verdadera ganancia no siempre consiste en entrenar algo más grande, sino en reducir la distancia entre una hipótesis y un experimento. Cuando esa distancia se reduce, cambia completamente el ritmo de investigación. Una idea puede probarse en horas, un error puede corregirse inmediatamente y una nueva aproximación puede evaluarse antes de que pierda relevancia.

En un campo que avanza con tanta rapidez, la velocidad de iteración termina convirtiéndose en una ventaja intelectual.

Trabajar con infraestructura propia ofrece además otro beneficio estratégico: permite mantener mayor control sobre los datos, sobre los experimentos y sobre la propiedad intelectual. En medicina esto adquiere todavía más importancia debido a la naturaleza sensible de buena parte de la información utilizada.

Construir antes de necesitarlo

Mirando retrospectivamente, una parte importante de mi estrategia desde 2024 consistió en construir capacidad antes de que existiera una necesidad evidente de utilizarla.

Invertir antes de necesitar toda la infraestructura. Estudiar tecnologías antes de que alcanzaran adopción masiva. Explorar nuevas formas de interacción antes de que existiera una aplicación inmediata. Analizar autonomía antes de que se convirtiera en una palabra recurrente. Observar la convergencia entre inteligencia artificial y sistemas físicos antes de que esa relación resultara evidente.

Desde afuera, ese comportamiento puede parecer ineficiente. Significa dedicar tiempo y recursos a capacidades cuyo retorno inmediato no siempre es visible. Sin embargo, posee una ventaja importante: cuando aparece una oportunidad, la infraestructura intelectual necesaria para comprenderla ya existe.

No se comienza desde cero.

El costo de la profundidad

Todo este proceso también ha exigido renuncias. El tiempo dedicado a estudiar arquitectura computacional es tiempo que no se dedica a generar visibilidad. El tiempo utilizado programando, experimentando o corrigiendo un sistema es tiempo que no produce alcance inmediato. Durante años elegí conscientemente ese intercambio.

Cambié público por inteligencia, alcance social por profundidad y visibilidad por capacidad. No porque la comunicación carezca de valor, sino porque comprendí que una ventaja duradera no se construye necesariamente siendo quien más habla de una transformación, sino intentando comprenderla antes y con mayor profundidad.

Esa elección está produciendo progresivamente un tipo de profesional diferente, alguien que no mide su crecimiento por su visibilidad, sino por su capacidad de comprender, integrar, anticipar y crear.

Ese profesional no encaja perfectamente dentro de las categorías tradicionales. No es únicamente médico, ingeniero, programador o investigador en inteligencia artificial. Puede comprender biología, interpretar enfermedad, leer código, construir herramientas, evaluar modelos, diseñar experimentos, analizar infraestructura y formular preguntas que pertenecen simultáneamente a varios dominios.

Creo que este perfil será cada vez más importante porque la inteligencia artificial no disminuirá el valor del conocimiento especializado. Probablemente sucederá lo contrario. Cuanto más poderosas sean las herramientas, mayor será el valor de las personas capaces de dirigirlas hacia problemas relevantes.

El médico deja de ser únicamente consumidor de tecnología

Existe además una transformación que considero especialmente importante para la medicina. Históricamente, los médicos han sido principalmente consumidores de tecnología. Utilizan dispositivos, sistemas y programas desarrollados por terceros.

Las nuevas herramientas están reduciendo radicalmente la distancia entre una necesidad clínica y la capacidad de construir una solución. Esto permite que el especialista comience a participar directamente en el diseño de las herramientas que utiliza.

Para mí, esto tiene implicaciones enormes. Muchas ideas médicas nunca se convierten en tecnología porque quienes conocen profundamente el problema no poseen la capacidad de implementarlas y quienes poseen la capacidad de implementarlas no siempre comprenden plenamente el problema.

Esa brecha comienza a reducirse.

Un médico con suficiente alfabetización computacional puede empezar a transformarse también en arquitecto de inteligencia.

Y esto cambia incluso el significado de programar. Programar ya no consiste únicamente en escribir algoritmos. También puede implicar diseñar cómo diferentes sistemas comparten información, cómo almacenan memoria, cómo utilizan herramientas, cómo se supervisan entre sí, cómo perciben un entorno y cómo aprenden del comportamiento humano.

Una parte creciente de la programación comienza así a parecerse menos a escribir instrucciones y más a diseñar ecosistemas cognitivos.

La inteligencia artificial como amplificación

A pesar de avanzar hacia sistemas progresivamente más autónomos, no considero que la cuestión central sea reemplazar al especialista. Esa formulación resulta demasiado limitada.

El problema realmente interesante consiste en preguntarse cuánto puede amplificarse un profesional cuando trabaja junto a inteligencias adicionales.

El humano posee comprensión clínica, experiencia, intuición y capacidad de contextualización. La máquina puede analizar cantidades masivas de información, conservar memoria prácticamente perfecta, cuantificar estructuras y ejecutar procesos repetitivos con enorme consistencia.

La combinación de ambas formas de inteligencia puede producir algo que no pertenece completamente a ninguna de ellas.

Un sistema híbrido.

Por eso imagino que el futuro del diagnóstico será profundamente interactivo. No consistirá simplemente en introducir una imagen y recibir una respuesta. Los sistemas podrán dialogar con el especialista, mostrar evidencia, recuperar casos semejantes, justificar qué regiones consideran relevantes, solicitar información adicional, aceptar correcciones y reevaluar conclusiones.

El diagnóstico podrá transformarse así en un proceso dinámico de colaboración.

El verdadero desafío es comprender contexto

Uno de los grandes límites actuales de muchas inteligencias es que poseen capacidades extraordinarias dentro de tareas específicas, pero todavía presentan dificultades para comprender completamente el contexto.

La medicina exige precisamente contexto.

Una lesión posee una edad, una localización, una historia, síntomas, estudios de imagen, resultados laboratoriales, morfología, biomarcadores, genética, tratamientos previos y evolución. El significado de cualquiera de esos elementos depende de los demás.

Los futuros sistemas médicos deberán aprender a integrar progresivamente todas esas dimensiones. No para acumular más datos, sino para construir representaciones más completas de cada problema.

Esta es una de las razones por las que considero que la frontera ya no se encuentra simplemente en el reconocimiento visual.

Reconocer es importante, pero es apenas una parte del problema.

Las preguntas realmente interesantes son otras: ¿puede un sistema decidir qué necesita observar? ¿Puede estimar su incertidumbre? ¿Puede buscar evidencia contradictoria? ¿Puede recordar experiencias relevantes? ¿Puede utilizar herramientas? ¿Puede integrar distintas modalidades? ¿Puede aprender observando al especialista? ¿Puede traducir conocimiento en acciones?

Cuando estas preguntas se vuelven centrales, la visión artificial deja de ser el destino y se transforma en una puerta de entrada hacia sistemas cognitivos mucho más amplios.

Una sola trayectoria, no proyectos aislados

Clasificación, segmentación, representación, navegación, lenguaje, memoria, aprendizaje del comportamiento, autonomía, interacción humano-máquina y robótica pueden parecer líneas independientes si se observan por separado. Para mí forman parte de una misma trayectoria.

El objetivo no es automatizar una colección de tareas inconexas. Es estudiar cómo el conocimiento especializado puede convertirse progresivamente en capacidad computacional.

Eso implica investigar cómo una máquina puede percibir, seleccionar información, construir relaciones, recordar, razonar y eventualmente actuar dentro de un dominio médico extremadamente complejo.

Este es el hilo conductor que conecta todos los experimentos.

¿Dónde estamos ahora?

Hoy nos encontramos en una posición muy diferente a la de 2024, no porque entonces faltara dominio de la inteligencia artificial, sino precisamente porque haber comprendido temprano su dirección permitió comenzar a construir antes.

Lo que ha cambiado es la escala de la capacidad acumulada: la cantidad de código escrito, la infraestructura disponible, la diversidad de experimentos, el volumen de información procesada, la complejidad de los sistemas explorados y, sobre todo, la forma de conceptualizar el problema.

Antes veía principalmente modelos; ahora veo sistemas. Antes veía imágenes; ahora veo entornos. Antes veía anotaciones; ahora veo comportamiento. Antes veía herramientas independientes; ahora veo inteligencias capaces de cooperar. Antes pensaba principalmente en software; progresivamente comienzo también a pensar en la relación entre inteligencia y acción física.

Muchas decisiones que en su momento parecían independientes comienzan hoy a mostrar una coherencia mucho mayor. Invertir en infraestructura, construir bases de datos, escribir código, estudiar navegación, registrar comportamiento, explorar diferentes formas de inteligencia, investigar representaciones visuales y observar la evolución de la robótica formaban parte, consciente o inconscientemente, de una misma preparación: estar listo para el momento en que medicina, inteligencia artificial y sistemas físicos comiencen a converger.

Ese momento ya ha comenzado.

Conclusión

Cuando intento observar retrospectivamente este recorrido desde afuera, aparece una perspectiva diferente. Mientras uno trabaja diariamente dentro de un problema, cada avance parece simplemente el siguiente paso: un nuevo experimento, una nueva hipótesis, otro bloque de código, otra prueba que falla, otra corrección, otra iteración. Solo al alejarse resulta posible observar que esos pasos estaban construyendo una dirección mucho más amplia.

Lo que comenzó como inteligencia artificial aplicada a imágenes médicas terminó convirtiéndose progresivamente en una investigación sobre cómo transformar experiencia médica en inteligencia computacional.

El objetivo ya no consiste simplemente en construir un sistema que conozca determinadas respuestas, sino en comprender qué componentes necesita una inteligencia para aprender a observar un dominio médico complejo, relacionar aquello que percibe con conocimiento previo, recordar experiencias, evaluar incertidumbre, seleccionar acciones y mejorar a partir de la interacción con especialistas.

Por eso el destino final nunca podría limitarse a un modelo, una aplicación o una única arquitectura. Tampoco se trata simplemente de llegar a un robot. El verdadero objetivo está en la integración progresiva de percepción, memoria, conocimiento, razonamiento, decisión, acción y experiencia humana dentro de sistemas capaces de complementarse entre sí.

Desde 2024 hemos avanzado deliberadamente en esa dirección, muchas veces omitiendo etapas que parecían obligatorias y construyendo capacidades antes de que su utilidad fuera evidente. Esa estrategia exigió sacrificar visibilidad por profundidad, audiencia por inteligencia e inmediatez por capacidad acumulada. Sin embargo, comienza a aparecer el resultado de ese sacrificio: un nuevo tipo de profesional que no mide su crecimiento por cuánto se le observa, sino por cuánto puede comprender, integrar, anticipar y crear.

Tal vez el cambio más importante pueda resumirse de una manera sencilla. Durante una primera etapa utilizábamos inteligencia artificial para ampliar aquello que éramos capaces de hacer. Hoy estamos entrando en una fase diferente: comenzamos a preguntarnos qué tipo de inteligencia necesitamos construir para hacer posible aquello que todavía no existe.