Modelo de lenguaje del ADN

Hablamos de letras que pueden matarte o curarte.

Este texto está escrito en inglés. Mis compañeros lo han traducido a otros idiomas. Nos comunicamos. Tengo ciertos conocimientos y los comparto contigo. Al recibir esta información, según tus intereses, puedes generar una idea, emprender una acción o simplemente disfrutar aprendiendo algo nuevo.

Un proceso similar ocurre dentro de nuestras células.

El ADN almacena información. Esta información se transcribe en ARN mensajero. El ribosoma lee este mensaje y produce proteínas como resultado final. La información fluye desde el almacenamiento hasta la interpretación y la acción.

Por esa razón, el ADN puede considerarse un lenguaje. Tiene un alfabeto, una estructura y reglas que determinan cómo se interpreta la información.

Si cometo “error” al escribir este texto, las consecuencias son limitadas. En biología, la situación es diferente. Un solo cambio en el ADN puede alterar la producción de una proteína, a veces con graves consecuencias para el organismo. Así pues, hablamos de las letras del lenguaje, que pueden matarte o curarte.

En nuestra vida cotidiana, interactuamos con sistemas como ChatGPT, Gemini y Claude. Estos son ejemplos de Modelos de Lenguaje a Gran Escala (LLM, por sus siglas en inglés). Procesan el lenguaje humano como entrada, lo convierten en representaciones matemáticas y generan una salida.

Un modelo de lenguaje basado en el ADN sigue una idea similar, pero el lenguaje es diferente.

En lugar de palabras, el sistema trabaja con secuencias compuestas por cuatro nucleótidos: A, T, G y C. Estas secuencias contienen información biológica, pero interpretarlas es mucho más complejo que leer una oración. El significado de una secuencia depende del contexto, la estructura y las interacciones dentro de la célula.

El genoma contiene regiones codificantes y no codificantes. Las regiones codificantes proporcionan las instrucciones para la síntesis de proteínas. Las regiones no codificantes no producen proteínas directamente, pero regulan cuándo, dónde y cómo se expresan los genes (representan el 98% del genoma). Aunque constituyen la mayor parte del genoma, su función aún no se comprende completamente.

Entender esta regulación es uno de los desafíos centrales de la biología moderna.

Durante mucho tiempo, decodificar el ADN a gran escala estuvo fuera de nuestro alcance. Hoy, los avances en el aprendizaje automático están cambiando eso. Los modelos de lenguaje del ADN están surgiendo como una nueva forma de interpretar la información genómica, acercándonos a la comprensión de cómo funciona este lenguaje biológico.

¡Bienvenidos al mundo del Modelo de Lenguaje del ADN (DLM)!

Perspectiva científica

Un modelo de lenguaje de ADN es un sistema de aprendizaje automático entrenado con grandes colecciones de secuencias genómicas. En lugar de aprender de textos humanos, aprende del ADN.

En este contexto, el genoma puede considerarse una forma de texto biológico. Las unidades básicas son cuatro nucleótidos: adenina (A), timina (T), citosina (C) y guanina (G). Diferentes combinaciones de estas letras forman patrones que transmiten significado biológico. El objetivo de un modelo de lenguaje de ADN es aprender estos patrones.

https://theory.labster.com/de/dna-structure/

A diferencia de los modelos tradicionales en biología, que se basan en datos experimentales etiquetados, los modelos de lenguaje de ADN se entrenan mediante un enfoque de autoaprendizaje. Esto significa que el modelo aprende directamente de secuencias de ADN sin procesar, sin necesidad de anotaciones explícitas. Al analizar miles de millones de nucleótidos en diferentes organismos, el sistema construye una representación interna de cómo se estructura la información genómica. Este proceso permite que el modelo capture múltiples capas de información simultáneamente. A nivel local, puede reconocer patrones cortos, como los sitios de unión de factores de transcripción. A mayor escala, puede comenzar a comprender cómo interactúan regiones distantes del genoma, incluidos elementos reguladores que pueden estar separados por miles de pares de bases.

Este cambio es importante. En lugar de entrenar un nuevo modelo para cada pregunta biológica, un único sistema preentrenado puede adaptarse a muchas tareas, como predecir el efecto de mutaciones genéticas, modelar la regulación génica o diseñar nuevas secuencias.

Cómo funcionan los modelos de lenguaje del ADN

A pesar de su complejidad, la mayoría de los modelos de lenguaje de ADN siguen una estructura similar. El sistema puede entenderse como tres componentes principales: cómo se representa la secuencia, cómo se aprenden los patrones y cómo se generan las predicciones.

Aprender sin etiquetas

El primer paso es el preentrenamiento. La mayoría de los modelos de lenguaje de ADN se entrenan utilizando una de dos estrategias.

En el primer enfoque, se ocultan partes de la secuencia de ADN y se le pide al modelo que prediga las partes faltantes. Para hacerlo correctamente, el sistema debe comprender el contexto circundante. Este método permite que el modelo aprenda las relaciones entre regiones cercanas y distantes del genoma.

En el segundo enfoque, el modelo se entrena para predecir el siguiente nucleótido en una secuencia basándose en lo anterior. Esta configuración es similar al funcionamiento de los modelos de generación de texto. Resulta especialmente útil cuando el objetivo es generar nuevas secuencias de ADN o completar secuencias incompletas.

Ambos métodos obligan al modelo a aprender la estructura subyacente del ADN en lugar de memorizar ejemplos específicos.

Representación del ADN como tokens

Antes de que un modelo pueda aprender del ADN, la secuencia debe convertirse en unidades que el sistema pueda procesar. Este paso se llama tokenización .

En el lenguaje humano, las palabras se separan por espacios. El ADN no tiene límites naturales; es una secuencia continua de letras. Esto dificulta la tokenización.

Un enfoque común consiste en agrupar los nucleótidos en segmentos cortos de longitud fija. Por ejemplo, una secuencia de seis letras puede tratarse como una sola unidad. Esto ayuda al modelo a capturar patrones locales, pero puede introducir redundancia y aumentar el coste computacional.

Los enfoques más avanzados emplean métodos adaptativos que agrupan patrones frecuentes en unidades más grandes, manteniendo las secuencias raras con mayor detalle. Esto permite que el modelo represente el genoma de forma más eficiente, preservando al mismo tiempo señales biológicas importantes. Esta elección de diseño influye en la capacidad del modelo para detectar estructuras significativas en el ADN, especialmente en regiones que regulan la actividad génica.

https://www.nature.com/articles/s42256-024-00872-0 

Arquitecturas neuronales y secuencias largas

El siguiente desafío es la escala. Las secuencias genómicas son largas. Pueden producirse interacciones importantes a lo largo de decenas de miles de nucleótidos. Los modelos estándar de aprendizaje automático tienen dificultades para manejar esta longitud de manera eficiente. Muchos modelos de lenguaje de ADN se basan en arquitecturas de transformadores, similares a las utilizadas en el procesamiento del lenguaje natural. Estos modelos son eficaces para capturar relaciones dentro de las secuencias, pero su coste computacional aumenta rápidamente con la longitud de la secuencia.

Para superar esta limitación, se están desarrollando arquitecturas más novedosas. Algunos modelos reemplazan los mecanismos de atención con operaciones más eficientes que pueden procesar secuencias más largas. Otros introducen componentes de memoria o marcos matemáticos alternativos que escalan de forma más eficaz. Estas innovaciones permiten a los modelos analizar regiones más extensas del genoma simultáneamente, lo cual es fundamental para comprender los mecanismos reguladores distribuidos en ubicaciones distantes.

Un tipo de lenguaje diferente

Si bien la analogía con el lenguaje humano es útil, el ADN funciona bajo reglas diferentes.

No existen palabras ni frases claras. Una misma secuencia puede tener distintos significados según el contexto. Además, procesos biológicos como la transcripción introducen una direccionalidad que no siempre resulta evidente a partir de la secuencia en bruto. Lo más importante es que una gran parte del genoma no codifica proteínas directamente, sino que regula cuándo y cómo se expresan los genes. Estas regiones reguladoras son complejas y aún se comprenden solo parcialmente.

Por esta razón, aprender el “lenguaje del ADN” no se trata simplemente de leer secuencias. Requiere comprender cómo se organiza, interpreta y ejecuta la información dentro de un sistema vivo.

Herramientas y plataformas

Para los investigadores y desarrolladores, existen varios puntos de partida para utilizar los modelos de lenguaje del ADN.

Repositorios y bibliotecas de código abierto

HuggingFace se ha convertido en el repositorio central de modelos de ADN preentrenados, incluidos Nucleotide Transformer , DNABERT-2 y GENA-LM . Estos modelos se pueden cargar en flujos de trabajo estándar de aprendizaje profundo basados en Python mediante la biblioteca transformers. Además, existen varios conjuntos de herramientas especializadas en GitHub:

Marco de trabajo NVIDIA BioNeMo

Para aplicaciones a escala industrial, el marco de trabajo NVIDIA BioNeMo ofrece un entorno optimizado para el entrenamiento y la implementación de modelos biomoleculares. BioNeMo incluye versiones optimizadas de modelos como DNABERT y Geneformer, con cargadores de datos y recetas de entrenamiento seleccionados y acelerados para clústeres de GPU de NVIDIA. El NIM (NVIDIA Inference Microservices) del marco de trabajo permite una implementación rápida, con velocidades de inferencia hasta 5 veces superiores a las de las implementaciones estándar.

Aplicaciones

Los modelos de lenguaje basados en ADN son cada vez más accesibles para un amplio abanico de usuarios, desde investigadores académicos hasta grandes empresas farmacéuticas. En el ámbito académico, la mayoría de los científicos no entrenan estos modelos desde cero, ya que el preentrenamiento requiere enormes recursos computacionales, a menudo con cientos de GPU de alto rendimiento funcionando durante semanas. En su lugar, recurren a modelos base preentrenados y los adaptan a preguntas biológicas específicas mediante ajustes finos.

Paralelamente, las empresas farmacéuticas y biotecnológicas están integrando estos sistemas en sus procesos de descubrimiento de fármacos. Utilizan modelos de lenguaje de ADN para pasar del descubrimiento de fármacos tradicional basado en búsquedas al diseño generativo, donde los modelos sugieren posibles dianas terapéuticas que luego se validan en sistemas de laboratorio automatizados. Esto crea un ciclo de retroalimentación cerrado entre la computación y la experimentación, reduciendo significativamente el tiempo de desarrollo. En genómica clínica, estos modelos se utilizan cada vez más para interpretar variantes genéticas vinculadas a enfermedades raras. Incluso con las tecnologías de secuenciación modernas, la mayoría de los pacientes con sospecha de trastornos raros no reciben un diagnóstico molecular claro. Los modelos de lenguaje de ADN ayudan a priorizar las mutaciones que probablemente causan enfermedades al evaluar cómo los cambios en la secuencia afectan la función biológica prevista. En algunos casos, los sistemas asistidos por IA ya han demostrado una mayor precisión diagnóstica que los flujos de trabajo tradicionales, particularmente al analizar datos genómicos complejos.

Más allá de su uso clínico y farmacéutico, los modelos de lenguaje de ADN se están convirtiendo en herramientas fundamentales en genómica y medicina de precisión. Una de sus aplicaciones clave es la predicción del efecto de las variantes genéticas, cuyo objetivo es determinar si una mutación genética es inocua o causante de enfermedad. Estos modelos aprenden esto directamente a partir de patrones de secuencia sin necesidad de etiquetas experimentales explícitas, lo cual es especialmente importante para las regiones no codificantes que conforman la mayor parte del genoma humano.

Otra aplicación importante es el modelado de la expresión génica, donde el sistema predice la cantidad de proteína que producirá un gen basándose en su ADN regulador. Esto incluye la comprensión de promotores, potenciadores y otros elementos reguladores que controlan la actividad génica. Al mismo tiempo, los modelos generativos se utilizan en biología sintética e ingeniería CRISPR, donde se pueden diseñar nuevas secuencias de ADN con propiedades funcionales específicas, como la actividad génica dirigida o la especificidad de organismo.

Finalmente, los modelos fundamentales más recientes extienden este enfoque a datos epigenómicos y de células individuales, lo que permite a los investigadores estudiar cómo difieren las células individuales en la expresión génica y cómo cambian los estados celulares en enfermedades como el cáncer. En conjunto, estas aplicaciones demuestran que los modelos del lenguaje del ADN no solo son herramientas para el análisis, sino también para el diseño y la intervención en diversos campos de la biología.

Perspectiva de futuro

El futuro de los modelos de lenguaje de ADN se orienta hacia el razonamiento del genoma completo, donde los sistemas ya no se limitan a patrones de secuencia locales, sino que pueden interpretar y razonar a través de todo el código genético de un organismo. Una dirección clave en este progreso es la ampliación de la longitud del contexto. Los modelos actuales suelen operar con secuencias que van desde 10.000 hasta 100.000 pares de bases, pero muchas interacciones reguladoras biológicas se producen a distancias que se miden en millones de pares de bases. Para abordar esta brecha, se están desarrollando nuevas arquitecturas para procesar contextos genómicos ultralargos.

Al mismo tiempo, el campo avanza hacia la integración de múltiples capas de información biológica en modelos fundamentales unificados. En lugar de aprender únicamente de secuencias de ADN, los sistemas futuros combinarán datos genómicos con la expresión de ARN, estructuras proteicas y señales epigenéticas, conformando así un “modelo biológico de la vida” multimodal. Mediante el entrenamiento con datos evolutivos de miles de especies, estos modelos buscan capturar las limitaciones biológicas universales que rigen tanto las enfermedades humanas como sistemas biológicos más amplios, como la resiliencia de los cultivos.

La biología está evolucionando hacia flujos de trabajo de descubrimiento cada vez más autónomos. Los sistemas de IA comienzan a actuar como agentes que no solo analizan datos, sino que también diseñan, ejecutan y perfeccionan experimentos en entornos de laboratorio automatizados. Con el auge de los laboratorios en la nube y las plataformas robóticas, la biología experimental se está volviendo más programable, donde los sistemas impulsados por IA pueden mejorar iterativamente las hipótesis y guiar directamente los experimentos físicos, acelerando el descubrimiento desde la idea hasta la validación.