Qué es un LLM: una máquina probabilística que reconstruye notas de laboratorio borradas
Al finalizar este tema
Comprenderá el principio fundamental de cómo ChatGPT, Claude y Gemini generan sus respuestas. Podrá conectar en una sola narrativa cómo la simple regla de predecir el siguiente token ha recorrido el camino del aprendizaje previo, la generación autoregresiva y el alineamiento con retroalimentación humana hasta convertirse en el asistente artificial actual; por qué a veces alucina (produce afirmaciones falsas); y cómo puede aplicar estos conocimientos en su práctica diaria como investigador en biología.
Este capítulo es el primero de esta ruta (AI Native) y cumple la función de un mapa. Los conceptos que aparecen aquí se explorarán en detalle a lo largo de los siguientes 14 capítulos, por lo que ahora basta con centrarse en obtener una visión general.
Imaginemos que tenemos unas notas de laboratorio borradas
Supongamos que usted es un estudiante de posgrado y acaba de heredar las antiguas notas de laboratorio dejadas por un colega mayor que se fue a estudiar al extranjero. Sin embargo, al abrir el cuaderno, se siente decepcionado: parece que se han derramado café varias veces, dejando la mitad derecha de cada página manchada e ilegible. En el lado izquierdo quedan anotados el orden experimental, los materiales y las condiciones, pero las observaciones, resultados e interpretaciones que deberían estar a la derecha son irreconocibles.
Usted debe restaurar estas notas. Afortunadamente, tiene en sus manos una máquina mágica: una herramienta que, al introducir cualquier registro experimental en su entrada, predice con gran plausibilidad la siguiente palabra que debería seguir. Con esta máquina, ¿qué podría hacer?
El procedimiento es sencillo. Introduzca completamente la mitad izquierda restante en la máquina. La máquina predice la primera palabra que debe aparecer a continuación. Añada esa palabra al cuaderno. Ahora introduzca nuevamente el texto completo de la nueva oración añadida como entrada. Prediga otra vez la siguiente palabra. Al repetir este proceso, la mitad derecha borrada se restaurará automáticamente. Aunque las frases restauradas no coincidirán exactamente con lo que escribió originalmente su colega, obtendrá un resultado plausible que conecta naturalmente el flujo lógico del experimento.
Este es precisamente el principio fundamental de funcionamiento de ChatGPT, Claude y Gemini que utiliza a diario. La conversación que mantenemos con estas máquinas consiste simplemente en predecir y añadir palabra por palabra (más exactamente, token por token) lo que la IA debería responder después de su pregunta.
Esta perspectiva nos libera de una ilusión cognitiva: un LLM no es un "alma inteligente que comprende preguntas y conoce las respuestas". Es solo una máquina sofisticada que selecciona estadísticamente la siguiente palabra más plausible y la añade en secuencia. Si mantenemos esta verdad presente, todos los conceptos que aparecerán a continuación se conectarán de manera natural.
¿En qué se diferencia de la búsqueda web?
Abordemos aquí un error común. Google Search y ChatGPT son cosas completamente distintas.
La búsqueda de Google encuentra documentos que ya están almacenados en algún lugar de Internet y proporciona un enlace. La respuesta se encuentra en ese enlace; Google simplemente cumple la función de encontrarlo, similar a una consulta en una base de datos. En una analogía con un cuaderno de laboratorio, sería como encontrar el original completo de un cuaderno de laboratorio similar que dejó otra persona y entregárselo tal cual.
LLM no es una base de datos. En lugar de buscar documentos almacenados, genera la respuesta desde cero cada vez. Esta es la razón por la que se pueden obtener respuestas ligeramente diferentes al hacer la misma pregunta dos veces. En una analogía con un cuaderno de laboratorio, LLM no busca y entrega el original, sino que crea instantáneamente oraciones que encajarían en las partes borradas.
Esta diferencia es crucial. La búsqueda consiste únicamente en la coincidencia entre la palabra clave y los documentos, mientras que LLM puede crear oraciones con combinaciones nunca antes vistas utilizando los patrones del texto aprendido. Esta propiedad es tanto la fuente de la creatividad como, como veremos más adelante, la fuente de las alucinaciones.
Definición precisa: una función que predice la probabilidad del siguiente token
Definámoslo ahora con mayor precisión.
LLM (Modelo de lenguaje grande, Large Language Model) es una función matemática muy sofisticada que predice la palabra que seguirá a un texto dado.
Aquí hay un matiz importante: no es una función que predice de forma determinista una única palabra, sino una función que calcula la probabilidad de todas las palabras posibles que podrían aparecer a continuación.
Por ejemplo, si se introduce la frase "El resultado de la reacción de PCR muestra bandas" en un LLM, se obtiene la siguiente distribución de probabilidades:
"apareció" probabilidad: 0.42
"se observó" probabilidad: 0.18
"no había" probabilidad: 0.11
"débilmente" probabilidad: 0.08
"dos" probabilidad: 0.05
...
"gato" probabilidad: 0.0000001Aquí se selecciona y se añade una sola palabra con la mayor probabilidad. ¿Y después? Se vuelve a introducir toda la oración nueva como entrada y se calcula de nuevo la distribución de probabilidades para la siguiente palabra. Se repite este proceso, construyendo la oración palabra por palabra.
Esto se conoce, en terminología de informática y estadística, como un modelo autorregresivo. Significa que lo que el modelo genera se vuelve a introducir como entrada. Las "GT" de GPT corresponden precisamente a Generative Pre-trained Transformer, es decir, un generador autorregresivo.
¿Por qué las respuestas varían ligeramente cada vez?
Aquí hay un punto interesante. Los LLM son modelos deterministas. Es decir, con los mismos parámetros y la misma entrada, la distribución de probabilidades es exactamente igual. Sin embargo, recibimos respuestas ligeramente distintas ante la misma pregunta. ¿Por qué?
Porque se ha diseñado para no seleccionar únicamente la palabra con la mayor probabilidad, sino que a veces se eligen aleatoriamente palabras con probabilidades ligeramente menores. El valor que controla este grado de aleatoriedad se denomina temperatura.
- Con una temperatura baja, solo se selecciona la palabra con la mayor probabilidad, por lo que las respuestas son siempre similares y seguras. No obstante, pueden resultar monótonas y repetitivas. Una temperatura de 0 es completamente determinista.
- Con una temperatura alta, se seleccionan con más frecuencia palabras de menor probabilidad, lo que genera respuestas creativas y variadas. Sin embargo, también aumenta el riesgo de obtener respuestas extrañas.
Inyectar aleatoriedad artificial en un modelo determinista es la verdadera razón por la que se obtienen respuestas distintas ante la misma pregunta. La función calcula siempre las mismas probabilidades, pero la aleatoriedad surge en la etapa de lanzar los dados según dichas probabilidades.
Expresado con una perspectiva de la informática, el bucle de generación autorregresiva se resume en el siguiente pseudocódigo:
contexto = prompt_del_usuariowhile no_se_cumpla_la_condición_de_parada: distribución = modelo.probabilidad_del_siguiente_token(contexto) siguiente_token = muestrear(distribución, temperature=1.0) contexto = contexto + siguiente_token yield siguiente_tokenConsejos prácticos. Cuando se requiere mayor diversidad de perspectivas que precisión absoluta, como al resumir un resumen o al generar ideas para un plan experimental, se aumenta ligeramente la temperatura (de 0,7 a 1,0). Al tratar con nombres de genes, fórmulas químicas y valores numéricos exactos, se reduce la temperatura (de 0,0 a 0,3). Esta es la razón por la que herramientas como Cursor y Claude Code suelen usar temperaturas bajas como valor predeterminado: en el código, la aleatoriedad equivale a errores.
¿Qué es exactamente un token?
Hasta ahora hemos hablado de "palabras", pero técnicamente se trata de tokens. Los tokens suelen ser unidades más pequeñas que las palabras.
Por ejemplo, la palabra en inglés unbelievable generalmente se divide en tres tokens: un, believe y able. El español suele dividirse en unidades de palabras de uso frecuente, pero las palabras poco comunes pueden dividirse a nivel de sílabas o incluso en unidades más pequeñas. Por ejemplo, prostaglandina puede dividirse en varios fragmentos como prosta, gland e ina.
¿Por qué dividir de esta manera? Porque no es posible incluir todas las palabras en un vocabulario. Si se incluyeran todas las palabras del mundo en el diccionario, el tamaño del vocabulario se dispararía. En cambio, si solo se incluyen fragmentos de uso frecuente, las palabras poco comunes pueden expresarse mediante combinaciones de estos fragmentos. Este enfoque se denomina tokenización de subpalabras. Algoritmos como BPE (Codificación de pares de bytes), WordPiece y SentencePiece realizan esta función.
Significado práctico de los tokens. Las tarifas de GPT, Claude y Gemini generalmente se calculan sumando el número de tokens de entrada más el número de tokens de salida. El coreano tiende a generar aproximadamente 1,5 a 2 veces más tokens que el inglés. Esto significa que, para una oración con el mismo significado, escribir en coreano podría resultar en un costo mayor.
Particularidades desde la perspectiva biológica. Al introducir secuencias de ADN y proteínas en un LLM, la tokenización funciona de manera peculiar. Secuencias como ATGCTA no suelen tener fragmentos exactos en el vocabulario, por lo que se dividen generalmente a nivel de caracteres individuales. Esto implica que el número de tokens aumenta considerablemente al procesar secuencias largas. Los modelos específicos para secuencias (por ejemplo, ESM, ProGen) utilizan métodos de tokenización distintos.
¿Cómo logra predecir tan bien? — La escala del preentrenamiento
Aquí es donde comienza la parte realmente sorprendente. Los LLM se entrenan con una enorme cantidad de datos de texto recopilados de Internet. ¿Cuánta cantidad?
Los datos de entrenamiento de GPT-3 constan aproximadamente de 400 mil millones de tokens (alrededor de 300 mil millones de palabras). Para hacernos una idea de esta magnitud, consideremos este experimento mental. Supongamos que leemos todos los libros de las bibliotecas de las universidades de cuatro años en Corea del Sur, un total de un millón de volúmenes. Si asumimos un promedio de 300 páginas por libro y 300 palabras por página, el total de la biblioteca sería de aproximadamente 90 mil millones de palabras. Por lo tanto, los datos de entrenamiento de GPT-3 equivalen al contenido de 3 a 4 bibliotecas universitarias.
Esto no es todo. Los últimos modelos de vanguardia como GPT-4, Claude y Gemini se han entrenado con cantidades mucho mayores. Imaginemos lo siguiente: la suma de los libros de todas las bibliotecas universitarias de cuatro años en Corea del Sur + toda la Wikipedia + los repositorios activos de código fuente abierto (GitHub) + una parte significativa de bases de datos de artículos académicos (como arXiv, PubMed, etc.). Esta es la realidad de los datos de preentrenamiento.
¿Cómo se entrena con esto? Se ajusta mediante el control de innumerables "perillas" dentro del modelo. Estos valores, llamados parámetros o pesos, determinan los resultados del modelo de lenguaje. Al cambiar estas perillas, también cambia la forma en que el modelo predice la siguiente palabra.
La "L" en Modelo de lenguaje grande se refiere a este número de parámetros. Son redes neuronales con cientos de miles de millones (billion) hasta cientos de miles de millones (hundreds of billion) de parámetros. GPT-3 tiene aproximadamente 175 mil millones, y los últimos modelos de vanguardia tienen aún más.
No es posible que una persona defina directamente tantos valores de parámetros. Inicialmente, los valores de parámetros establecidos aleatoriamente se ajustan gradualmente a valores que permiten predicciones cada vez más plausibles mediante la repetición del entrenamiento.
El proceso de entrenamiento es el siguiente:
- Se preparan fragmentos de texto compuestos por unas pocas palabras hasta miles de palabras, extraídos de los datos de entrenamiento.
- Se introduce en el modelo todo el texto excepto la última palabra, y se verifica cómo predice el modelo dicha última palabra.
- Se ajustan muy ligeramente los parámetros del modelo para que la predicción se acerque a la respuesta correcta.
- En este momento, se utiliza un algoritmo llamado retropropagación para acercarse progresivamente a la respuesta correcta.
Al repetir este proceso innumerables veces, el modelo no solo aprende a predecir bien la siguiente palabra en los datos de entrenamiento, sino que también puede hacer predicciones plausibles incluso con oraciones que nunca ha visto antes. Esto se denomina generalización.
¿Cuánto cálculo se requiere? — Haciéndonos una idea a escala de un experimento biológico
Para procesar esta enorme cantidad de parámetros y datos, se requiere una cantidad de cálculos inimaginable. Para que los investigadores en biología puedan hacerse una idea, usemos escalas familiares.
El ciclo celular de las células de mamífero dura aproximadamente 24 horas. Esto significa que una célula tarda un día en dividirse. La cantidad de operaciones de entrenamiento de GPT-3 es de aproximadamente FLOPS (operaciones de punto flotante). Si comparamos cada división celular con una operación, la cantidad de cálculos necesarios para el entrenamiento de GPT-3 equivaldría a divisiones celulares.
No es fácil comprender lo enorme que es este número. El número de células en el cuerpo de un adulto es de aproximadamente 30 billones (). Es decir, incluso si todas las células del cuerpo se dividieran exactamente una vez simultáneamente, correspondería a operaciones. El entrenamiento de GPT-3 requiere una cantidad de cálculos 10 mil millones de veces mayor que la división total de las células del cuerpo. Sería necesario repetir el evento de división de todo el cuerpo durante 10 mil millones de días para alcanzar esa magnitud. 10 mil millones de días equivalen a aproximadamente 27 millones de años.
Lo que se necesita realmente para afrontar este cálculo es el procesamiento en paralelo y chips de computadora especializados, es decir, las GPU. En el entrenamiento de los modelos más avanzados hoy en día, miles o decenas de miles de GPU funcionan en paralelo durante varios meses. Un solo acelerador de IA de última generación como la NVIDIA H100 realiza aproximadamente 4 billones de operaciones por segundo ( FLOPS). Si se hacen funcionar 10 mil de estas GPU durante 3 meses, se obtienen aproximadamente FLOPS, lo cual se acerca al entrenamiento de nivel GPT-4.
Esta es la razón por la que hay muy pocas empresas en el mundo con esta infraestructura: OpenAI, Anthropic, Google, Meta, etc. Se sabe que solo los costos de entrenamiento alcanzan cientos de miles de millones de wones.
El aprendizaje previo no es suficiente para mantener una conversación: ajuste fino y evolución dirigida
El modelo que se obtiene tras el aprendizaje previo es, en realidad, una máquina que simplemente concatena textos de Internet. Todavía no es un interlocutor que responda preguntas. Por ejemplo, si se pregunta "¿Cómo puedo cuidar a un gato?", el modelo inicial (raw) entrenado solo con aprendizaje previo, en lugar de dar una respuesta, simplemente concatenaría la frase de la pregunta: "Cómo puedo cuidar a un gato. Y también un perro. Y también un pájaro." Es más un autocompletador de texto que un interlocutor.
Existen dos pasos para convertir este modelo inicial en un asistente conversacional como ChatGPT o Claude, que conocemos.
Paso 1: Ajuste fino (Fine-Tuning): Se entrena adicionalmente el modelo con datos de ejemplos de conversación (pares de pregunta-respuesta) creados por humanos. En esta etapa, el modelo aprende la estructura conversacional de "cuando llega una pregunta, debe seguir con una respuesta".
Paso 2: RLHF (Aprendizaje por Refuerzo a partir de la Retroalimentación Humana): Los evaluadores humanos comparan varias respuestas del modelo e indican su preferencia sobre cuál es mejor. Utilizando estos datos de preferencia, se ajusta el modelo mediante aprendizaje por refuerzo. El resultado es un modelo ajustado para predecir la siguiente palabra en una dirección que los usuarios prefieran más.
A estos dos pasos se les denomina colectivamente alineación. Es el proceso de hacer que el modelo coincida con las expectativas y los estándares de seguridad humanos.
Si trasladamos este proceso al lenguaje de los experimentos biológicos, obtenemos una imagen sorprendentemente familiar. Pensemos en el cribado de evolución dirigida utilizando pantallas de fagos o bibliotecas de anticuerpos. Se crean innumerables variantes de anticuerpos en un tubo de ensayo, se seleccionan solo aquellos que se unen bien al antígeno diana y se amplifican; luego, entre esos, se seleccionan los que se unen aún mejor y se amplifican nuevamente... Al repetir este ciclo, quedan anticuerpos con una afinidad de unión extremadamente reforzada.
El concepto de la alineación (RLHF) es exactamente el mismo que este ciclo:
- Modelo inicial = Biblioteca inicial de anticuerpos (emisiones probabilísticas en todas direcciones)
- Selección de preferencia por evaluadores humanos = "Cribado para seleccionar solo aquellos que se unen bien al diana"
- Reentrenamiento del modelo en esa dirección = "Amplificación de los clones seleccionados"
- Repetición de este ciclo = "Varias rondas de evolución dirigida"
El resultado es un modelo que emite probabilísticamente con prioridad las respuestas alineadas con el sentido común, los estándares de seguridad y las expectativas humanas. "Preentrenamiento" y "alineación" son etapas de ingeniería completamente separadas. El proceso por el cual el modelo se vuelve inteligente (creación de la biblioteca genética que genera anticuerpos) y el proceso por el cual se domestica de manera segura para los humanos (cribado dirigido) ocurren en etapas distintas.
Esta distinción es importante. Porque, por mucho que esté alineado, siempre existe una zona probabilística restante en algún lugar del espacio de parámetros multidimensionales que no pasó el cribado. Al igual que la evolución dirigida no es perfecta tras unas pocas rondas. Los intentos de atravesar esta zona restante son los ataques de inyección de instrucciones o fuga de seguridad.
Transformer: la arquitectura que permitió el procesamiento paralelo
Subyacente a lo explicado hasta ahora está la estructura de red neuronal llamada Transformer.
Antes de 2017, la mayoría de los modelos de lenguaje procesaban el texto secuencialmente, palabra por palabra. Estructuras como RNN (Red Neuronal Recurrente) o LSTM. Este método era inadecuado para el procesamiento paralelo, ya que no se podía pasar a la siguiente palabra hasta que se terminara de procesar la anterior. Por mucho que hubiera múltiples GPUs, no se podía romper el flujo secuencial.
En 2017, un equipo de investigación de Google publicó el artículo "Attention Is All You Need", presentando una nueva arquitectura llamada Transformer. Esta estructura procesa la oración completa en paralelo, en lugar de leer el texto secuencialmente de principio a fin. Este único artículo transformó radicalmente el panorama de la IA en los siguientes 8 años.
Dentro del Transformer, cada palabra se convierte primero en un vector numérico. Esta transformación se denomina incrustación (embedding). Dado que el entrenamiento de la IA puede realizarse con datos numéricos continuos, es necesario codificar el lenguaje en números.
Cada vector numérico contiene el significado y el contexto de la palabra correspondiente. En el espacio vectorial, las palabras con significados similares se ubican en posiciones cercanas. Desde esta perspectiva, los vectores de "célula" y "mitocondria" están cerca, mientras que los vectores de "célula" y "multiplicación de matrices" están lejos.
El verdadero núcleo del Transformer es la potente operación llamada atención (attention). La atención permite que los vectores intercambien información entre sí, ajustando adecuadamente el significado de cada palabra según el contexto circundante.
Por ejemplo, consideremos la abreviatura ambigua "PC", común en textos biológicos:
- En la oración "Se cultivaron células PC12", PC se interpreta como línea celular de feocromocitoma.
- En la oración "Los clústeres fueron claros en el análisis de componentes principales (PC1, PC2)", PC significa componente principal.
- También puede usarse para referirse a control positivo.
Aunque es la misma "PC", la posición del vector cambia según el contexto circundante. Este es el poder de la atención: los modelos han aprendido mediante parámetros esta capacidad humana de comprender mediante el contexto.
Además de la atención, el Transformer incluye una operación llamada red neuronal feed-forward. Se sabe que esta parte actúa como el almacén de conocimiento del modelo. Aquí es donde se almacena comprimida en una combinación específica de parámetros un hecho como "la proteína spike del SARS-CoV-2 se une al receptor ACE2".
Al repetir las operaciones de atención y feed-forward a través de varias capas, los vectores de cada palabra reflejan progresivamente mejor el contexto. Comprimen y transmiten a la etapa final la información necesaria para predecir con precisión la siguiente palabra.
En la etapa final, utilizando un vector que refleja todo el contexto, se predice la distribución de probabilidad de la siguiente palabra. Puede considerarse que el modelo predice dicha probabilidad para todas las palabras posibles que podrían aparecer a continuación.
Si bien los investigadores diseñan la estructura del modelo, lo que realmente determina su salida son miles de millones de parámetros ajustados automáticamente durante el entrenamiento. Por lo tanto, resulta difícil explicar con precisión por qué un modelo genera una respuesta específica después del hecho. Esto conduce al problema de la interpretabilidad, que analizaremos más adelante.
Emergencia: capacidades que aparecen repentinamente a gran escala
Aquí hay una observación interesante. Entrenamos el modelo aumentando los parámetros de 1 millón, 100 millones, 1 mil millones y 10 mil millones. La mayoría de las capacidades mejoran gradualmente en proporción al tamaño.
Sin embargo, al superar cierto umbral de escala, de repente aparecen nuevas capacidades. El razonamiento lógico, la programación, el cálculo en varios pasos, seguir instrucciones e incluso traducir a otros idiomas comienzan a aparecer de forma estadísticamente significativa por encima de una escala específica. Este fenómeno se denomina capacidades emergentes.
Existe una analogía familiar para los investigadores en biología: la detección de quórum. Las bacterias no realizan acciones especiales individualmente, pero cuando su densidad supera un umbral específico, comienzan repentinamente comportamientos colectivos como la formación de biopelículas o la bioluminiscencia. La capacidad de las bacterias individuales permanece igual, pero el sistema completo experimenta una transición de fase cuando supera una densidad crítica.
La emergencia en los LLM es conceptualmente similar. Cuando la escala de parámetros supera cierto umbral, aparecen capacidades que antes no existían. Sin embargo, hay una verdad que debemos recordar para no dejarnos cautivar por esta "magia": en última instancia, todo esto se basa en multiplicaciones de matrices y sumas de sesgos repetidas billones de veces. No es misterioso. Es simplemente una máquina de predicción probabilística sofisticada y masiva; solo parece mágica porque su escala supera nuestra capacidad de comprensión intuitiva.
¿Por qué inventa cosas? — Alucinación
A veces, los LLM dan respuestas completamente incorrectas como si supieran exactamente de lo que hablan.
- Citan artículos inexistentes con autores y años plausibles.
- Inventan funciones de Python o paquetes de R que no existen.
- Crean nombres de genes o medicamentos que no existen.
- Presentan con confianza protocolos experimentales completamente diferentes a los resultados reales.
A esto se le llama alucinación.
Si comprendemos el principio, queda claro por qué ocurre. Los LLM no tienen un paso para verificar si algo es real. Simplemente seleccionan el siguiente token según las probabilidades aprendidas. Generan combinaciones plausibles con alta probabilidad incluso para cosas que no están en los datos de entrenamiento.
La probabilidad de generar una tontería plausible puede ser mayor que la de responder "no lo sé"; esta es la raíz de la alucinación.
En particular, las alucinaciones son más frecuentes en las siguientes situaciones:
- Conocimiento poco común: Temas que aparecen con poca frecuencia en los datos de entrenamiento (por ejemplo, subtipos tumorales minoritarios específicos)
- Información reciente: Eventos posteriores al punto temporal de los datos de entrenamiento (si el entrenamiento se detuvo en 2024, un artículo publicado en 2026)
- Citas precisas: Artículos, páginas o valores numéricos específicos
- Cadenas de razonamiento largas: Lógica que atraviesa múltiples etapas
- Preguntas ambiguas: Prompts interpretables en varias direcciones
No es posible eliminar por completo las alucinaciones. Es inevitable dado que la base de los LLM es la predicción probabilística. Sin embargo, existen varios métodos para mitigarlas.
- RAG (Generación Aumentada por Recuperación): Buscar documentos confiables antes de responder e incluirlos como contexto → ver sección #9
- Temperatura baja: Inhibir la selección de palabras con baja probabilidad
- Solicitud explícita de incertidumbre: Especificar en el prompt "si no lo sabe, diga que no lo sabe"
- Obligación de citar: "Debe especificar siempre las fuentes de cita"
- Pipeline de verificación de hechos: Etapa de validación separada
El alineamiento (RLHF) también contribuye a la mitigación de alucinaciones. En el ciclo de evolución direccional, si un evaluador humano otorga una puntuación alta a una respuesta que dice "No lo sé", el modelo se sesga gradualmente en esa dirección. No obstante, como se mencionó anteriormente, es una necesidad matemática que queden zonas probabilísticas sin filtrar en algún lugar del espacio multidimensional, por lo que la defensa perfecta es imposible.
Aplicaciones prácticas para investigadores de biología — 3 escenarios
¿Cómo se utiliza esta teoría en un laboratorio de investigación biológica? Aquí hay tres escenarios prácticos.
Escenario 1 — Resumen de artículos y lluvia de ideas
Se seleccionan 10 resúmenes de artículos relevantes de PubMed y se pegan en el prompt para hacer la consulta.
"Estoy observando cambios metabólicos en líneas celulares donde he eliminado un gen supresor de tumores específico mediante CRISPR-Cas9. Resume los 3 puntos de conexión entre estos artículos y mi experimento, y propón 5 ideas para experimentos posteriores."
Una tarea de investigación y resumen que tomaría decenas de minutos o varias horas se completa en pocos minutos. Sin embargo, es obligatorio verificar las citas con el texto original. Las alucinaciones pueden llevar a citar artículos inexistentes o distorsionar las conclusiones de artículos existentes.
En este caso, es recomendable subir ligeramente la temperatura (alrededor de 0.7). Dado que el objetivo es una lluvia de ideas desde diversas perspectivas, respuestas un poco más creativas son útiles.
Escenario 2 — Revisión de código y depuración con Biopython
Escribí un script para analizar un archivo FASTA y calcular el contenido de GC, pero el resultado siempre es 0. Pego el código completo y:
"Encuentra la razón por la cual el contenido de GC siempre es 0 en este código. Además, mejóralo para que sea seguro en términos de memoria al procesar archivos grandes (de varios GB)."
Los modelos de lenguaje grandes (LLM) suelen proporcionar diagnósticos precisos (por ejemplo, no procesar mayúsculas y minúsculas, realizar solo count("G") pero omitir count("C"), generar complejidad O(n^2) mediante el rebanado de cadenas, etc.). Además, proponen código mejorado. La validación con datos de prueba debe ser realizada necesariamente por el usuario.
En este punto, se reduce la temperatura (alrededor de 0.2). El código no debe tener aleatoriedad, ya que esta equivale a errores.
Escenario 3: Automatización de la limpieza de datos
Un archivo de Excel recibido de un hospital colaborador clínico presenta celdas fusionadas, indicadores de color, fórmulas corruptas y una mezcla de erratas. Se muestran algunas filas al LLM:
"Escribe código Python para limpiar esto en un DataFrame de pandas. Rellena las celdas fusionadas con el valor superior, extrae la información de color en una columna separada y normaliza los patrones frecuentes de erratas mediante expresiones regulares."
Una tarea que podría llevar varias horas en la práctica puede completarse en cinco minutos.
Los tres escenarios aprovechan correctamente la característica de los LLM de "generar respuestas", algo que las búsquedas no pueden hacer. En los siguientes capítulos de esta serie, aprenderás técnicas de ingeniería de prompts y flujos de trabajo de herramientas más sofisticados para extraer cada escenario con mayor precisión.
Revisión desde la perspectiva de la evolución dirigida
Anteriormente, se comparó el alineamiento (RLHF) con el cribado de evolución dirigida. Si ampliamos un poco esta perspectiva, todo el proceso de entrenamiento de los LLM se convierte en una imagen muy familiar para los investigadores de biotecnología.
Preentrenamiento = Recopilación de diversidad genética natural. El proceso de recopilar grandes cantidades de texto de Internet es estructuralmente similar a recopilar secuencias génicas de todas las especies existentes en la naturaleza para crear una base de datos a gran escala. No se interesa por el origen específico de cada oración individual, sino que el objetivo es comprender los patrones estadísticos de la distribución general.
Ajuste fino = Reducción a una biblioteca de anticuerpos específica. El ajuste fino del modelo en bruto preentrenado para adaptarlo a un formato de diálogo específico es conceptualmente similar a crear una biblioteca posterior reducida que conserva solo las regiones de interés objetivo específicas a partir de una biblioteca general de anticuerpos.
RLHF = Varias rondas de cribado de evolución dirigida. El RLHF, que selecciona entre varias respuestas aquellas preferidas por los humanos para reforzar el modelo en esa dirección, es conceptualmente idéntico a la evolución dirigida, donde se crean múltiples variantes de anticuerpos en un tubo de ensayo y solo se seleccionan las que tienen una alta afinidad de unión al objetivo para amplificarlas nuevamente.
Comprender este mapeo abre una perspectiva interesante: el ciclo familiar "selección → amplificación" de la investigación biológica funciona exactamente igual en la etapa de alineamiento del entrenamiento de los LLM. Esta perspectiva se detallará más en capítulos posteriores, especialmente en el capítulo #4 (retropropagación) y el capítulo #11 (alineamiento y alucinaciones).
Resumen clave
Hagamos un resumen.
- Los LLM son modelos autorregresivos que predicen la distribución de probabilidad del siguiente token.
- Son generadores que crean cada vez desde cero, no realizan búsquedas; por eso son creativos, pero también por eso pueden producir alucinaciones.
- El preentrenamiento (equivalente a la cantidad de texto de 3 a 4 bibliotecas universitarias) comprime los patrones de conocimiento, y el ajuste fino y RLHF (refuerzo por aprendizaje con retroalimentación humana) alinean el formato conversacional y los estándares de seguridad.
- En la base se encuentra una estructura de procesamiento paralelo de transformador + atención + capa de alimentación directa.
- Al superar cierta escala, aparecen repentinamente capacidades emergentes (análogas a la detección de números primos), pero en el fondo sigue siendo una predicción probabilística.
- Recuerde siempre que no existe una función para determinar "si realmente lo sabe".
Próximos conceptos
Esta primera entrega sirve como mapa. En las siguientes, profundizaremos en cada tema.
Fase 1: Principios
- Entrega n.º 2
neural-network-basics— ¿Qué es una red neuronal? Una estructura estática compuesta por diales e interruptores. - Entrega n.º 3
how-nn-learns— ¿Cómo aprende? El descenso de gradiente desde la perspectiva de la minimización de la energía libre. - Entrega n.º 4
backpropagation-intuition— La tensa negociación democrática del error. Intuición de la retropropagación. - Entrega n.º 5
transformer-and-embedding— El momento en que los tokens se ubican en el espacio semántico. - Entrega n.º 6
attention-mechanism— Cómo distinguir los múltiples significados de "PC".
Fase 2: Aplicaciones
- Entrega n.º 7
prompt-engineering-basics— Guiar la probabilidad en la dirección deseada. - Entrega n.º 8
structured-output— Controlarlo como una función mediante el modo JSON. - Entrega n.º 9
context-window-and-rag— Cuánto puede contener y RAG. - Entrega n.º 10
embedding-and-vector-db— Búsqueda mediante vectores. - Entrega n.º 11
hallucination-and-alignment— La necesidad matemática de las alucinaciones y sus contramedidas.
Fase 3: Herramientas y flujos de trabajo
- Episodio #12
cursor-and-claude-code— Codificación por Vibing en la Práctica - Episodio #13
mcp-and-agent— MCP y Agentes de IA - Episodio #14
local-llm— Implementación de Modelos Personales con Ollama
Fase 4 — Integración Biológica
- Episodio #15
bio-ai-integration— Conexión con la Práctica de DevBench
📐 Apéndice — Fórmulas Matemáticas para Expertos
Dificultad: Muy difícil (Very Hard) Dirigido a: Lectores que ya poseen conocimientos de nivel de posgrado en probabilidad, cálculo y álgebra lineal.
El cuerpo principal del texto se centra en la intuición y las ilustraciones; aquí se presenta una formulación rigurosa de las matemáticas subyacentes. Los lectores que lo lean por primera vez pueden omitir esta sección. Este apéndice sirve como punto de referencia para consultar posteriormente al leer artículos científicos o implementar modelos directamente.
A.1 Descomposición Probabilística Autoregresiva (Autoregressive Factorization)
Los LLM modelan la probabilidad conjunta de todo el texto descomponiéndola en el producto de probabilidades condicionales.
P(w_1, w_2, ..., w_n)
= P(w_1) · P(w_2 | w_1) · P(w_3 | w_1, w_2) · ... · P(w_n | w_1, ..., w_{n-1})
= ∏_{t=1}^{n} P(w_t | w_{<t})Aquí, w_t es el token en el instante t, y w_{<t} = (w_1, ..., w_{t-1}) representa todos los tokens anteriores. El modelo aproxima esta probabilidad condicional P(w_t | w_{<t}; θ) mediante una red neuronal parametrizada por θ (de cientos de miles de millones a billones de parámetros).
A.2 Softmax y temperatura
La salida de la última capa del modelo consiste en puntuaciones reales (logits) para cada token del vocabulario. Para convertir estas puntuaciones en una distribución de probabilidad, se utiliza Softmax con temperatura.
P(w_t = i | context) = exp(z_i / T) / Σ_j exp(z_j / T)z_ies el valor logit correspondiente al token .Tes la temperatura.T → 0: La probabilidad del valor logit más alto converge a 1 (equivalente a argmax, determinista).T → ∞: Converge a una distribución uniforme (completamente aleatorio).T = 1: Softmax original.
Consejo para la estabilidad numérica: En la implementación práctica, se resta el valor máximo, como en exp(z_i / T - max(z) / T), para evitar el desbordamiento.
A.3 Pérdida de entropía cruzada — Función objetivo del preentrenamiento
Cuando el token correcto en un paso es y ∈ {1, ..., V} (tamaño del vocabulario ), la pérdida de entropía cruzada entre la distribución de predicción del modelo p̂ = softmax(z) y la etiqueta real es:
L(θ) = -log p̂_y = -log( exp(z_y) / Σ_j exp(z_j) )Este es el valor que se obtiene al aplicar el logaritmo a la probabilidad predicha del token correcto y cambiar su signo. Si el modelo asigna una probabilidad de 1 al token correcto, la pérdida es 0; cuanto menor sea la probabilidad, mayor será la pérdida.
La pérdida total para todo el conjunto de datos se calcula promediando este valor en todos los puntos temporales y documentos:
L_total(θ) = -1/N · Σ_{documento} Σ_{instante t} log P(w_t | w_{<t}; θ)Minimizar esta pérdida con respecto al parámetro θ es el objetivo matemático del preentrenamiento. La optimización se realiza mediante el descenso de gradiente estocástico (SGD) o sus variantes mejoradas (Adam, AdamW, etc.).
A.4 Interpretación desde la teoría de la información: perplejidad
El valor obtenido al elevar a un exponente la pérdida de entropía cruzada se denomina perplejidad.
Perplexity = exp(L_total)Esto es una medida de "cuántas opciones candidatas reduce el modelo, en promedio, para el siguiente token". Una perplejidad más baja indica una mayor confianza en la predicción. La perplejidad de un predictor aleatorio (para un vocabulario de tamaño V) es exactamente V, mientras que los modelos grandes bien entrenados suelen tener un rango de 10 a 30 en lenguaje natural.
A.5 Optimización de preferencias mediante RLHF: modelo de Bradley-Terry
Cuando los evaluadores humanos comparan dos respuestas, la y_w (preferida, ganadora) y la y_l (no preferida, perdedora), en RLHF, entrenamos el modelo de recompensa r_φ(x, y) para que prediga con precisión la probabilidad.
P(y_w ≻ y_l | x) = σ( r_φ(x, y_w) - r_φ(x, y_l) )Aquí, σ(z) = 1 / (1 + exp(-z)) representa la función sigmoide. Esta corresponde a la forma del modelo de Bradley-Terry, y el objetivo del aprendizaje por preferencias es maximizar la verosimilitud logarítmica.
L_reward(φ) = -E_{(x, y_w, y_l) ~ D} [ log σ( r_φ(x, y_w) - r_φ(x, y_l) ) ]Posteriormente, se utiliza el aprendizaje por refuerzo, como PPO (Optimización de política proximal), para ajustar el modelo de política (es decir, el LLM) y maximizar el modelo de recompensa r_φ. Durante este proceso, se aplica una penalización basada en la divergencia KL con respecto al modelo preentrenado original para evitar desviaciones excesivas.
J(π_θ) = E_{x~D, y~π_θ(·|x)} [ r_φ(x, y) - β · KL( π_θ(·|x) || π_ref(·|x) ) ]π_θ: Modelo de política en entrenamientoπ_ref: Modelo de referencia (modelo preentrenado o SFT)β: Coeficiente de penalización KL (generalmente entre 0,01 y 0,1)
Si el equilibrio de estos términos es incorrecto, se producen dos tipos de fallos. Si β es demasiado grande, el modelo no puede salir del estado preentrenado y no logra alinearse; si β es demasiado pequeño, se produce manipulación de recompensas o colapso del modelo.
Si consideramos esta situación mediante una analogía biológica, si β es demasiado grande, el modelo no se aparta de la configuración inicial y el efecto de selección es nulo; si β es demasiado pequeño, la presión de selección es excesiva, la diversidad desaparece por completo y converge en unos pocos clones: colapso de la diversidad.
A.6 Alternativas recientes: DPO (Optimización Directa de Preferencias)
Desde 2023, DPO ha surgido como una alternativa que no requiere un modelo de recompensa independiente, sino que optimiza directamente el modelo de política a partir de datos de preferencia.
L_DPO(θ) = -E_{(x, y_w, y_l) ~ D} [ log σ( β · log(π_θ(y_w|x) / π_ref(y_w|x))
- β · log(π_θ(y_l|x) / π_ref(y_l|x)) ) ]Este formato es estable y eficiente desde el punto de vista computacional, incluso sin PPO, por lo que se ha adoptado recientemente en varios modelos de código abierto.
A.7 Fórmula de atención del transformador (Atención de producto escalar)
La autoatención del transformador se define mediante la siguiente fórmula:
Attention(Q, K, V) = softmax( Q · K^T / sqrt(d_k) ) · VQ ∈ R^{n×d_k}: matriz de consultaK ∈ R^{n×d_k}: matriz de claveV ∈ R^{n×d_v}: matriz de valord_k: dimensión de las claves y las consultas (generalmente 64 u 128)sqrt(d_k): constante de escalamiento (para evitar que la magnitud del producto escalar se dispare)
Para cada posición, se calcula el producto escalar entre la consulta en esa posición y todas las claves, se normaliza mediante softmax y, a continuación, se obtiene una suma ponderada de la matriz de valores. Esta operación aprende automáticamente de los datos qué posiciones están relacionadas entre sí y en qué medida.
La atención multi-cabeza realiza esta operación en paralelo para varios pares de proyecciones (Q, K, V) y, a continuación, concatena los resultados.
MultiHead(X) = Concat(head_1, ..., head_h) · W_O
where head_i = Attention(X · W_Q^i, X · W_K^i, X · W_V^i)Esta estructura es clave para la capacidad de procesamiento en paralelo de los transformadores y la fuente del poder actual de los LLM. La intuición visual detallada de esta sección se aborda en el episodio #6 attention-mechanism.
A.8 Nota — Comprensión de la magnitud de la pérdida durante el entrenamiento
En conjuntos de datos masivos para el preentrenamiento (por ejemplo, terabytes de texto web), el modelo calcula en paralelo la pérdida para miles o decenas de miles de tokens por lote. La pérdida en cada paso es el promedio de la entropía cruzada de ese lote; al repetirse esto durante millones de pasos (a lo largo de meses), el modelo finalmente converge. El número total de operaciones de preentrenamiento de los modelos más avanzados se sitúa aproximadamente entre 3 × 10^24 y 3 × 10^25 FLOPS.
Al comparar este valor con la idea anterior de "10 mil millones de veces la división celular de todo el cuerpo", podemos hacernos una idea de la magnitud del procesamiento en paralelo extremo en el que se lleva a cabo el entrenamiento real.
Referencias
El contenido, los escenarios y las analogías de este episodio son desarrollos propios de BioPlayground; a continuación, se presentan referencias externas que pueden ayudar al aprendizaje conceptual:
- Artículo original sobre los transformadores: Vaswani et al., "Attention Is All You Need" (NeurIPS 2017)
- Artículo sobre GPT-3: Brown et al., "Language Models are Few-Shot Learners" (NeurIPS 2020)
- Principios de RLHF: Christiano et al., "Deep Reinforcement Learning from Human Preferences" (NeurIPS 2017)
- Artículo sobre DPO: Rafailov et al., "Direct Preference Optimization" (NeurIPS 2023)
- Material educativo sobre la visualización del aprendizaje profundo: Serie "Deep Learning" de 3Blue1Brown (YouTube); referencia pedagógica
- Texto de referencia sobre el procesamiento del lenguaje natural: Jurafsky & Martin, "Speech and Language Processing" (disponible en línea)
Este episodio es un mapa y la primera puerta. En los siguientes 14 episodios, profundizaremos en cada concepto, para finalmente regresar a este mapa en el último episodio.