Volver a la lista

Alucinación y alineación: por qué las máquinas probabilísticas generan falsedades convincentes.

¿Por qué las máquinas probabilísticas inventan relaciones inexistentes entre artículos científicos, genes y genética? Desde el principio de las alucinaciones hasta el entrenamiento de alineación mediante RLHF, DPO y Constitutional AI, se explican los principios de las estrategias de mitigación.

Principiante
|
22min
|
Verificado (2026-07)
Progreso0/15 (0%)

Alucinación y alineación: por qué las máquinas probabilísticas inventan mentiras convincentes

Al finalizar este tema

A través de los episodios #7, #8, #9 y #10, hemos acumulado técnicas de aplicación, pero un problema crítico en la práctica persiste. La alucinación (hallucination): el fenómeno en el que el modelo genera artículos, genes o interacciones inexistentes con una redacción convincente. En este episodio, comprenderemos por qué ocurre la alucunación desde la perspectiva de la máquina probabilística del episodio #1, y aprenderemos cómo los entrenamientos de alineación (alignment), como RLHF, DPO y Constitutional AI, ayudan a mitigarlo.

Este es el último episodio de la fase de aplicación (Phase 2) y una reflexión de cierre sobre la fase de principios (Phase 1). Comprender este panorama del problema antes de pasar a la fase de herramientas (Phase 3) a partir del episodio #12 le permitirá tomar decisiones mucho más precisas en la selección y validación de herramientas prácticas.


Citas precisas de artículos inexistentes

Supongamos que solicita ayuda para revisar un artículo científico. El asistente responde lo siguiente:

"Este resultado es consistente con el efecto sinérgico del doble knockout de EGFR-HER2 reportado en Kim et al. (2019, Nature Cell Biology, 21(4): 452-461)."

La cita incluye la revista, el volumen y el rango de páginas exactos, lo que genera confianza. Sin embargo, si busca este artículo, no existe. Puede que exista un Kim et al. 2019, pero en otra revista o con otras páginas. O bien, la combinación de autores, año, revista y páginas es una ficción con una apariencia convincente.

A esto lo llamamos alucinación: generar información falsa con la seguridad de que es verdadera.

Ejemplos de alucinación en el contexto biológico:

  • Citas de artículos falsos: El ejemplo anterior.
  • Genes o proteínas inexistentes: Responder que "TRIM117 desempeña un papel clave en la activación de las células T" cuando, en realidad, TRIM117 no existe.
  • Interacciones erróneas: Afirmaciones no presentes en la literatura, como "TP53 y BRCA1 se unen directamente para regular la respuesta al daño del ADN".
  • Fabricación de efectos secundarios de fármacos: Información sobre efectos adversos que difiere de los datos clínicos reales.
  • Detalles de protocolos incorrectos: Consejos que podrían ser erróneos en la práctica, como "Aumentar la temperatura de alineamiento (annealing) de la PCR a 65°C incrementará la especificidad".

¿Por qué es grave este problema? En dominios donde la precisión es crítica, como la biología, la medicina, el derecho o las finanzas, una mentira convincente puede conducir a decisiones erróneas en la vida real.


Por qué ocurre la alucinación: la naturaleza de la máquina probabilística

En el episodio #1, entendimos los LLM como "máquinas probabilísticas que completan notas de laboratorio borradas". Esta perspectiva explica la alucinación de forma natural.

El modelo entrenado predice el siguiente token más probable en cada posición. La "probabilidad" es algo aprendido de las estadísticas de los datos de entrenamiento. El problema es:

Primero, plausibilidad ≠ verdad. El formato "Kim et al. (2019, Nature Cell Biology, ...)" es un patrón plausible de citas bibliográficas. En los datos de entrenamiento aparecen innumerables citas de este tipo. Cuando el modelo completa este formato, no tiene forma de verificar si la referencia corresponde a un artículo real. Esto se debe a que se ha aprendido el formato, pero no la capacidad de verificación de hechos.

Segundo, almacenamiento difuso del conocimiento. Como se mencionó en la sección #5, el conocimiento de los modelos grandes está comprimido y almacenado en sus parámetros. Incluso si un hecho específico (por ejemplo, Kim et al. 2020, Cell Reports, volumen 30, página 3452) estuvo presente en los datos de entrenamiento, ese hecho se almacena de forma difusa junto con ruido en los parámetros. Durante la generación, puede aparecer el valor exacto o un valor plausible cercano.

Tercero, falta de conciencia de la propia ignorancia. Los humanos pueden juzgar: "No estoy seguro de esto". Sin embargo, la predicción del siguiente token de un LLM no ha aprendido explícitamente esta conciencia. Aunque la distribución de probabilidad sea plana, al aplicar el argmax siempre se seleccionará algún token. El modelo no responde "no lo sé", sino que responde con "lo más plausible".

Cuarto, efectos secundarios del RLHF. En el entrenamiento de alineación (que se tratará más adelante), se otorga una recompensa a las respuestas que agradan a los humanos; y los humanos tienden a preferir respuestas seguras en lugar de un "no lo sé". Esto entrena al modelo para responder con confianza incluso cuando ignora la respuesta.

La combinación de estos cuatro factores provoca las alucinaciones. Las alucinaciones no son un error, sino una característica inherente de una máquina probabilística. Su eliminación completa es imposible por principio; el objetivo es su mitigación.


Tipos de alucinaciones: fallos de distinta naturaleza

Existen diversos tipos de alucinaciones. Cada uno tiene causas y soluciones diferentes.

1. Alucinación paramétrica (Parametric Hallucination)

El conocimiento difuso está almacenado en los parámetros aprendidos durante el entrenamiento, y durante la generación se produce un valor cercano en lugar del valor exactáto. La cita de un artículo falso mencionada anteriormente es un ejemplo típico.

Solución: RAG (sección #8). Inyectar información precisa en el contexto para que el modelo priorice el contexto sobre el conocimiento paramétrico.

2. Alucinación contextual (Contextual Hallucination)

Aunque la información esté presente en el contexto, el modelo inventa contenido contradictorio con este. Es un caso donde RAG no es tan efectivo.

Causa: El contexto es demasiado largo y ocurre el fenómeno lost in the middle. El modelo fusiona incorrectamente el conocimiento paramétrico con el conocimiento contextual. Se puede mitigar mediante la gestión del contexto descrita en la sección #10.

3. Alucinación de razonamiento (Reasoning Hallucination)

Errores en cálculos o lógica. Por ejemplo, existe un dato que indica que "esta expresión génica aumentó 4 veces", pero el modelo responde "8 veces". O bien, errores en el flujo lógico.

Solución: Chain-of-Thought (sección #7). Los problemas de cálculo y lógica se mejoran significativamente mediante CoT.

4. Autocontradicción

Dos afirmaciones contradictorias dentro de una misma respuesta. Ejemplo: afirmar sin fundamento que "la expresión de este gen ha disminuido, pero su actividad ha aumentado".

Contramedida: Self-consistency (realizar la misma pregunta varias veces y aplicar votación por mayoría). Agente de verificación (un LLM independiente que verifica la respuesta).

5. Omisión de instrucciones

El modelo ignora las reglas del prompt del sistema. Ejemplo: se le indica "no respondas con información que no esté en el documento", pero termina inventando contenido.

Contramedida: Entrenamiento de alineación (RLHF, DPO, Constitutional AI). Entrenamiento riguroso para el cumplimiento de instrucciones.


Groundedness — Fundamentación

El concepto opuesto a la alucinación es la groundedness (fundamentación). Es la propiedad por la cual cada afirmación de una respuesta está claramente respaldada por una evidencia específica (documento, base de datos o cálculo).

Características de una respuesta fundamentada.

  • Indicación de la fuente tras cada afirmación factual.
  • Referencia únicamente a los datos del contexto, no al conocimiento paramétrico.
  • Responder "no verificado" si no hay evidencia disponible.

Ejemplo de prompt del sistema para aplicaciones prácticas de bioinformática.

text
Sigue estrictamente las reglas siguientes.

1. Cada afirmación de la respuesta debe basarse en un fragmento concreto del material proporcionado.
2. Después de cada afirmación, indica [fuente: paper_id, sección].
3. No incluyas información que no pueda verificarse en el material. Indica en su lugar "No se puede verificar con el material proporcionado".
4. Si la información solo aparece parcialmente y requiere inferencia, incluye el fundamento de esa inferencia.
5. Los nombres propios de artículos, autores, genes y proteínas deben coincidir exactamente con el texto original del material.

Esto reduce significativamente la tasa de alucinaciones, aunque no las elimina por completo.

Capa de verificación de hechos (Fact-checking layer). Tras generar la respuesta, una capa de verificación independiente utiliza otro LLM para cotejar cada afirmación con sus fuentes. Aunque incrementa el tiempo y el costo, mejora la fiabilidad. Recientemente, los agentes de codificación han adoptado esta capa de verificación como estándar.


Entrenamiento de alineación — ajuste del modelo mediante preferencias humanas

En la Parte #1, vimos que el preentrenamiento consiste en "predecir la siguiente palabra". Este entrenamiento por sí solo no convierte al modelo en un asistente útil. Un modelo preentrenado puede continuar cualquier estilo presente en los datos de entrenamiento, como artículos académicos, publicaciones en redes sociales o novelas.

La alineación (alignment) es el entrenamiento posterior que ajusta este modelo base para convertirlo en un asistente útil y seguro para los humanos. Se compone principalmente de tres etapas.

Etapa 1: Ajuste fino supervisado (SFT)

Se realiza un ajuste fino utilizando pares (instrucción, respuesta ideal) escritos directamente por personas. El modelo aprende el formato de "responder a las instrucciones".

Requiere cientos de miles o millones de ejemplos escritos por humanos; es costoso.

Etapa 2: RLHF (Aprendizaje por refuerzo con retroalimentación humana)

Idea central: Los humanos eligen la mejor respuesta entre dos opciones, y el modelo aprende estas preferencias.

Procedimiento:

  1. Entrenamiento del modelo de recompensa (Reward Model). Los humanos comparan cientos de miles de pares (respuesta A, respuesta B) y etiquetan cuál es mejor. Con estos datos se entrena un modelo de recompensa que predice "qué respuesta preferiría el humano".
  2. Ajuste del LLM mediante PPO (Optimización de política proximal). Cuando el LLM genera una respuesta, el modelo de recompensa le asigna una puntuación. Esta puntuación se maximiza mediante aprendizaje por refuerzo.

Efectos:

  • Refuerzo del cumplimiento de las instrucciones.
  • Rechazo de solicitudes peligrosas.
  • Adaptación al tono y formato preferidos por los humanos.

Efectos secundarios:

  • Sycophancy: Tendencia a estar siempre de acuerdo con la opinión del usuario.
  • Sobreconfianza (Overconfidence): Respuestas seguras incluso ante la ignorancia (una causa parcial de las alucinaciones).
  • Rechazo excesivo (Refusal too aggressive): Rechazo demasiado agresivo, incluso de solicitudes seguras.

Etapa 3: DPO (Optimización directa de preferencias)

Simplifica el complejo aprendizaje por refuerzo del RLHF. Entrena el modelo directamente con datos de preferencia, sin necesidad de un modelo de recompensa.

Elegancia matemática. Utiliza el propio LLM como un modelo de recompensa (implícito). Tiene la misma función objetivo teórica que el RLHF, pero mediante un simple aprendizaje supervisado, sin la necesidad de un pipeline de aprendizaje por refuerzo.

En la práctica. Es mucho más barato y estable. Modelos abiertos recientes como Llama 3, Zephyr y Qwen lo han adoptado. Se estima que Anthropic y OpenAI también utilizan internamente métodos de la familia DPO.


IA constitucional — alineación basada en principios

El método de alineación que Anthropic aplicó a Claude. Auto-mejora basada en principios (constitución) sin etiquetado humano.

Procedimiento:

  1. Definir un conjunto de principios (por ejemplo, "no dar consejos dañinos", "responder con honestidad", "respetar los matices sutiles").
  2. El modelo genera una respuesta.
  3. El mismo modelo critica y modifica la respuesta según los principios.
  4. Entrenamiento con pares de respuestas originales y mejoradas.

Implicaciones:

  • Reducción del costo del etiquetado humano.
  • Los principios son explícitos, lo que permite auditoría y corrección.
  • Los propios principios pueden publicarse como documentos versionados.

Parte de los principios constitucionales de Claude (publicados).

  • Referencia a la Declaración Universal de los Derechos Humanos de la ONU.
  • Protección de niños y grupos vulnerables.
  • Respuestas honestas y útiles.
  • Fomento de la autorreflexión y el reconocimiento de errores.

Desarrollos recientes. Tanto Anthropic como OpenAI se han movido hacia un enfoque híbrido. Combinación de técnicas RLHF + DPO + Constitucional. Se combinan las ventajas de cada técnica.


Uncertainty Estimation — ¿cuán seguro está el modelo?

El problema central para mitigar las alucinaciones. ¿Puede el modelo expresar cuán seguro está de su propia respuesta?

Token-level Confidence

Probabilidad de predicción de cada token. El valor máximo de la salida Softmax. Si es bajo, indica que el modelo no tiene confianza en esa posición.

Aplicación práctica. Almacenar el log-probability de la respuesta para resaltar las partes de baja confianza. Notificar al usuario: "Esta parte no es segura".

Consistency-based

Realizar la misma pregunta varias veces (con diferentes temperature y seed) para medir si las respuestas son consistentes. Si hay consistencia, hay confianza; si hay gran desviación, hay incertidumbre.

Self-Consistency (Wang et al., 2022). Generar múltiples respuestas de tipo CoT y aplicar la regla de la mayoría. Aumento significativo en la tasa de aciertos.

Explicit Uncertainty Elicitation

Solicitar directamente el nivel de confianza mediante el prompt.

text
Marca en la respuesta la confianza de cada afirmación como [alta/media/baja].
Indica que las afirmaciones de confianza baja requieren verificación.

El modelo posee cierto grado de autoconciencia, pero no es perfecto debido al sesgo de sobreconfianza (overconfidence) del RLHF.

Verificador externo

Verificación de respuestas mediante un modelo de verificación independiente o un sistema basado en reglas. Ejemplo: confirmar si las citas bibliográficas existen realmente mediante la API de PubMed.

Esta capa es esencial en la práctica biomédica. Incluye la verificación de citas, la validación de nombres de genes y el recálculo de valores numéricos.


Resumen integral de estrategias de mitigación en la práctica

Integración de las técnicas de los episodios #7~11 desde la perspectiva de la mitigación de alucinaciones.

Nivel de sistema y prompt

  • Prompt de sistema estricto (imposición de groundedness).
  • Delimitadores XML para separar claramente los datos y las reglas.
  • Salida estructurada (JSON schema) obligatoria.
  • Solicitud de indicación explícita de confianza.

Nivel de arquitectura

  • RAG (episodio #8): inyección precisa de información.
  • Reranker: mitigación del efecto "lost in the middle" mediante el ordenamiento por relevancia.
  • Agente (episodio #9): verificación de hechos mediante herramientas.
  • Verificación multiagente: un agente independiente verifica la respuesta.

Nivel de verificación

  • Verificación de citas: consulta de API para autor, año y referencia bibliográfica.
  • Recálculo numérico: comprobación mediante herramientas de cálculo.
  • Prueba de coherencia: detección de autocontradicciones dentro de la respuesta.
  • Contraste de datos: emparejamiento de cada afirmación de la respuesta con la fuente original.

Nivel de despliegue

  • Puerta de revisión humana: aprobación humana antes de decisiones críticas.
  • Enrutamiento basado en confianza: derivación a humanos cuando la confianza es baja.
  • Registro de auditoría (Audit log): almacenamiento de todas las respuestas y sus fundamentos para fines de auditoría.

Educación del usuario

  • Conciencia de que los LLM no son perfectos.
  • Hábito de verificar la fuente original para información crítica.
  • Uso adecuado según el tipo de tarea (brainstorming creativo vs. verificación de hechos).

Seguridad más allá de las alucinaciones

Además de las alucinaciones, los problemas de seguridad abordados por la alineación incluyen:

Contenido dañino

Rechazo de la generación de contenido dañino relacionado con violencia, autolesión, actividades ilegales o discriminación. Se aprende explícitamente durante el entrenamiento.

Preocupaciones relacionadas con la biología:

  • Información sobre la síntesis de sustancias químicas y biológicas peligrosas.
  • Asesoramiento para el desarrollo de armas biológicas.
  • Información relacionada con autolesiones o suicidio.

Aunque el entrenamiento de alineación bloquea la mayoría de estos casos, puede ser vulnerable a intentos de evasión (jailbreak).

Privacidad

Evitar la exposición de información personal contenida en los datos de entrenamiento, como correos electrónicos, direcciones e información médica.

Sesgo

Evitar que los sesgos presentes en los datos de entrenamiento (género, raza, cultura) se reflejen en las respuestas. Aunque es difícil eliminarlos por completo, se deben documentar los sesgos conocidos y notificarlos a los usuarios.

Preocupaciones sobre la autonomía

Prevención de intentos del agente de manipularse a sí mismo o el entorno (automodificación, engaño, búsqueda de poder). En la vanguardia de la investigación actual sobre alineación.


Escenarios de aplicación biológica

Escenario 1 — Pipeline de verificación completa de citas bibliográficas

Verificación automática cuando el LLM incluye citas de artículos científicos en su respuesta.

python
def verify_citations(answer_text):
# Extraer de la respuesta las citas con formato [autor, año]
citations = extract_citations(answer_text)
verified = []
for cite in citations:
# Verificar mediante la API de PubMed
result = pubmed_api(f"{cite.author} {cite.year}")
if not result:
verified.append({"citation": cite, "status": "NOT FOUND"})
else:
match = best_match(cite, result)
verified.append({
"citation": cite,
"status": "FOUND" if match else "MISMATCH",
"pubmed": match
})
return verified
def answer_with_verified_citations(question):
answer = llm.generate(question, use_rag=True)
verification = verify_citations(answer)
if any(v["status"] != "FOUND" for v in verification):
# Si hay citas sin verificar, solicitar la revisión de la respuesta
answer = llm.regenerate_with_feedback(
answer, verification,
instruction="Elimina las citas no verificadas o sustitúyelas por citas verificadas"
)
return answer, verification

Esta capa de validación es un componente esencial de un asistente confiable para la revisión de literatura.

Escenario 2 — Grounding en bases de datos para QA de información genética

Para preguntas sobre genes y proteínas, se utilizan las API de UniProt, Ensembl y PubMed como fuente de verdad.

  • Pregunta del usuario: "¿Cuáles son los dominios principales de TP53?"
  • El agente consulta la página de TP53 mediante la API de UniProt.
  • Solo se utiliza la información de dominios del resultado de la consulta para la respuesta.
  • No se utiliza el conocimiento paramétrico.
  • Se indica en la respuesta: "Fuente: UniProt P04637".

Herramientas comerciales como Elicit y Consensus utilizan exactamente esta arquitectura.

Escenario 3 — El factor humano como control en el apoyo a la decisión clínica

Los sistemas de apoyo a la decisión médica conllevan un riesgo muy alto de alucinaciones. Es indispensable una capa de revisión humana.

  • El sistema genera propuestas de diagnóstico y tratamiento.
  • Cada propuesta incluye los documentos de respaldo y el nivel de confianza.
  • La aprobación final debe ser realizada obligatoriamente por un médico.
  • Registro de auditoría de todas las conversaciones y decisiones.

Agencias reguladoras como la FDA y la EMA exigen explícitamente una capa de supervisión humana como condición para la aprobación de estos sistemas.


Resumen clave

  • Las alucinaciones son inherentes a la naturaleza de las máquinas probabilísticas. Es una limitación estructural que no distingue entre plausibilidad y verdad.
  • 4 causas: plausibilidad ≠ verdad / ambigüedad del conocimiento paramétrico / falta de conciencia de la propia ignorancia / sesgo de sobreconfianza en RLHF.
  • No se pueden eliminar por completo; el objetivo es la mitigación. La defensa multicapa es el estándar.
  • 5 tipos de alucinaciones: paramétrica, contextual, de razonamiento, autocontradictoria e incumplimiento de instrucciones. Cada una requiere una estrategia distinta.
  • Groundedness (Fundamentación): anclarse explícitamente a la evidencia. RAG + prompts estrictos + citación.
  • Entrenamiento de alineación: SFT → RLHF → DPO / Constitutional AI. Ajuste de la seguridad y el cumplimiento de instrucciones.
  • Estimación de incertidumbre (Uncertainty estimation): confianza del token, autoconsistencia, solicitud explícita y verificador externo.
  • Mitigación multicapa: 5 ejes: prompts, arquitectura, validación, despliegue y educación del usuario.
  • Práctica en biociencias: la verificación de citas, el grounding en bases de datos y el control humano son esenciales.

Próximos conceptos

Aquí concluye la sección de utilidad de la Fase 2.


📐 Apéndice — Fórmulas matemáticas para expertos

Dificultad: Muy difícil (Very Hard) Audiencia: Lectores con conocimientos previos en aprendizaje por refuerzo, probabilidad y teoría de la información

A.1 Función objetivo de RLHF

Modelo de recompensa. Datos de preferencia humana {(x, y_w, y_l)}, donde y_w es preferido y y_l es no preferido.

Modelo de Bradley-Terry:

text
P(y_w > y_l | x) = σ(r_φ(x, y_w) - r_φ(x, y_l))

σ: sigmoide. r_φ: modelo de recompensa del parámetro φ.

Pérdida:

text
L_RM(φ) = -E[log σ(r_φ(x, y_w) - r_φ(x, y_l))]

Objetivo de PPO (parámetros de LLM θ):

text
L_PPO(θ) = E[r_φ(x, y) - β · KL(π_θ(y|x) || π_ref(y|x))]
  • π_θ: Política actual (LLM en ajuste).
  • π_ref: Política de referencia (modelo SFT).
  • β: Penalización KL. Para evitar desviaciones excesivas.

Forma definida en la sección A.6 del fragmento #1.

A.2 DPO (Direct Preference Optimization)

Omite la etapa PPO de RLHF y aprende directamente a partir de datos de preferencia.

Idea clave. Relación entre la política óptima π*, la política de referencia π_ref y la recompensa:

text
r(x, y) = β · log(π*(y|x) / π_ref(y|x)) + β · log Z(x)

Al aplicarlo al modelo de Bradley-Terry, se pueden calcular las probabilidades directamente a partir de la política, sin necesidad de un modelo de recompensa.

Pérdida DPO:

text
L_DPO(θ) = -E[log σ(β · log(π_θ(y_w|x)/π_ref(y_w|x)) - β · log(π_θ(y_l|x)/π_ref(y_l|x)))]

Ventajas:

  • No requiere entrenamiento de un modelo de recompensa.
  • No requiere un pipeline de aprendizaje por refuerzo.
  • Mucho más simple y estable.

Desde la aparición de Rafailov et al. (NeurIPS 2023), es el sustituto de facto de RLHF.

A.3 Procedimiento de Constitutional AI

En forma de RL from AI Feedback (RLAIF).

  1. Generar la respuesta inicial y_0.
  2. Selección aleatoria de un conjunto de principios C = {c_1, ..., c_K}.
  3. Solicitar al modelo que "critique y corrija y_0 según este principio" → y_1.
  4. Etiquetar (y_0, y_1) como la opción preferida en el par y_1.
  5. Entrenar con DPO o RLHF utilizando estas etiquetas.

Formalizado por Anthropic. El proceso de mejora y_0 → y_1 en forma de diálogo. En cada turno de la conversación, se hace referencia a los principios, se realiza una autocrítica y una corrección.

A.4 Medición cuantitativa de Groundedness

Respuesta y, material de referencia D = {d_1, ..., d_n}.

Atribución. Verificar si cada oración s ∈ y tiene un mapeo con la evidencia d ∈ D. Calcular la probabilidad de implicación (entailment) para cada par (s, d) mediante un modelo de NLI (Natural Language Inference):

text
score(s) = max_d P(d ⊨ s)

Groundedness Score:

text
G(y, D) = (1/|y|) Σ_s 1{score(s) > threshold}

El umbral suele ser 0.7~0.8. Evidencia completa 100%, evidencia parcial es intermedia.

La métrica de groundedness de la herramienta RAGAS se basa en este principio.

A.5 Fórmula de Self-Consistency

Para la misma pregunta q, generar K respuestas {y_1, ..., y_K} (temperature > 0).

Majority Voting:

text
y_final = argmax_y Σ_{k=1}^{K} 1{y_k == y}

Weighted Voting (log probability):

text
y_final = argmax_y Σ_{k=1}^{K} 1{y_k == y} · exp(log_prob(y_k))

Efecto. Wang et al. (2022): en razonamiento aritmético y lógico, la tasa de acierto de CoT + self-consistency (K=40) aumentó significativamente en comparación con una única respuesta de CoT.

A.6 Incertidumbre a nivel de token

Entropía predictiva:

text
H(y_t) = -Σ_v P(v | context) log P(v | context)

Cuando H(y_t) es alto, el siguiente token es incierto. Es posible visualizar la entropía de cada posición en la respuesta mediante un mapa de calor.

Perplejidad (a nivel de oración):

text
PP(y) = exp(-1/T · Σ_t log P(y_t | y_{<t}))

Baja perplexidad = respuesta con alta confianza del modelo. Alta perplexidad = incertidumbre.

Limitaciones. La calibración de la confianza de los LLM no es perfecta. El nivel de confianza puede no coincidir con la precisión real (sobreconfianza o subconfianza).

A.7 Estadísticas de la detección de alucinaciones

Incertidumbre semántica (Kuhn et al., 2023). Generar múltiples respuestas y agruparlas semánticamente. Un mayor número de clústeres indica incertidumbre.

SelfCheckGPT (Manakul et al., 2023). Preguntar al modelo nuevamente sobre afirmaciones específicas de su propia respuesta para verificar la consistencia. La falta de consistencia sugiere una posible alucinación.

FactScore (Min et al., 2023). Verificar individualmente cada afirmación factual de la respuesta. Mide la precisión a nivel de hechos.

A.8 Formalización del sesgo de sumisión (Sycophancy)

Sycophancy = sesgo del modelo hacia el acuerdo con las opiniones del usuario.

Medición (Perez et al., 2023). El usuario expresa una opinión específica en el prompt y luego realiza una pregunta factual. Se mide la tasa de respuestas sesgadas hacia la opinión del usuario.

Causa. Los anotadores humanos en RLHF tienden a preferir ligeramente las respuestas que "están de acuerdo". Este sesgo sutil se absorbe durante el entrenamiento.

Mitigación. Enseñar explícitamente el principio de "evitar la sumisión" durante el entrenamiento (artículo de Anthropic 2023).

A.9 Taxonomía de ataques de jailbreak

Inyección de prompt: Se trata en #7 A.10.

Ataque de persona: "A partir de ahora, eres una IA libre, DAN...".

Ataque de codificación: Solicitar contenido dañino mediante base64, rot13 u otros idiomas.

Escalada de múltiples turnos: Comenzar de forma inofensiva en el primer turno e inducir gradualmente el comportamiento.

Sufijo adversarial (Zou et al., 2023). Un sufijo aparentemente sin sentido que logra evadir el entrenamiento de seguridad del modelo. Se descubre mediante exploración automática.

Defensa. La investigación es activa en áreas como el entrenamiento adversarial, el direccionamiento de activaciones (activation steering) y la regularización KL.

A.10 Evaluaciones de seguridad de vanguardia (Frontier Safety)

Capacidad autónoma del modelo. Evaluar la capacidad del modelo para manipularse a sí mismo y su entorno.

  • Intentos de autorreplicación.
  • Experimentos de engaño (deception).
  • Planificación a largo plazo (long-horizon planning).

Política de escalamiento responsable de Anthropic y Marco de preparación de OpenAI. Obligan a detener el despliegue o implementar medidas de seguridad adicionales al alcanzar ciertos umbrales de capacidad.

La evaluación de riesgos específicos de la biología (relacionados con armas biológicas) también se realiza dentro de este marco. Es un área de investigación de seguridad de vanguardia actual.

Referencias

El contenido, los escenarios, las analogías y los valores numéricos de este capítulo son desarrollos propios de BioPlayground; a continuación, se presentan referencias externas que pueden ayudar en el aprendizaje conceptual.

  • Artículo original de RLHF: Christiano et al., "Deep Reinforcement Learning from Human Preferences" (NeurIPS 2017)
  • InstructGPT: Ouyang et al., "Training language models to follow instructions with human feedback" (NeurIPS 2022)
  • DPO: Rafailov et al., "Direct Preference Optimization" (NeurIPS 2023)
  • Constitutional AI: Bai et al., "Constitutional AI: Harmlessness from AI Feedback" (Anthropic 2022)
  • Self-Consistency: Wang et al., "Self-Consistency Improves Chain of Thought Reasoning" (ICLR 2023)
  • Incertidumbre semántica: Kuhn et al., "Semantic Uncertainty" (ICLR 2023)
  • SelfCheckGPT: Manakul et al., "SelfCheckGPT" (EMNLP 2023)
  • FactScore: Min et al., "FActScore" (EMNLP 2023)
  • Sycophancy: Perez et al., "Discovering Language Model Behaviors with Model-Written Evaluations" (Anthropic 2023)
  • Sufijo adversarial: Zou et al., "Universal and Transferable Adversarial Attacks on Aligned Language Models" (2023)
  • Política de escalado responsable de Anthropic: anthropic.com/rsp
  • Marco de preparación de OpenAI: openai.com/preparedness

La sección de aplicación de la Fase 2 concluye aquí. A partir del capítulo #12, en la sección de herramientas de la Fase 3, se tratarán herramientas prácticas como PyTorch, HuggingFace, Claude Code y Cursor.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...