Qué resuelve RAG (fecha de corte del conocimiento y alucinaciones)
RAG recupera contexto relevante en el momento de la consulta para que el LLM cite fuentes reales en lugar de inventar datos.
Qué resuelve RAG (fecha de corte del conocimiento y alucinaciones) es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.
Dos problemas de los LLM básicos
Incluso los mejores LLM tienen dos problemas estructurales:
- Fecha de corte del conocimiento: solo conocen lo que estaba incluido en sus datos de entrenamiento. Si pregunta a GPT-4 por un acontecimiento de ayer, no tendrá ni idea.
- Alucinaciones: cuando el modelo no sabe algo, se inventa cosas con total seguridad.
Qué es RAG
Generación aumentada mediante recuperación (RAG) significa:
- Buscar fragmentos relevantes en una base de conocimiento
- Insertar esos fragmentos en el prompt
- Pedir al LLM que responda utilizando ÚNICAMENTE esos fragmentos
El modelo se convierte en un «lector» del conocimiento externo, en lugar de depender de sus pesos congelados.
Un ejemplo concreto
Usuario: "¿Cuál es nuestra política de devoluciones para dispositivos electrónicos abiertos?"
- Buscar "política de devoluciones dispositivos electrónicos" en la base de conocimiento de la empresa y obtener 3 párrafos de los documentos de ayuda
- Crear el prompt: "Usando el contexto siguiente, responda: ..."
- El modelo produce una respuesta fiel con citas
Por qué RAG supera al fine-tuning
Para el conocimiento factual, RAG > fine-tuning porque:
- Puede actualizar la base de conocimiento sin volver a entrenar
- Los datos por usuario o tenant se separan fácilmente
- Permite incluir citas (sabe QUÉ fragmento produjo la respuesta)
- Es más barato de mantener
Por qué RAG reduce las alucinaciones
Si se indica al modelo que responda ÚNICAMENTE a partir del contexto proporcionado y el contexto contiene la verdad, es mucho más probable que acierte que si depende de su memoria.
No es perfecto: los modelos todavía inventan cosas ocasionalmente, pero reduce las alucinaciones de forma drástica.
Las tres etapas
Todo sistema RAG tiene tres etapas:
- Ingestión (offline): fragmentar los documentos, generar embeddings y almacenarlos
- Recuperación (online): generar el embedding de la consulta y encontrar los fragmentos top-K
- Generación (online): el LLM produce una respuesta utilizando los fragmentos recuperados
RAG ingenuo frente a RAG avanzado
RAG ingenuo (prototipo de 5 líneas):
- Fragmentación de tamaño fijo
- Recuperación mediante un solo vector
- Insertar el top-K en el prompt
El RAG avanzado añade re-ranking, reescritura de consultas, HyDE, múltiples vectores y evaluación; cada elemento mejora la calidad, pero también añade complejidad.
Cuándo ayuda RAG
- Bases de conocimiento y documentos de la empresa
- Atención al cliente basada en un manual de producto
- Preguntas y respuestas sobre información de cola larga
- Asistentes personales basados en datos del usuario
Cuándo perjudica RAG
- Conversaciones sencillas (no se necesitan datos)
- Tareas que requieren razonamiento, no datos
- Cuando el corpus es lo bastante pequeño como para caber de todos modos en el contexto
La plantilla del prompt
Un prompt RAG típico tiene este aspecto:
prompt = f'''
Answer the user\'s question using ONLY the context below.
If the answer is not in the context, say 'I do not know'.
Context:
{retrieved_chunks}
Question:
{user_question}
Answer:
'''Citas
Formatee los fragmentos con identificadores de origen y pida al modelo que los cite:
context = '\n'.join(
f'[doc {i+1}] {chunk.text}'
for i, chunk in enumerate(chunks)
)
# Then ask: 'Cite the relevant [doc N] for each claim.'Objetivo de RAG
¿Qué problema aborda principalmente RAG?
Resumen
RAG convierte los LLM en estudiantes que pueden consultar el libro. A continuación: cómo fragmentar realmente los documentos para la recuperación.
Preguntas frecuentes
¿La lección «Qué resuelve RAG (fecha de corte del conocimiento y alucinaciones)» es gratis?
Sí — el texto completo de «Qué resuelve RAG (fecha de corte del conocimiento y alucinaciones)» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.
¿Qué aprenderé en «Qué resuelve RAG (fecha de corte del conocimiento y alucinaciones)»?
RAG recupera contexto relevante en el momento de la consulta para que el LLM cite fuentes reales en lugar de inventar datos. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Agents?
No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.
¿Cuánto tiempo toma la lección «Qué resuelve RAG (fecha de corte del conocimiento y alucinaciones)»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Agents?
Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Qué resuelve RAG (fecha de corte del conocimiento y alucinaciones)
- Estrategias de segmentación (fija, por frases y semántica)
- Indexar un conjunto de documentos
- Crear un RAG ingenuo con FAISS o Chroma