Optimización de Recuperación (RAG Avanzado) – Curso | IDSA + UTN
  1. Inicio
  2. Cursos
  3. Optimización de Recuperación
CURSO AVANZADO · 30 HORAS

Optimización de Recuperación (RAG Avanzado)

Sistemas de búsqueda léxica, semántica e híbrida a escala

Dominá la recuperación híbrida (BM25 + Embeddings), implementá técnicas avanzadas como HyDE y MMR, aplicá fine-tuning con losses contrastivas y escalá con índices ANN (HNSW, IVF). Optimizá latencia y precisión.

30 horas
10 unidades
Tutor RAG 24/7
Perfil avanzado
hybrid_retrieval.py
# Recuperación Híbrida
def hybrid_search(query, alpha):
  lex = bm25.rank(query)
  sem = embedding.rank(query)
  hybrid = alpha*lex + (1–alpha)*sem
  return mmr(hybrid, lambda=0.7)
1
Retrieve — BM25 léxico y embeddings densos
2
Fuse — peso alpha y MMR para diversidad
3
Scale — índices ANN (HNSW, IVF)
10
Unidades didácticas
30h
Duración total
Avanzado
Nivel del curso
24/7
Tutor RAG disponible
Inversión del curso
$200.000 ARS
Acceso completo + certificación UTN + IDSA. Emisión por curso, no al final del trayecto.
Transferencia en 1 pago
20% de descuento
$160.000
Hasta 3 cuotas sin interés
Total $200.000 ARS
$200.000
▸ OBJETIVOS DE APRENDIZAJE

Lo que lograrás al completar el curso

Cada objetivo es verificable mediante entregables y defensa conversacional. Aprenderás a optimizar la recuperación léxica y semántica para sistemas RAG de producción.

1

Diseñar e implementar pipelines de recuperación optimizados combinando métodos léxicos (BM25) y semánticos (embeddings)

2

Aplicar técnicas de aumento (HyDE), diversificación (MMR) y fine-tuning de representaciones con losses contrastivas

3

Evaluar críticamente la calidad con métricas (Recall@k, MRR, NDCG@k) y optimizar latencia con ANN (HNSW, IVF)

4

Construir un ranker híbrido BM25 + embeddings y optimizar el peso de fusión alpha

5

Implementar BM25 desde cero y comparar métricas de similitud entre embeddings

6

Mitigar riesgos de alucinación en HyDE mediante umbrales de confianza

7

Prevenir catastrophic forgetting durante el fine-tuning de embeddings

▸ TEMARIO COMPLETO

10 unidades · Álgebra, métricas e híbridos

Progresión estructurada: de los fundamentos matemáticos de la recuperación a la implementación de índices escalados y su conexión con modelos generativos.

1
Fundamentos
Repaso de álgebra lineal para recuperación
▼
  • Recordar normas, proyecciones y producto punto
  • Comprender la desigualdad de Cauchy-Schwarz
2
Léxico
BM25 en profundidad
▼
  • Derivar e implementar BM25 desde cero
  • Optimizar parámetros k1 y b
3
Evaluación
Métricas de evaluación en recuperación
▼
  • Calcular Recall@k, MRR, NDCG@k, Precision/Recall
  • Interpretar curvas de ganancia acumulada
4
Semántico
Embeddings y similitudes avanzadas
▼
  • Comparar métricas (coseno, producto punto, distancia euclídea)
  • Evaluar impacto de la normalización
5
Híbrido
Recuperación híbrida (BM25 + embeddings)
▼
  • Implementar ranker híbrido
  • Optimizar el peso alpha en fusión
6
Aumento
HyDE (Documentos hipotéticos)
▼
  • Generar documentos sintéticos con LLM
  • Mitigar riesgos de alucinación con umbrales
7
Diversidad
MMR (Maximum Marginal Relevance)
▼
  • Derivar la función de diversidad
  • Ajustar lambda según contexto
8
Optimización
Fine-tuning de embeddings
▼
  • Aplicar losses contrastivas (triplet, InfoNCE)
  • Implementar hard negative mining
  • Prevenir catastrophic forgetting
9
Escalado
Optimización de latencia y escalado
▼
  • Implementar ANN con índices HNSW, IVF
  • Evaluar trade-off velocidad-precisión
10
Cierre
Cierre y conexión con M-304
▼
  • Conectar recuperación con muestreo estocástico (difusión)
  • Sintetizar el aprendizaje del curso
▸ MODALIDAD

Diseñado para profesionales que practican

100% asincrónica, autogestionada, on-demand. Contenido en Moodle, tutor RAG 24/7, quizzes y entregables verificables con defensa conversacional.

Tutor RAG 24/7

Un asistente RAG entrenado sobre el contenido del curso responde tus dudas. Evalúa tu conocimiento mediante defensa conversacional.

  • Respuestas con fuentes citadas
  • Defensa conversacional
  • Contexto del curso completo

Contenido en Moodle

Lecciones estructuradas y referenciadas en texto. Sin videos interminables: leé, consultá y avanzá a tu ritmo.

  • Plataforma Moodle
  • Búsqueda instantánea
  • Ritmo personal

Notebooks en Google Colab

Notebooks ejecutables con código real. No pseudocódigo: cada técnica de recuperación se implementa y ejecuta.

  • Ejecución sin configuración
  • Código paso a paso
  • GPU disponible en Colab

Quizzes y entregables

Cada unidad tiene quizzes y entregables con verificación automática: tests sobre tu código, métricas de evaluación mínimas, etc.

  • Corrección automática
  • Criterios objetivos
  • Feedback inmediato
▸ METODOLOGÍA

De la teoría a la recuperación a escala

Ciclo estructurado que se repite en las 10 unidades para consolidar competencias verificables.

1

Recuperar

BM25 léxico y embeddings densos.

2

Híbrido

Fusión de scores y MMR para diversidad.

3

Optimizar

Fine-tuning de embeddings y HyDE.

4

Escalar

Índices ANN (HNSW, IVF) y latencia.

▸ STACK TECNOLÓGICO

Herramientas que usarás

Sin fricción de configuración. Todo se ejecuta en Google Colab.

🐍 Python
🔍 FAISS
⚡ HNSWlib
🧬 Sentence-Transformers
🔥 PyTorch
📚 Moodle
☁️ Google Colab
▸ CERTIFICACIÓN ACADÉMICA

Doble aval universitario, verificación digital

Al completar el curso recibís un certificado digital con doble aval: UTN Facultad Regional Reconquista e Instituto Data Science Argentina.

Certificado UTN + IDSA

Qué incluye el certificado

  • Doble firma: Decano UTN FRRQ + Director IDSA
  • Resolución oficial: 920/2020 UTN Facultad Regional Reconquista
  • Datos personalizados: nombre, DNI, curso, carga horaria y calificación
  • Código QR de verificación digital
  • Copia automática a la Facultad para registro oficial
  • Emisión por curso: no esperás al final del trayecto

Se emite al aprobar los quizzes del curso y los trabajos prácticos con estado aprobado.

▸ PREGUNTAS FRECUENTES

Resolvemos tus dudas

¿Qué es la optimización de recuperación en RAG?▼
Es el proceso de mejorar la calidad y velocidad con la que un sistema RAG extrae información relevante de una base de conocimiento, combinando métodos léxicos (BM25), semánticos (embeddings) y técnicas avanzadas como HyDE y MMR.
¿Necesito experiencia previa para este curso?▼
Perfil avanzado. Se recomienda dominio de Python, fundamentos de NLP y álgebra lineal básica. No se requiere experiencia previa con índices ANN, pero sí con programación Python intermedia-avanzada.
¿El curso es sincrónico o asincrónico?▼
100% autogestionado, on-demand y asincrónico. No hay horarios de clase ni sesiones en vivo. Avanzás a tu ritmo con contenido en Moodle, notebooks ejecutables y un tutor RAG disponible 24/7.
¿Qué herramientas se utilizan en el curso?▼
Notebooks ejecutables en Google Colab. Usaremos librerías como FAISS y HNSWlib para índices ANN, Sentence-Transformers para embeddings, PyTorch para fine-tuning y la plataforma Moodle para el contenido teórico.
¿Cómo se verifican los entregables?▼
Cada unidad incluye quizzes y entregables con verificación automática (métricas de recuperación mínimas, implementaciones correctas). Además, contarás con defensa conversacional mediante el tutor RAG para validar tu comprensión teórica.
¿Puedo pagar en cuotas?▼
Sí. Podés pagar hasta en 3 cuotas sin interés (total $200.000), o aprovechar el 20% de descuento pagando por transferencia en 1 pago, quedando en $160.000.
¿Cuál es el siguiente paso después de este curso?▼
M-303 es parte del trayecto de Optimización Algorítmica. Podés combinarlo con M-304 (Difusión), M-305 (Forecasting) o M-307 (Causalidad) como electivos. Si querés acceder al Frontier Program, necesitás haber completado la Diplomatura.

De la recuperación básica a la híbrida y escalable

10 unidades, 30 horas, verificable y aplicable. Dominá la fusión léxica y semántica para RAG de producción.

Artículo añadido al carrito.
0 artículos - $0,00