La calidad de un RAG depende sobre todo de la recuperación: si no traes el fragmento pertinente, el modelo no puede usarlo. La búsqueda puramente vectorial es buen punto de partida, pero falla con nombres exactos, códigos y términos raros. Combinar recuperación densa y léxica, y reordenar después, cierra esa brecha.
Densa y léxica: dos tipos de falla
- Densa (embeddings): captura semántica y sinónimos, pero difumina términos exactos y tokens infrecuentes.
- Léxica (BM25): acierta con palabras exactas y códigos, pero ignora parafraseo y sinónimos.
Búsqueda híbrida
Un buscador híbrido ejecuta ambos recuperadores y fusiona sus rankings, por ejemplo con reciprocal rank fusion. Lo que cada método recupera bien sube, y la debilidad de uno la compensa el otro.

Reranking con cross-encoder
El índice vectorial usa un bi-encoder (consulta y documento por separado) porque es rápido. Un cross-encoder lee consulta y documento juntos y puntúa su relevancia con mucha más precisión, pero es caro: se usa solo sobre un top-k pequeño para reordenar.
Reescritura de la consulta
- Multi-query: genera variantes de la pregunta para ampliar la recuperación.
- HyDE: escribe una respuesta hipotética y busca por similitud a ella.
- Expansión: añade términos que el usuario omitió.
| Método | Ventaja | Debilidad |
|---|---|---|
| Vectorial (bi-encoder) | rápido y semántico | términos exactos y tokens raros |
| BM25 (léxico) | términos exactos | sinónimos y paráfrasis |
| Híbrido + RRF | mejor recall | requiere afinar la fusión |
| Cross-encoder (rerank) | precisión al reordenar | coste alto, solo sobre candidatos |
Errores frecuentes
- Confiar solo en denso cuando el dominio usa códigos, modelos o leyes numeradas.
- Pedir top-k muy grande: diluye el contexto útil y encarece la generación.
- Reordenar con un cross-encoder mal calibrado que prioriza longitud.
Ejemplo resuelto: el documento exacto no aparece
- Confirmar que la consulta incluye un término exacto (un SKU o un número de norma).
- Añadir BM25 al pipeline vectorial y fusionar con RRF.
- Sobre el top-50 fusionado, aplicar un cross-encoder para quedarse en top-5.
- Medir con el set de evaluación de RAG si la respuesta ahora tiene el fragmento correcto.
¿Para qué sirve en la realidad?
Buena parte de la "mala respuesta" de un RAG es en realidad mala recuperación. Híbrido + reranking es la palanca más rentable para subir la calidad sin cambiar de modelo ni de base vectorial.
¿Por qué se combina BM25 con búsqueda vectorial en un sistema híbrido?
Un cross-encoder se usa para reordenar un conjunto pequeño de candidatos porque es caro pero preciso.
La técnica de reescritura que genera una respuesta hipotética y busca documentos similares a ella se llama .
Clasifica cada técnica según si amplía candidatos o los reordena.
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Une cada término con su definición.
Recuperación avanzada
Toca una tarjeta para ver la respuesta.
Recuperación híbrida y reranking
- Recuperacion RAG
- Hibrida
- vectorial semantica
- vectorial semantica
- BM25 lexica
- Hibrida
- fusion RRF
- cross-encoder caro
- multi-query
Retrieval-Augmented Generation (Lewis et al., 2020)Paper fundacional que acopla recuperador y generador.
Survey de RAG para grandes modelos de lenguajePanorama de estrategias de recuperación y reranking.
Tu RAG legal falla en consultas que citan números de artículo exactos. ¿Qué pieza del pipeline (chunking, denso, léxico o reranker) te espera que más impacte, y cómo lo confirmarías con la evaluación de RAG?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.