Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Fine-tuning vs RAG vs prompting: ¿cuál deberías usar?
Usa prompting para aclarar la tarea, retrieval-augmented generation (RAG) para aportar conocimiento actual o privado, y fine-tuning para cambiar comportamientos repetibles del modelo. Estas técnicas resuelven problemas distintos y a menudo forman parte del mismo sistema.
Empieza con una línea base de prompting medida. Añade RAG cuando las respuestas necesiten evidencia externa o datos que cambien con frecuencia. Aplica fine-tuning cuando los fallos restantes sean comportamientos estables, como el formato, el tono, los límites de clasificación, el tool use o el lenguaje del dominio, y haya suficientes ejemplos revisados.
Última revisión: 2026-08-10. La decisión prioriza el tipo de fallo, las necesidades de evidencia, la calidad de los datos, la frecuencia de actualización, la latencia, el coste operativo y la capacidad para evaluar regresiones.
Tabla de decisión
| Problema | Primera intervención | Motivo |
|---|---|---|
| Las instrucciones no son claras o faltan ejemplos | Prompting | Es la forma más rápida de comprobar si el modelo base ya tiene esa capacidad. |
| Los datos son privados, deben citarse o cambian con frecuencia | RAG | La recuperación actualiza el conocimiento sin reentrenar y puede conservar la procedencia de las fuentes. |
| El comportamiento de salida es sistemáticamente incorrecto | Fine-tuning | Los ejemplos revisados pueden enseñar un formato, estilo, etiquetas o comportamiento de herramientas estables. |
| El modelo carece de la capacidad subyacente | Cambiar el modelo o el diseño del sistema | Prompting y fine-tuning no pueden crear de forma fiable una capacidad inexistente. |
| Las respuestas necesitan datos actuales y un comportamiento especializado | RAG más fine-tuning | La recuperación aporta la evidencia, mientras que el ajuste cambia cómo la utiliza el modelo. |
Usa prompting primero
Prompting es el diagnóstico más barato. Define la tarea, el contrato de salida, los ejemplos, las herramientas permitidas y las condiciones de rechazo. Crea un conjunto de evaluación pequeño antes de añadir más infraestructura. Si un prompt mejorado corrige los fallos representativos, detente ahí.
Prompting se vuelve frágil cuando el prompt contiene una base de conocimiento grande, excepciones repetidas o demostraciones largas. Es una señal para trasladar el conocimiento a la recuperación o el comportamiento a los datos de entrenamiento, no para seguir ampliando un único bloque de instrucciones.
Usa RAG para el conocimiento y la procedencia
RAG encaja con manuales de producto, políticas, documentos internos, acontecimientos recientes y cualquier respuesta que deba citar una fuente. Su calidad depende del análisis, el chunking, la recuperación, el ranking, los permisos y la compatibilidad con citas. Un generador más grande no puede recuperar la evidencia que la recuperación no haya encontrado.
RAG no es un método de entrenamiento del comportamiento. Puede mostrar al modelo un ejemplo o una regla, pero no hace que ese comportamiento sea estable en todas las solicitudes.
Usa fine-tuning para comportamientos repetibles
Fine-tuning encaja con la clasificación, el estilo de extracción, la estructura de las respuestas, la terminología del dominio y los patrones recurrentes de tool use. Requiere datos de entrenamiento revisados, un conjunto de evaluación reservado, versionado de artefactos y una vía de rollback. No hagas fine-tuning sobre datos que cambien a menudo cuando la recuperación pueda proporcionarlos en el momento de la solicitud.
Una secuencia práctica
- Define el éxito y crea un conjunto de evaluación representativo.
- Establece una línea base basada únicamente en prompting con el modelo más potente que sea aceptable.
- Añade RAG si los fallos se deben a evidencia ausente o cambiante.
- Recopila y revisa ejemplos de los fallos estables que persistan.
- Aplica fine-tuning solo si la mejora de calidad, latencia o coste compensa el trabajo adicional de datos y operaciones de modelos.
- Repite la misma evaluación después de cada cambio en el prompt, el índice, el modelo o el adapter.
Lecturas recomendadas
- Fine-Tuning LLMs cubre los datos, LoRA, la evaluación y el despliegue.
- RAG Evaluation Metrics muestra cómo localizar fallos por fase del pipeline.
- Context Engineering for AI Agents cubre el contexto de ejecución que rodea a los prompts y la recuperación.