Saltar al contenido principal
Generación aumentada de recuperación

RAG Chatbot para
Sitio web y documentación

Un chatbot RAG para sitios web, documentación y centros de ayuda que recupera de tu propio contenido en lugar de adivinar. ChattyBox responde preguntas como «¿Qué incluye el plan Pro?» desde tus páginas publicadas y cita la fuente, sin infraestructura de recuperación personalizada que construir ni alojar.

¿Qué es RAG?

RAG combina un modelo de lenguaje con contenido fuente recuperado. Antes de generar una respuesta, el chatbot busca en tus páginas publicadas los pasajes que coinciden con la pregunta.

Si tu prioridad es la confianza en las respuestas, combina este flujo de recuperación con un chatbot de IA fundamentado que evita respuestas inventadas mediante restricciones de fuente y respuestas de respaldo.

1

Recuperar

Cuando un visitante hace una pregunta, ChattyBox busca pasajes relevantes en el contenido indexado de sitios web, documentación, ayuda y CMS.

2

Aumentar

Esos pasajes fuente se añaden como contexto para que el modelo tenga algo concreto a partir de lo cual responder.

3

Generar

El modelo genera una respuesta concisa y puede incluir enlaces fuente para que los visitantes verifiquen los detalles.

Evidencia editorial probada

El recorrido RAG completo, desde la fuente hasta la respuesta citada

Un sistema RAG fiable es una cadena de etapas comprobables, no una única llamada al modelo. Esta arquitectura de referencia separa la preparación de contenido, la recuperación, la generación y la cita para que los equipos puedan localizar fallos y reindexar las fuentes modificadas sin reentrenar un modelo.

Autor técnico
Ingeniería de ChattyBox
Revisor técnico
Revisión de documentación de ChattyBox
Última actualización
Información verificada
9 de julio de 2026

Se revisa cuando cambia el comportamiento de recuperación y al menos cada seis meses.

Diagrama de arquitectura RAG que muestra las etapas de rastreo, análisis, fragmentación, incrustación, recuperación, aviso, respuesta y cita
Las fuentes se preparan en un índice, se recuperan los pasajes relevantes para cada pregunta y la respuesta conserva los enlaces a las páginas de respaldo.
Cada etapa tiene una salida y una comprobación de calidad distintas; probar solo la prosa final oculta defectos de indexación y recuperación.
EtapaQué ocurreControl a verificar
Etapa
1. Rastreo
Qué ocurre
Descubre las páginas permitidas a partir de URL y sitemaps.
Control a verificar
Las URL esperadas están presentes; las rutas excluidas y privadas están ausentes.
Etapa
2. Análisis
Qué ocurre
Extrae encabezados, prosa, listas, tablas, código, URL canónicas y metadatos.
Control a verificar
Se elimina el ruido de navegación sin perder comandos ni etiquetas de versión.
Etapa
3. Fragmentación
Qué ocurre
Divide el contenido en pasajes coherentes que conservan la identidad de página y sección.
Control a verificar
Cada pasaje se entiende por sí solo y conserva los requisitos previos.
Etapa
4. Inserción
Qué ocurre
Representa los pasajes para la coincidencia semántica y almacena los metadatos de origen.
Control a verificar
Cada vector se asigna a un pasaje de origen actual y permitido.
Etapa
5. Recuperación
Qué ocurre
Ordena un pequeño conjunto de pasajes frente a la pregunta del visitante.
Control a verificar
Las pruebas de Recall@k colocan el pasaje de referencia en el conjunto de contexto.
Etapa
6. Aviso
Qué ocurre
Combina la pregunta, los pasajes, los metadatos de origen y las reglas de respaldo.
Control a verificar
Las instrucciones no pueden ampliar permisos ni anular las reglas de respaldo.
Etapa
7. Respuesta
Qué ocurre
Genera solo los detalles con respaldo o rechaza cuando la evidencia sea insuficiente.
Control a verificar
Las afirmaciones materiales siguen el contexto; la evidencia faltante activa el respaldo.
Etapa
8. Cita
Qué ocurre
Adjunta la página y sección canónicas que respaldan la respuesta.
Control a verificar
Los enlaces se resuelven, coinciden con la versión y respaldan directamente la afirmación.

Actualización y reindexación

Un cambio en una fuente no se puede recuperar hasta que la página afectada se rastree, analice, fragmente e incruste de nuevo. Haz seguimiento de las revisiones de origen, sustituye los fragmentos obsoletos en lugar de añadir duplicados, elimina las páginas borradas y prueba respuestas representativas tras la reindexación. Define la frecuencia de rastreo a partir de la ventana más corta aceptable de respuesta obsoleta para precios, políticas y documentación versionada.

Límites de fuentes públicas y privadas

Las páginas públicas pueden compartir un mismo alcance de rastreo. Los datos privados, de inquilino, de empleado o de cuenta necesitan ingesta autenticada y autorización en el momento de la recuperación antes de que los pasajes entren en el aviso. Las reglas de robots no son control de acceso. Nunca indexes secretos y comprueba que las identidades no autorizadas no puedan recuperar títulos, fragmentos, URL ni detalles de respuestas de fuentes restringidas.

Evalúa la recuperación antes de juzgar la redacción

Usa un conjunto versionado de preguntas con pasajes de origen conocidos, afirmaciones esperadas y casos de respaldo esperados. Ejecútalo tras cambios de origen, fragmentación, inserción, clasificación o aviso, e inspecciona los fallos por etapa.

SeñalCómo medirlaFallo que expone
Señal
Recall@k
Cómo medirla
Proporción de preguntas respondibles en las que un pasaje de referencia aparece entre los k resultados principales.
Fallo que expone
Cobertura de rastreo faltante, fragmentos débiles, desajuste de vocabulario o inserciones obsoletas.
Señal
Calidad de la clasificación
Cómo medirla
Registra el rango recíproco o el nDCG de los pasajes relevantes evaluados.
Fallo que expone
Existe una página relevante pero el ruido o una versión obsoleta la superan en la clasificación.
Señal
Respaldo de afirmaciones
Cómo medirla
Revisa cada afirmación material frente a los pasajes suministrados al modelo.
Fallo que expone
La respuesta combina suposiciones con evidencia o exagera la fuente.
Señal
Precisión de las citas
Cómo medirla
Verifica que cada cita se resuelva y respalde directamente la afirmación asociada.
Fallo que expone
La respuesta correcta enlaza a una página solo relacionada o a la versión equivocada.
Señal
Precisión y exhaustividad del respaldo
Cómo medirla
Incluye preguntas no respondibles y de fuentes conflictivas; puntúa las declinaciones correctas y las respuestas omitidas.
Fallo que expone
El bot conjetura sin evidencia o se niega a pesar de haber evidencia suficiente.
Señal
Retraso de actualización
Cómo medirla
Mide el tiempo desde un cambio publicado en la fuente hasta una respuesta recuperada correcta.
Fallo que expone
Retraso de rastreo, fragmentos obsoletos duplicados o propagación de eliminación fallida.

Elige RAG para conocimiento cambiante y atribuible

MétodoMejor encajeLímite importante
Método
Búsqueda por palabras clave o en el sitio
Mejor encaje
Los usuarios quieren páginas ordenadas y leerán la fuente por sí mismos.
Límite importante
No sintetiza una respuesta y puede pasar por alto coincidencias semánticas.
Método
RAG
Mejor encaje
El conocimiento cambia, las citas importan y las respuestas abarcan unos pocos pasajes.
Límite importante
La calidad depende de la cobertura de rastreo, la recuperación, los permisos y la calidad de la fuente.
Método
Ajuste fino
Mejor encaje
Enseña un estilo, formato, clasificación o comportamiento de tarea estables.
Límite importante
No es un reemplazo fiable de datos actuales, citas o eliminación de fuentes.
Método
Avisos con contexto largo
Mejor encaje
Un conjunto de documentos acotado cabe en el contexto y todos los elementos son relevantes.
Límite importante
El coste y el ruido crecen con el contexto; los permisos y la actualización siguen necesitando controles.

Cómo evaluar un chatbot RAG para atención al cliente

No existe una opción universalmente mejor. Prueba la fidelidad de las citas, el comportamiento alternativo, la actualidad de las fuentes, el contenido contradictorio, el escalado, los límites del contexto privado, los análisis, las integraciones y el esfuerzo de implementación con las mismas preguntas de soporte.

Respuestas sobre contenido público

Un chatbot RAG enfocado puede responder preguntas repetidas a partir de documentos y artículos de ayuda aprobados, con citas y un comportamiento alternativo conservador.

Acciones de cuenta y gestión de casos

Elige una suite de soporte más amplia cuando necesites acciones de cuenta autenticadas, enrutamiento de tickets, SLA, espacios de trabajo para agentes u operaciones multicanal.

Ejecuta las mismas pruebas de límites

Incluye preguntas con información ausente, desactualizada, contradictoria, privada y de alto impacto. Registra URL citadas, rechazos, derivaciones y notas del revisor en lugar de publicar una puntuación no verificada.

Planifica el límite de soporte y escalado · Evalúa las pruebas de fuentes enlazadas · Usa la lista de verificación para reducir alucinaciones

Recorrido de fuente a respuesta

Supón que la página de instalación indexada indica que el script del widget debe ir justo antes de la etiqueta body de cierre. La recuperación debería seleccionar ese pasaje, el aviso debería prohibir consejos de ubicación sin respaldo, y la respuesta debería exponer la instrucción con la página de instalación adjunta como evidencia.

  1. 1. La pregunta se inserta y se compara con los fragmentos permitidos.
  2. 2. El pasaje de instalación se clasifica por encima de páginas más amplias del widget.
  3. 3. El modelo responde solo al detalle de ubicación presente en ese pasaje.
  4. 4. La tarjeta de origen enlaza al usuario con la página exacta de documentación.

Continúa con las guías sobre citas de fuentes, Chatbot para Docusaurus con fuentes citadas, chatbots de documentación para desarrolladores y el Chatbot de IA para MkDocs con citas de fuentes.

Asistente de documentación
x
¿Dónde debo añadir el script del widget?
Añade el script del widget de ChattyBox justo antes de la etiqueta body de cierre en cada página donde deba aparecer el widget.
Haz una pregunta...
Con tecnología de ChattyBox

Cómo mantiene ChattyBox la recuperación de forma práctica

Índice de contenido con búsqueda

Tus páginas de sitio web, documentación, centro de ayuda y CMS se indexan para que el chatbot pueda buscar el contenido que ya publicas.

Modelo de incrustaciones

Las incrustaciones ayudan a relacionar las preguntas de los visitantes con pasajes fuente relevantes incluso cuando la redacción es distinta.

Recuperación enfocada

Para cada pregunta, ChattyBox recupera un pequeño conjunto de pasajes relevantes en lugar de pedir al modelo que responda de memoria.

Avisos limitados al contexto

El paso de respuesta está limitado al contexto recuperado y configurado para evitar afirmaciones sin respaldo.

Enlaces de citas

Cada respuesta incluye enlaces a las páginas fuente, de modo que los usuarios pueden verificar la información.

Manejo de respaldo

Cuando falta contenido relevante, el bot puede recurrir a un respaldo en lugar de improvisar una respuesta sin apoyo.

RAG chatbot frente a chatbot genérico de IA

Un chatbot genérico responde desde una amplia memoria de modelo y puede parecer seguro sobre cosas que no sabe. Un chatbot RAG recupera primero sus páginas, por lo que la respuesta está vinculada al contenido que publicó y se puede verificar.

Chatbot genérico de IA
  • Respuestas de la memoria amplia del modelo, no de su contenido.
  • Puede inventar funciones, precios o pasos que no están en sus documentos.
  • No hay una fuente clara para verificar la respuesta.
RAG chatbot
  • Recupera primero el contenido de ayuda, los documentos y el sitio web publicado.
  • Retrocede en lugar de adivinar cuando la fuente no contiene la respuesta.
  • Cita la página que utilizó para que los visitantes puedan verificar cada reclamo.

Cuando las citas sean prioritarias, combina la recuperación con un chatbot de IA con citas de fuentes que vincula las respuestas respaldadas con sus páginas de origen.

RAG sin reconstruir tu pila de contenido

Conecta tu contenido de sitio existente, prueba la calidad de las respuestas e incrusta un chatbot con citas de fuentes cuando las respuestas se vean correctas.

Empieza gratis, sin tarjeta de crédito

We use optional analytics and tag-management tools to understand site use. Choose whether to allow Ahrefs Web Analytics, PostHog, and Google Tag Manager. Turning analytics off reloads this page so the change takes effect cleanly. Essential site functionality and error monitoring are not controlled by this choice. Read our privacy policy.