Lectico

Plan Starter y superior — Los asistentes de Ventas y Soporte técnico no están disponibles en el plan Free. Consulta los planes disponibles para más información.

Qué es el scraping web

El scraping es el proceso mediante el cual Lectico visita una URL de tu sitio web, renderiza la página completa (incluyendo contenido generado por JavaScript) y extrae el texto relevante. A partir de ese contenido, la IA genera automáticamente preguntas y respuestas organizadas por categorías, que alimentan el conocimiento de tu asistente.

El scraping es la forma principal de cargar conocimiento en un asistente de Ventas. Puedes agregar las URLs de tu landing page, página de producto, precios o cualquier sección relevante de tu sitio web.

En un asistente de Soporte técnico, el scraping te permite importar tu documentación, help center o base de conocimiento existente directamente desde las URLs donde está publicada.

Cómo agregar una URL

Abre la sección de conocimiento de tu asistente

En el sidebar izquierdo, haz clic en Conocimiento. En el grid de asistentes, haz clic en la tarjeta del asistente al que deseas agregar contenido.

Localiza la sección de fuentes

En la parte superior de la pantalla de detalle del asistente, verás tres contadores: Fuentes, Categorías (o Temas en Ventas) y Respuestas. Debajo de estos contadores se encuentra la sección Fuentes.

Añade una nueva URL

Haz clic en el botón + Añadir junto a la sección de fuentes. Se desplegará un menú con las opciones disponibles. Selecciona la opción de URL e ingresa la dirección completa de la página que deseas importar (por ejemplo, https://tu-sitio.com/productos).

Confirma y espera el procesamiento

Una vez confirmada la URL, Lectico inicia el scraping en segundo plano. No necesitas permanecer en esta pantalla: puedes navegar a otras secciones y volver cuando el proceso termine.

Importar múltiples URLs de una sola vez

Si tu documentación o sitio tiene muchas páginas, puedes importar todas en una sola operación — ya sea desde el wizard de creación de un asistente de Soporte, o desde la sección de Conocimiento con "Importar documentación web".

Introduce la URL raíz de tu documentación

En el wizard de un asistente de Soporte, en el paso de Conocimiento, selecciona URL de documentación e introduce la URL raíz (por ejemplo, https://docs.tu-sitio.com). Haz clic en Explorar documentación.

Revisa las páginas descubiertas

Lectico renderiza tu sitio y detecta automáticamente las subpáginas. Verás una lista agrupada por secciones (basada en la estructura de URLs) con las páginas disponibles. Junto a la lista se muestran:

  • Tu plan actual y las páginas disponibles este mes.
  • Un banner de sugerencia de upgrade si tu sitio tiene más páginas de las que tu plan permite.

Selecciona las páginas a importar

Marca o desmarca según tus necesidades. Usa Seleccionar todas para incluir el máximo permitido por tu plan, o filtra por URL si hay muchos resultados.

Crea el asistente (o confirma el import)

Haz clic en Crear asistente con N páginas (o Importar N páginas desde Conocimiento). Lectico encola todas las páginas y te lleva al detalle del asistente.

Las páginas se procesan una a una en segundo plano: la primera genera las categorías del cuestionario y las siguientes distribuyen su contenido en esas categorías, manteniendo una organización coherente.

¿Cuánto tarda? Aproximadamente 30-60 segundos por URL. Un batch de 5-10 páginas suele terminar en 3-10 minutos; 50 páginas pueden tardar alrededor de una hora. Puedes cerrar la pestaña — el procesamiento continúa.

¿Por API? El mismo pipeline está disponible vía POST /v1/agents/:id/knowledge/batch. Ver la referencia de la API.

Descubrimiento recursivo de páginas

Cuando introduces la URL raíz de un sitio de documentación, Lectico no se limita a leer los enlaces de esa primera página: recorre el sitio entero de forma recursiva para encontrar todas las páginas, incluidas las que están varios niveles de profundidad por debajo.

Esto importa especialmente en sitios de documentación modernos (Fumadocs, Docusaurus, Mintlify, VitePress, MkDocs…), que en muchos casos se renderizan en el navegador (SPA). En esos sitios, el menú lateral solo muestra los enlaces de la sección activa, así que una lectura única de la página raíz dejaría fuera la mayor parte del contenido.

Cómo descubre las páginas

Lectico combina dos estrategias para obtener el listado completo:

EstrategiaCuándo se usaQué hace
SitemapSi el sitio publica un sitemap.xml válido con suficientes URLsSe usa directamente como fuente autoritativa: una sola petición, listado completo. Es lo habitual en sitios generados de forma estática (Docusaurus, VitePress, MkDocs).
Recorrido recursivoSi no hay sitemap útil (frecuente en SPAs)Lectico parte de la URL que indicaste, renderiza la página, sigue los enlaces que encuentra dentro del mismo sitio y repite el proceso página a página hasta recorrer todo el árbol.

El recorrido recursivo respeta el ámbito de la URL que introduces:

  • Si indicas una subsección concreta —por ejemplo https://docs.tu-sitio.com/docs—, Lectico explora esa subsección y todo lo que cuelga de ella (/docs/**), sin salirse a otras secciones del dominio.
  • Si indicas la raíz del dominio, explora todo el sitio.
  • Siempre se queda dentro de tu mismo dominio: no sigue enlaces a sitios externos.

¿Cuánto tarda el descubrimiento? El recorrido recursivo es una operación puntual que se ejecuta al pulsar Explorar documentación. Para un sitio de ~130 páginas suele tardar alrededor de 1-2 minutos. Verás un indicador de progreso; no cierres el modal hasta que termine.

Límite de páginas descubiertas

El descubrimiento puede listar hasta varios cientos de páginas. El número que finalmente importas depende de tu plan: en la pantalla de selección verás tu plan actual y las páginas disponibles este mes, y un aviso si el sitio tiene más páginas de las que tu plan permite. Marca o desmarca las páginas según tus necesidades antes de confirmar.

Si tu sitio es muy grande y supera el tope de descubrimiento, Lectico te lo indicará: el listado será parcial. En ese caso puedes importar primero las secciones más relevantes y añadir el resto más adelante (ver actualización incremental).

Actualización incremental por página

Tu documentación cambia: editas una página, publicas una nueva o retiras otra. En un asistente de Soporte técnico no necesitas volver a rastrear el sitio completo para reflejar esos cambios — puedes actualizar una sola fuente y Lectico reindexa únicamente esa página.

La actualización incremental por página aplica a los asistentes de Soporte técnico, que cargan sitios de documentación. En Ventas y Formación, gestiona el conocimiento desde sus flujos habituales.

Cuando una página de tu documentación cambia, vuelve a leerla sin tocar el resto del sitio:

Abre la sección de fuentes

En Conocimiento, selecciona tu asistente de Soporte y localiza la lista de Fuentes.

Vuelve a analizar la fuente

Junto a la URL que quieres actualizar, haz clic en Volver a analizar. Lectico vuelve a leer esa página, extrae su contenido actualizado y reemplaza únicamente los fragmentos correspondientes a esa URL.

Confirma la reindexación

Al terminar, verás un aviso con el número de fragmentos reindexados. El resto de páginas de tu conocimiento permanece intacto.

Como Lectico reemplaza los fragmentos de esa URL (no los añade), volver a analizar una página no genera duplicados: el conocimiento queda exactamente con el contenido más reciente.

Para incorporar una página nueva a un asistente de Soporte que ya está activo:

Añade la URL

En la sección Fuentes, haz clic en + Añadir y selecciona la opción de URL. Introduce la dirección completa de la nueva página.

Espera la indexación incremental

Lectico lee la página, genera sus fragmentos y los añade al conocimiento existente. El aviso de confirmación refleja que la página se ha indexado. No hace falta reprocesar todo el sitio.

Si una página deja de existir o ya no quieres que el asistente la use:

Elimina la fuente

En la lista de Fuentes, elimina la URL que quieras retirar.

Verifica que desaparece del conocimiento

Lectico borra todos los fragmentos asociados a esa URL. A partir de ese momento el asistente deja de responder en base a esa página.

La actualización incremental es idempotente: editar o volver a analizar una página deja el conocimiento con el contenido más reciente de esa URL, sin acumular versiones antiguas ni fragmentos huérfanos.

Render JavaScript completo

A diferencia de un scraping básico, Lectico renderiza completamente la página usando un navegador headless. Esto significa que el contenido generado dinámicamente por JavaScript (como secciones que cargan al hacer scroll, contenido de frameworks como React o Vue, o elementos que dependen de llamadas a APIs) se captura correctamente.

No necesitas hacer nada especial para activar esta funcionalidad: se aplica automáticamente a todas las URLs.

Estados del job de scraping

Cada URL que agregas genera un job de scraping. En la sección Fuentes de la pantalla de conocimiento, puedes ver el estado de cada job:

EstadoSignificado
En progresoLa URL está siendo procesada. El scraping, extracción y análisis de contenido están en curso.
CompletadoEl contenido fue extraído y procesado correctamente. Las preguntas y respuestas ya están disponibles.
ErrorHubo un problema al acceder o procesar la URL. Verifica que la dirección sea correcta y que la página sea accesible públicamente.

Procesamiento en segundo plano

El pipeline completo que se ejecuta tras agregar una URL incluye las siguientes etapas:

  1. Preparando fuente — Lectico se conecta a la URL y prepara el entorno de renderizado.
  2. Extrayendo contenido — El navegador renderiza la página y extrae el texto relevante, filtrando navegación, footers y otros elementos no informativos.
  3. Generando Q&A — La IA analiza el contenido extraído y genera preguntas y respuestas organizadas por categorías.
  4. Validando calidad — Cada respuesta pasa por el juez de calidad para verificar su precisión.
  5. Vectorizando respuestas — Las respuestas confirmadas se indexan para que el asistente pueda usarlas al responder.

Este proceso se ejecuta completamente en segundo plano. Puedes cerrar la pestaña del navegador y volver más tarde: el procesamiento continúa sin interrupción.

Después del scraping

Una vez completado el procesamiento, encontrarás las preguntas y respuestas generadas en la sección de conocimiento de tu asistente, organizadas por categorías. Desde allí puedes:

El número de URLs que puedes agregar por asistente depende de tu plan. Consulta tu pantalla de Consumo en el sidebar para ver tus límites actuales.

Playground

En la esquina inferior derecha de la pantalla de conocimiento, verás un botón flotante con un icono de chat. Haz clic para abrir el Playground y probar tu asistente con preguntas basadas en el contenido recién importado.

Próximos pasos