Quiero construir un flujo de trabajo multi-agente de IA que escanee todos nuestros sitemaps y proporcione recomendaciones de estrategia de contenido

¡Hola! He intentado varias veces que un workflow funcione y no logro hacerlo bien. Mi jefe tiene una startup, y el equipo que contrató era nuevo en esto porque ninguno de nosotros había gestionado un proyecto grande como este antes. En el pipeline de publicación de contenido, eso significa que recibes alrededor de 500 blogs y te das cuenta de que acabas de torturar a todo el equipo. Ahora soy un gran creyente en la planificación de contenido.

Así que pasamos nuestro tiempo reescribiendo contenido ya escrito, buscando en el sitemap palabras clave que queremos posicionar para ver si ya las usamos, etc.

Aquí está lo que sé que lo arreglería: (versión básica)

Mi Workflow:

Paso 1: Extraer Cada URL del Sitemap

Quiero que n8n extraiga múltiples sitemaps XML de varios sitios web y almacene todas las URLs en datasets/tablas organizadas por separado.

El workflow haría:

  • Obtener XML del sitemap

  • Analizar todas las URLs

  • Limpiar slugs/títulos

  • Alertarnos sobre duplicados

  • Categorizar URLs por:

  • Relación semántica

Rastreará primero para obtener la información más actualizada.


Paso 2: Crear una Base de Datos de Contenido Buscable

Quiero que todas las URLs, títulos, categorías, palabras clave y quizás embeddings se almacenen en algún lugar buscable.

Almacenamiento posible:

  • Google Sheets (temporal/pruebas)

Objetivo principal:
Cuando alguien ingresa una palabra clave o idea de tema, el sistema verifica al instante:

  • ¿Ya cubrimos esto?

  • ¿Lo cubrimos parcialmente?

  • ¿Hay riesgo de canibalización?

  • ¿Es realmente un clúster faltante?

  • ¿Qué página debería apoyar este tema internamente?


Paso 3: Agente de Decisión IA

Esta es la parte con la que sigo teniendo dificultades.

Quiero un agente IA que:

  1. Reciba una idea de contenido o palabra clave

  2. Elija el sitio web/proyecto correcto

  3. Busque en el sitemap/base de datos de contenido apropiado

  4. Analice la superposición semántica

  5. Determine:

    • Cobertura existente

    • Cobertura faltante

    • Intención de ingresos

    • Intención de búsqueda

    • Ubicación de clúster sugerida

    • Oportunidades de enlaces internos

Básicamente:
“¿Deberíamos escribir este artículo o no?”

Y si es sí:

  • ¿Dónde pertenece?

  • ¿Qué tema padre lo apoya?

  • ¿Qué artículos relacionados deberían existir a su alrededor?

  • ¿Qué páginas deberían enlazarla?


Paso 4: Generación de Clústers de Temas Faltantes

Una vez que el sistema encuentra una brecha, quiero que genere:

  • Ideas de artículos faltantes

  • Artículos de apoyo semántico

  • Preguntas frecuentes

  • Ángulos de “La gente también pregunta”

  • Páginas comerciales de apoyo

  • Modificadores de ubicación

  • Relaciones de entidades

  • Oportunidades de estudios de caso

Estoy fuertemente influenciado por el mapeo de autoridad temática al estilo de Koray, pero quiero que sea práctico para operaciones de contenido reales.


Paso 5: Generación de Brief de Contenido

Si se aprueba:
Generar un brief de contenido estructurado que incluya:

  • Palabra clave principal

  • Palabras clave secundarias

  • Intención de búsqueda

  • Etapa del embudo

  • Encabezados recomendados

  • Enlaces internos

  • Objetivos de conversión

  • Sugerencias de CTA

  • Sugerencias de schema

  • Brechas de competidores

  • Longitud de palabra sugerida

  • Entidades/temas importantes a mencionar


Problemas Actuales con los que Sigo Topándome

  • Ideas de contenido duplicadas

  • Agentes que olvidan datos previos del sitemap o agregan títulos que no existen

  • Ventanas de contexto sobrecargadas

  • Búsquedas semánticas lentas

  • IA generando temas ya cubiertos

  • Mala organización entre múltiples sitios web

  • Dificultad para enrutar prompts a la base de datos del sitio correcto

  • Formateo JSON rompiéndose entre nodos

  • Embeddings/configuraciones de búsqueda volviéndose costosas rápidamente

¿Es realmente la mejor manera de configurar esto? Realmente quiero que funcione. A mi jefe le robaron $150k en su primer año. No necesita las fugas en producción, y eso pondría nuestra estrategia de contenido en “a prueba de fallos e intocable”.

¡Se agradecerá cualquier ayuda!

bienvenido a la comunidad de n8n @Workflow_Student
No empezaría esto como un gran flujo de trabajo multi-agente. Yo lo dividiría en dos flujos de trabajo primero. Un flujo de trabajo debe ingerir y normalizar los datos del sitemap en un índice de contenido real con URL, sitio, título, slug, tema, metadatos e incrustaciones. El segundo flujo de trabajo debe recibir una palabra clave, recuperar solo los registros relevantes de ese índice, y luego pedirle a la IA que decida basándose en esos registros recuperados. El Agente de IA de n8n puede usar herramientas y almacenes de vectores, pero no recordará mágicamente todos los datos del sitemap a menos que le des una capa de recuperación adecuada, y el Analizador de Salida Estructurada es la forma más segura de mantener la recomendación final en una forma JSON predecible. Para una primera versión funcional, evitaría “multi-agente” y construiría un flujo de trabajo RAG controlado con un paso de recuperación claro, un paso de decisión, y un breve paso de generación.

Hola — esto parece que necesita un prototipo más pequeño antes de un sistema multiagente completo.

Yo empezaría con: entrada de URL de sitemap → rastreo/extracción de metadatos de página → agrupación de páginas por tema → recomendaciones de IA con enlaces de fuente → salida en Google Sheet/Doc. Mantenerlo determinista primero, luego añadir agentes solo donde mejoren la revisión o priorización.

Si puedes compartir un sitemap y el formato de salida deseado, puedo presupuestar un flujo inicial fijo.

Contacto: travisofwork@gmail.com