Describe el problema/error/pregunta
Estoy intentando averiguar por qué un nodo Information Extractor está realizando 10+ llamadas a un LLM en una única ejecución para una única entrada - el problema es que está usando 10 veces el número de tokens necesarios.
Estoy usando un nodo Information Extractor con Google Gemini 2.5 Flash. Estoy usando un prompt bastante grande y pasando una gran cantidad de texto como contenido a analizar (25K+ tokens de prompt y contenido). El nodo Information Extractor está configurado con un esquema JSON.
El 99%+ del tiempo esto funciona perfectamente. Hoy, he estado recibiendo mensajes de error 524 como ventanas emergentes en la interfaz de usuario, y el nodo Extractor está llamando al subnodo Gemini 10+ veces, llevando los conteos totales de tokens de 35K a más de 500K.
Tengo los reintentos deshabilitados, y continuar en caso de error, salida a una interfaz de error. ¿Por qué el nodo extractor está enviando mi prompt y contenido al modo LLM más de una vez? ¿Cómo evito este comportamiento no deseado?
¿Cuál es el mensaje de error (si existe)? Problema con reintentos
La solicitud falló con el código de estado 524
Comparte tu workflow
(Selecciona los nodos en tu lienzo y usa los atajos de teclado CMD+C/CTRL+C y CMD+V/CTRL+V para copiar y pegar el workflow.)
Comparte la salida devuelta por el último nodo
Información sobre tu configuración de n8n
- Versión de n8n: 2.25.7
- Base de datos (predeterminado: SQLite): N/A
- Configuración n8n EXECUTIONS_PROCESS (predeterminado: own, main):
- Ejecutando n8n mediante (Docker, npm, n8n cloud, aplicación de escritorio): n8n Cloud
- Sistema operativo:
@am4c130d ese 524 es un tiempo de espera agotado de la puerta de enlace, Gemini simplemente no respondió a tiempo hoy, y las 10+ llamadas son reintentos que se disparan por debajo del reintento a nivel de nodo que desactivaste, están en la capa del modelo. ¿puedes verificar las opciones en tu subnodo Gemini Chat Model, cuál es el máximo de reintentos establecido allí?
Gracias por la respuesta rápida.
En el Information Extractor - los reintentos están deshabilitados.
En el nodo de chat de Gemini las únicas opciones que tengo son: máximo de tokens, temperatura de muestreo, Top K, Top P, Configuración de seguridad. En la pestaña de configuración solo hay una opción de Notas.
No veo cómo gestionar los reintentos.
@am4c130d sí, ese es el problema, n8n no expone el maxRetries del modelo así que no puedes limitarlos desde el nodo, son los reintentos internos de langchain los que se disparan en el timeout. la palanca que realmente tienes es el 524 en sí, es un gateway timeout que se activa cuando una llamada se ejecuta demasiado tiempo (alrededor de 100s), y tu solicitud de 25k tokens es lo suficientemente lenta como para alcanzarlo mientras gemini está lento hoy. si puedes, divide el contenido en pasadas más pequeñas para que cada llamada termine bien por debajo de eso, sin timeout significa sin cascada de reintentos y sin quemarse 10x. si realmente necesita los 25k completos en una sola pasada, la otra ruta es llamar a gemini a través de un nodo HTTP Request donde controlas el timeout y los reintentos tú mismo, luego analiza el json después.
Gracias, eso se alinea con lo que estoy leyendo también - voy a investigar el nodo HTTP, ya que probablemente sea más fácil que dividir mi prompt.
Gracias - voy a marcar tu respuesta como solución, ya que es la respuesta pragmática.
¡De nada! ¡Me alegra haber podido ayudarte!
¡Bienvenido @am4c130d!
El 524 desencadena una cascada de reintentos a nivel de LangChain - esa es la causa raíz que achamm describió. Una corrección adicional específica para n8n autohospedado: establece la variable de entorno N8N_DEFAULT_HTTP_TIMEOUT a un valor más alto (el valor predeterminado es 300000ms / 5 min). Si tu proxy inverso o CDN tiene un tiempo de espera más corto que lo que tarda tu llamada a Gemini, el 524 se dispara antes de que n8n pueda completar, desencadenando reintentos antes de que la primera llamada haya fallado realmente. También vale la pena revisar: si estás usando Cloudflare, su tiempo de espera de puerta de enlace predeterminado es de 100 segundos, lo que puede afectar las llamadas a Gemini 2.5 Flash de 25K tokens en días de mucho tráfico.
Gracias, estoy usando n8n cloud, así que n8n elige el proxy, etc. Aparte de autohospedarme, en cuyo caso usaría un modelo local, seguiré la solución de @achamm.