Modelos QWEN autohospedados en N8N

Hola,
¿Es posible integrar modelos QWEN autohospedados en N8N? ¿Puede QWEN funcionar con otros nodos en N8N, como Nodos de Javascript u otros? Una empresa quiere usar el modelo QWEN autohospedado como modelo de Chat de IA (LLM).

Sería útil si hubiera un nodo para:

Mi caso de uso:

¿Hay algún recurso que apoye esto?

¿Estás dispuesto a trabajar en esto?

Sí, por supuesto.
Esto debería publicarse en la categoría Preguntas

Cambié el tipo de tema a pregunta como mencionó @kjooleng.

Sí, es posible solo usar el estándar de Open AI e ingresa las credenciales ahí.

Sí, eso funciona bien. Los modelos QWEN son compatibles con OpenAI API, puedes integrarlos directamente en n8n. Hay dos formas:
La más sencilla: n8n tiene un nodo nativo Ollama-Model. Instala Ollama, descarga el modelo QWEN (ollama pull qwen2.5:7b), y apunta el nodo Ollama en n8n a http://localhost:11434. Listo. Funciona con AI Agent Node, Chat Node y en combinación con nodos JavaScript mediante el paso normal de elementos.

Por pura curiosidad:
¿Qué versión de QWEN planean usar y en qué hardware se ejecuta el servidor?

¡Bienvenido @nino_kariauli!

Sí, Qwen es compatible con la API de OpenAI, por lo que puedes conectarlo a n8n sin necesidad de ningún nodo personalizado. Dos enfoques según cómo lo alojes:

Opción 1 - Ollama (la más simple para alojamiento local):

  1. Instala Ollama y ejecuta ollama pull qwen2.5:7b (o el tamaño que se ajuste a tu hardware)
  2. En n8n, usa el nodo Ollama Chat Model y apúntalo a http://localhost:11434 (o a la IP de tu servidor si lo ejecutas de forma remota)
  3. Conéctalo al nodo AI Agent como el modelo

Opción 2 - API compatible con OpenAI (si usas vLLM, LM Studio o un endpoint de Qwen alojado):

  1. En n8n, crea una credencial de OpenAI API
  2. Establece la Base URL en tu endpoint (p. ej. http://your-server:8000/v1)
  3. Establece la clave API en lo que requiera tu servidor (o cualquier cadena si no tiene autenticación)
  4. Usa el nodo OpenAI Chat Model, establece el nombre del modelo en qwen2.5-7b-instruct (que coincida con lo que sirva tu servidor)

Ambas opciones funcionan directamente con el nodo AI Agent y transmiten el contexto de forma clara hacia/desde los nodos JavaScript Code a través de $input.first().json.

Para ser más específico respondiendo tu pregunta @nino_kariauli sobre nodos JavaScript, aquí está el flujo de datos

Después de ejecutar tu AI Agent (o nodo OpenAI Chat Model), envía el resultado a un nodo Code de esta manera

const aiResponse = $input.first().json.output; // Nodo AI Agent

Una trampa con la configuración de credenciales compatible con OpenAI es que el nombre del modelo que ingreses en n8n debe coincidir exactamente con lo que expone tu servidor. Ollama lo sirve como qwen2.5:7b, pero vLLM típicamente lo sirve como Qwen/Qwen2.5-7B-Instruct. Puedes verificar qué reporta tu servidor haciendo una solicitud GET /v1/models en tu endpoint.

Para un despliegue empresarial, algunas notas prácticas sobre dimensionamiento:

Qwen2.5-7B → ~8GB VRAM (bien para una sola GPU)

Qwen2.5-14B → ~16GB VRAM

Qwen2.5-72B → requiere multi-GPU o cuantización (GGUF Q4 lo reduce a ~40GB)

Si múltiples personas la usarán concurrentemente, opta por vLLM en lugar de Ollama — Ollama encola las solicitudes una a la vez, mientras que vLLM maneja el procesamiento por lotes correctamente para tráfico en producción.