QWEN selbst gehostete Modelle in N8N

Hallo,
Ist es möglich, QWEN selbst gehostete Modelle in N8N zu integrieren und kann QWEN mit anderen Knoten in N8N zusammenarbeiten, wie JavaScript-Knoten oder andere. Ein Unternehmen möchte ein selbst gehostetes QWEN-Modell als AI-Chat-Modell (LLM) nutzen.

Ein Knoten würde für folgende Aufgaben hilfreich sein:

Mein Anwendungsfall:

Gibt es Ressourcen zur Unterstützung?

Bist du bereit, daran zu arbeiten?

Ja, natürlich.
Das sollte unter der Kategorie Frage gepostet werden

Themptyp wie von @kjooleng erwähnt zu Frage geändert.

Ja, das ist möglich. Nutze einfach den OpenAI-Standard und gib dort deine Anmeldedaten ein.

Ja, das funktioniert gut. QWEN-Modelle sind OpenAI-API-kompatibel, du kannst sie direkt in n8n einbinden. Es gibt zwei Wege:
Der einfachste: n8n hat einen nativen Ollama-Model-Node. Ollama installieren, QWEN-Modell pullen (ollama pull qwen2.5:7b), und den Ollama-Node in n8n auf http://localhost:11434 zeigen lassen. Fertig. Funktioniert mit AI Agent Node, Chat Node und in Kombination mit JavaScript-Nodes über normale Item-Weitergabe.

Rein aus Neugier:
Welche QWEN-Version plant ihr einzusetzen und auf welcher Hardware läuft der Server?

Willkommen @nino_kariauli!

Ja, Qwen ist mit der OpenAI API kompatibel, daher kannst du es ohne benutzerdefinierten Node mit n8n verbinden. Je nachdem, wie du es hostst, hast du zwei Möglichkeiten:

Option 1 - Ollama (am einfachsten für lokales Hosting):

  1. Installiere Ollama und führe ollama pull qwen2.5:7b aus (oder welche Größe auch immer zu deiner Hardware passt)
  2. In n8n nutze den Ollama Chat Model Node und weise ihn auf http://localhost:11434 hin (oder deine Server-IP, falls remote gehostet)
  3. Verbinde ihn mit dem AI Agent Node als Modell

Option 2 - OpenAI-kompatible API (bei Verwendung von vLLM, LM Studio oder einem gehosteten Qwen-Endpunkt):

  1. Erstelle in n8n eine OpenAI API Anmeldedaten
  2. Setze die Base URL auf deinen Endpunkt (z. B. http://your-server:8000/v1)
  3. Setze den API Key auf das, was dein Server benötigt (oder eine beliebige Zeichenkette, wenn er keine Authentifizierung hat)
  4. Nutze den OpenAI Chat Model Node, setze den Modellnamen auf qwen2.5-7b-instruct (entsprechend dem, was dein Server bereitstellt)

Beide Optionen funktionieren direkt mit dem AI Agent Node und übergeben den Kontext sauber an/von JavaScript Code Nodes via $input.first().json.

Um deine Frage @nino_kariauli zu JavaScript-Knoten präziser zu beantworten, hier ist der Datenfluss

Nach dem Ausführen deines AI Agent (oder OpenAI Chat Model-Knotens) sende die Ausgabe an einen Code-Knoten wie folgt

const aiResponse = $input.first().json.output; // AI Agent node

Eine Falle beim OpenAI-kompatiblen Credential-Setup ist, dass der Modellname, den du in n8n eingibst, genau dem entsprechen muss, was dein Server bereitstellt. Ollama serviert es als qwen2.5:7b, aber vLLM serviert es normalerweise als Qwen/Qwen2.5-7B-Instruct. Du kannst überprüfen, was dein Server meldet, indem du GET /v1/models auf deinem Endpunkt aufrufst.

Für ein Unternehmens-Deployment ein paar praktische Größennoten:

Qwen2.5-7B → ~8GB VRAM (passt für eine einzelne GPU)

Qwen2.5-14B → ~16GB VRAM

Qwen2.5-72B → benötigt Multi-GPU oder Quantisierung (GGUF Q4 reduziert es auf ~40GB)

Wenn mehrere Personen es gleichzeitig nutzen werden, wähle vLLM über Ollama — Ollama reiht Anfragen nacheinander auf, während vLLM Batching korrekt für Production-Traffic handhabt.