Hallo,
Ist es möglich, QWEN selbst gehostete Modelle in N8N zu integrieren und kann QWEN mit anderen Knoten in N8N zusammenarbeiten, wie JavaScript-Knoten oder andere. Ein Unternehmen möchte ein selbst gehostetes QWEN-Modell als AI-Chat-Modell (LLM) nutzen.
Ja, natürlich.
Das sollte unter der Kategorie Frage gepostet werden
Themptyp wie von @kjooleng erwähnt zu Frage geändert.
Ja, das ist möglich. Nutze einfach den OpenAI-Standard und gib dort deine Anmeldedaten ein.
Ja, das funktioniert gut. QWEN-Modelle sind OpenAI-API-kompatibel, du kannst sie direkt in n8n einbinden. Es gibt zwei Wege:
Der einfachste: n8n hat einen nativen Ollama-Model-Node. Ollama installieren, QWEN-Modell pullen (ollama pull qwen2.5:7b), und den Ollama-Node in n8n auf http://localhost:11434 zeigen lassen. Fertig. Funktioniert mit AI Agent Node, Chat Node und in Kombination mit JavaScript-Nodes über normale Item-Weitergabe.
Rein aus Neugier:
Welche QWEN-Version plant ihr einzusetzen und auf welcher Hardware läuft der Server?
Willkommen @nino_kariauli!
Ja, Qwen ist mit der OpenAI API kompatibel, daher kannst du es ohne benutzerdefinierten Node mit n8n verbinden. Je nachdem, wie du es hostst, hast du zwei Möglichkeiten:
Option 1 - Ollama (am einfachsten für lokales Hosting):
- Installiere Ollama und führe
ollama pull qwen2.5:7baus (oder welche Größe auch immer zu deiner Hardware passt) - In n8n nutze den Ollama Chat Model Node und weise ihn auf
http://localhost:11434hin (oder deine Server-IP, falls remote gehostet) - Verbinde ihn mit dem AI Agent Node als Modell
Option 2 - OpenAI-kompatible API (bei Verwendung von vLLM, LM Studio oder einem gehosteten Qwen-Endpunkt):
- Erstelle in n8n eine OpenAI API Anmeldedaten
- Setze die Base URL auf deinen Endpunkt (z. B.
http://your-server:8000/v1) - Setze den API Key auf das, was dein Server benötigt (oder eine beliebige Zeichenkette, wenn er keine Authentifizierung hat)
- Nutze den OpenAI Chat Model Node, setze den Modellnamen auf
qwen2.5-7b-instruct(entsprechend dem, was dein Server bereitstellt)
Beide Optionen funktionieren direkt mit dem AI Agent Node und übergeben den Kontext sauber an/von JavaScript Code Nodes via $input.first().json.
Um deine Frage @nino_kariauli zu JavaScript-Knoten präziser zu beantworten, hier ist der Datenfluss
Nach dem Ausführen deines AI Agent (oder OpenAI Chat Model-Knotens) sende die Ausgabe an einen Code-Knoten wie folgt
const aiResponse = $input.first().json.output; // AI Agent node
Eine Falle beim OpenAI-kompatiblen Credential-Setup ist, dass der Modellname, den du in n8n eingibst, genau dem entsprechen muss, was dein Server bereitstellt. Ollama serviert es als qwen2.5:7b, aber vLLM serviert es normalerweise als Qwen/Qwen2.5-7B-Instruct. Du kannst überprüfen, was dein Server meldet, indem du GET /v1/models auf deinem Endpunkt aufrufst.
Für ein Unternehmens-Deployment ein paar praktische Größennoten:
Qwen2.5-7B → ~8GB VRAM (passt für eine einzelne GPU)
Qwen2.5-14B → ~16GB VRAM
Qwen2.5-72B → benötigt Multi-GPU oder Quantisierung (GGUF Q4 reduziert es auf ~40GB)
Wenn mehrere Personen es gleichzeitig nutzen werden, wähle vLLM über Ollama — Ollama reiht Anfragen nacheinander auf, während vLLM Batching korrekt für Production-Traffic handhabt.