Problem/Fehler/Frage beschreiben
Hi alle zusammen,
ich baue einen Workflow in n8n für ein Kursprojekt und bin bei der letzten Stufe der Audio-Transkription stecken geblieben.
Das Ziel ist:
-Eine Sprachnachricht von Telegram empfangen
-Die Audio mit Telegram → Get a File herunterladen (über file_id)
-Die Audio in Text umwandeln (speech-to-text)
-Die Transkription an einen AI Agent senden
Frage
Was ist die empfohlene und zuverlässige Methode in n8n, um:
eine Telegram-Sprachnachricht (.oga / opus) zu verarbeiten
sie an eine nicht-OpenAI speech-to-text API zu senden (z. B. Groq Whisper oder ähnlich)
und eine stabile Transkriptions-Ausgabe zu erhalten
Besonders interessiert bin ich in:
Best Practice für die Verarbeitung von Telegram-Binärdateien
ob es bekannte Einschränkungen mit multipart/form-data im HTTP Request Node gibt
empfohlene Workarounds, wenn direkter Binär-Upload unzuverlässig ist
Jedes funktionierende Muster oder Beispiel-Workflow würde ich sehr schätzen ![]()
Was ist die Fehlermeldung (falls vorhanden)?
Wo ich feststecke
In dieser Phase:
- Telegram → Get a File funktioniert korrekt
- Ich erhalte die Binärdatei (.oga, audio/ogg)
- Der Workflow bricht ab, wenn ich versuche, diese Datei an eine Whisper/STT API zu senden
Ich habe mehrere Ansätze getestet:
- HTTP Request Node mit Form-Data + Binärdatei
- Code Node mit fetch + FormData
- verschiedene Binär-Mappings in n8n
Aber ich bekomme immer Fehler wie:
- „file must be one of [flac mp3 mp4 mpeg mpga m4a ogg opus wav webm]„
- „file not received„
- multipart/form-data-Probleme
- invalid request / bad request
Zu diesem Zeitpunkt kann ich die Datei erfolgreich herunterladen, aber ich kann sie nicht zuverlässig an eine Transkriptions-API senden.
Bitte teilen Sie Ihren Workflow
Erwarteter Workflow (aus dem Tutorial)
Das Tutorial, das ich befolge, schlägt vor:
Telegram → Get a File
OpenAI → Whisper → Transcribe a Recording
Whisper-Ausgabe mit einem AI Agent verbinden
Verwenden Sie diesen Ausdruck im AI Agent:
{{$json.message.text ?? $node["OpenAI"].json.text}}
Damit der Agent beide verarbeiten kann:
Text-Nachrichten
Audio-Transkriptionen
ABER ich verwende NICHT OpenAI!!
Ich möchte OpenAI vermeiden (aus Kostengründen), daher versuche ich, eine alternative speech-to-text-Lösung zu verwenden (z. B. Groq Whisper API oder ähnlich).
Geben Sie die vom letzten Node zurückgegebene Ausgabe an
Informationen zu Ihrem n8n-Setup
- n8n-Version: 2.23.4
- Datenbank (Standard: SQLite): Standard
- n8n EXECUTIONS_PROCESS-Einstellung (Standard: own, main): Standard
- n8n wird ausgeführt über (Docker, npm, n8n cloud, Desktop-App): Web
- Betriebssystem: Cloud (nicht selbst gehostet)