Ready flow - Lire un document Word et remplir une feuille de calcul Excel

J’ai besoin d’aide, j’ai déjà créé plusieurs flux et je n’arrive pas à atteindre la fin. Voici le prompt/flux que je suis en train de mettre en place.

J’ai un fichier Word joint qui contient des informations sur plusieurs cas juridiques. Je dois extraire ces données pour remplir une feuille de calcul Excel. L’objectif final est de créer une liste de propriétés éligibles pour enchères. Règles d’extraction : 1. Filtre restrictif : Analysez chaque cas du document de manière séquentielle. N’EXTRAYEZ les données et n’AJOUTEZ à la liste que les cas qui mentionnent explicitement l’existence de PROPRIÉTÉS ; si vous ne trouvez pas le numéro de dossier, ne l’ajoutez pas à la feuille de calcul, ce qui signifie que chaque ligne est unique et doit faire référence à un seul cas. Rejetez complètement tout cas qui n’a pas de propriété. 2. Ordre chronologique : La première ligne du tableau Excel doit correspondre au premier cas admissible trouvé dans le fichier Word, en respectant strictement l’ordre du document. 3. Cohérence : N’inventez pas de données. Si une information requise n’est pas claire dans le texte du cas, remplissez le champ avec « Non informé ». Format de sortie : Feuille de calcul Excel. Utilisez les colonnes standard suivantes (ajustez si vous avez besoin de plus de champs) : - Numéro de dossier - Type de propriété (Maison, Appartement, Terrain, etc.) - Adresse/Localisation de la propriété - Valeur estimée (le cas échéant) - Brève description de l’actif Instructions d’exécution, Demandeur, Défendeur, Avocat du demandeur, Téléphone, Email, Site web, Référence, Remarques.

Salut @Ronaldo_Alves, bienvenue !

Ce qui te bloque, c’est le fichier Word. Le nœud Extract from File de n8n ne lit pas les .docx, seulement des formats comme PDF, texte, CSV et XLSX. Enregistre d’abord le document en PDF, puis utilise Extract from PDF pour extraire le texte.

Ensuite, alimente ce texte dans un nœud Information Extractor, définis le Schema Type sur Generate From JSON Example, et colle une structure comme celle-ci pour que chaque cas soit son propre objet :

{
  "cases": [
    {
      "case_number": "",
      "property_type": "",
      "address": "",
      "appraisal_value": "",
      "description": "",
      "execution_instruction": "",
      "claimant": "",
      "respondent": "",
      "lawyer": "",
      "phone": "",
      "email": "",
      "website": "",
      "referral": "",
      "notes": ""
    }
  ]
}

Conserve tes règles (ignore les cas sans propriété ou sans numéro de cas, ne jamais inventer de données, utilise « Not informed ») dans le prompt du nœud. Ajoute ensuite un nœud Split Out sur le tableau cases pour que chaque cas devienne une ligne, et termine avec Convert to File défini sur XLSX.

Bonjour @Ronaldo_Alves

Quel nœud échoue ou quel message d’erreur voyez-vous ?
Veuillez partager votre workflow

Salut @Ronaldo_Alves, bienvenue dans la communauté n8n !

ces modèles vont t’aider, il suffit de les adapter à tes besoins.
Analyze Legal Documents with GPT & o4-mini plus Gmail & Google Sheets | n8n workflow template
:sparkles::kitchen_knife: Advanced AI powered document parsing & text extraction with Llama Parse | n8n workflow template

L’approche de conversion PDF d’achamm fonctionne bien. Si vous auto-hébergez n8n et souhaitez ignorer l’étape de conversion, vous pouvez également lire le fichier .docx directement en utilisant un nœud Code avec le package mammoth - ajoutez NODE_FUNCTION_ALLOW_EXTERNAL=mammoth à vos variables d’environnement, puis utilisez mammoth.extractRawText({buffer: Buffer.from($binary.data, 'base64')}) pour obtenir le texte. À partir de là, dirigez-le vers un nœud Information Extractor avec votre schéma et il gère la sortie structurée de manière élégante.