Preciso de ajuda, já criei vários fluxos e não consigo chegar ao fim. Aqui está o prompt/fluxo que estou montando.
Tenho um arquivo Word em anexo que contém informações sobre vários casos legais. Preciso extrair esses dados para preencher uma planilha Excel. O objetivo final é criar uma lista de propriedades elegíveis para leilão. Regras de Extração: 1. Filtro Restritivo: Analise cada caso no documento sequencialmente. APENAS extraia dados e adicione à lista os casos que mencionam explicitamente a existência de PROPRIEDADES; se não conseguir encontrar o número do caso, não o adicione à planilha, ou seja, cada linha é única e deve se referir a um único caso. Descarte completamente qualquer caso que não tenha uma propriedade. 2. Ordem Cronológica: A primeira linha da tabela Excel deve corresponder ao primeiro caso elegível encontrado no arquivo Word, seguindo rigorosamente a ordem do documento. 3. Consistência: Não invente dados. Se alguma informação necessária não estiver clara no texto do caso, preencha o campo como “Não informado”. Formato de Saída: Planilha Excel. Use as seguintes colunas padrão (ajuste se precisar de mais campos): - Número do Caso - Tipo de Propriedade (Casa, Apartamento, Terreno, etc.) - Endereço/Localização da Propriedade - Valor da Avaliação (se houver) - Breve Descrição do Bem Instrução de Execução, Autor, Réu, Advogado do Autor, Telefone, Email, Site, Referência, Observações.
O que está bloqueando você é o arquivo Word. O nó Extract from File do n8n não lê .docx, apenas formatos como PDF, texto, CSV e XLSX. Então salve o documento como PDF primeiro e depois use Extract from PDF para extrair o texto.
Depois alimente esse texto em um nó Information Extractor, defina Schema Type para Generate From JSON Example e cole uma estrutura como esta para que cada caso seja seu próprio objeto:
Mantenha suas regras (pular casos sem propriedade ou sem número de caso, nunca inventar dados, usar “Not informed”) no prompt do nó. Depois adicione um nó Split Out no array cases para que cada caso se torne uma linha e finalize com Convert to File definido para XLSX.
A abordagem de conversão de PDF do achamm funciona bem. Se você está auto-hospedando o n8n e quer pular a etapa de conversão, você também pode ler o .docx diretamente usando um nó Code com o pacote mammoth - adicione NODE_FUNCTION_ALLOW_EXTERNAL=mammoth às suas variáveis de ambiente, depois use mammoth.extractRawText({buffer: Buffer.from($binary.data, 'base64')}) para obter o texto. De lá, direcione-o para um nó Information Extractor com seu schema e ele processa a saída estruturada de forma clara.