我需要幫助,我已經創建了幾個流程,但無法到達終點。以下是我正在組織的提示/流程。
我有一個附加的 Word 檔案,其中包含幾個法律案件的信息。我需要提取這些數據以填充 Excel 電子表格。最終目標是創建符合拍賣資格的房產清單。提取規則:1. 限制性篩選:按順序分析文檔中的每個案件。只提取並添加到列表中明確提及存在房產的案件;如果找不到案件編號,請勿將其添加到電子表格中,這意味著每一行都是唯一的,必須涉及單個案件。完全丟棄任何沒有房產的案件。2. 時間順序:Excel 表的第一行必須對應於在 Word 檔案中找到的第一個符合條件的案件,嚴格按照文檔的順序。3. 一致性:不要編造數據。如果案件文本中任何必需的信息不清楚,請將該欄位填為「未告知」。輸出格式:Excel 電子表格。使用以下標準列(如果需要更多欄位,可以調整):- 案件編號 - 房產類型(房屋、公寓、土地等)- 房產地址/位置 - 評估價值(如有)- 資產簡要描述 執行指令、申請人、被申請人、申請人律師、電話、電子郵件、網站、轉介、備註。
Hi @Ronaldo_Alves,歡迎!
卡住你的是 Word 檔案。n8n 的 Extract from File 節點不支援讀取 .docx,只支援 PDF、text、CSV 和 XLSX 等格式。所以請先將文件另存為 PDF,然後使用 Extract from PDF 來提取文本。
接著將該文本輸入到 Information Extractor 節點,將 Schema Type 設定為 Generate From JSON Example,並貼上類似這樣的結構,使每個案件都成為單獨的物件:
{
"cases": [
{
"case_number": "",
"property_type": "",
"address": "",
"appraisal_value": "",
"description": "",
"execution_instruction": "",
"claimant": "",
"respondent": "",
"lawyer": "",
"phone": "",
"email": "",
"website": "",
"referral": "",
"notes": ""
}
]
}
在節點的提示詞中保留你的規則(跳過沒有物業或沒有案件編號的案件、永遠不要虛構數據、使用「Not informed」)。然後在 cases 陣列上新增 Split Out 節點,使每個案件都成為一列,最後用 Convert to File 設定為 XLSX 完成。
嗨 @Ronaldo_Alves
哪個節點失敗了,或者你看到什麼錯誤訊息?
請分享你的工作流程
achamm 的 PDF 轉換方法效果很好。如果您自行託管 n8n 並想跳過轉換步驟,也可以使用 Code 節點搭配 mammoth 套件直接讀取 .docx 檔案 - 將 NODE_FUNCTION_ALLOW_EXTERNAL=mammoth 加入環境變數,然後使用 mammoth.extractRawText({buffer: Buffer.from($binary.data, 'base64')}) 來取得文字。之後,將其傳入 Information Extractor 節點並設定您的架構,它就能乾淨地處理結構化輸出。