{“content”:"Estou criando um fluxo de trabalho automatizado para cortar de forma inteligente imagens de papéis de parede decorativos com base nas dimensões da parede do cliente (largura × altura em cm). O catálogo possui mais de 7000 imagens com assuntos muito diferentes (flores, folhas, padrões geométricos, figuras, etc.).
Minha abordagem atual:
-
Agente de IA com OpenAI Vision analisa a imagem e retorna coordenadas de corte em percentuais (
left,right,focal_y) -
Um nó JavaScript converte percentuais em pixels com base nas dimensões da imagem e tamanho da parede
-
Um nó Python/Pillow executa o corte real
O problema é que o GPT Vision estima coordenadas visualmente e às vezes é impreciso — assuntos como folhas ou flores acabam ligeiramente cortados nas bordas.
O que eu já tentei:
-
Definir
temperature: 0para determinismo
-
Prompt detalhado com princípios de design e exemplos

-
focal_ypara posicionamento vertical
Minha pergunta: Qual seria a melhor abordagem para melhorar a precisão em um catálogo grande e variado?
-
Refinar o prompt ainda mais?
-
Adicionar OpenCV no nó Python para detectar limites de objetos precisos após o GPT dar a área aproximada?
-
Algo completamente diferente?
Versão n8n: 2.12.2 (Self Hosted) Executado via: Docker SO: Windows Processo de execuções: External task runner (Python)"}