Melhor abordagem para corte automático de 7000+ papéis de parede com reconhecimento de conteúdo?

{“content”:"Estou criando um fluxo de trabalho automatizado para cortar de forma inteligente imagens de papéis de parede decorativos com base nas dimensões da parede do cliente (largura × altura em cm). O catálogo possui mais de 7000 imagens com assuntos muito diferentes (flores, folhas, padrões geométricos, figuras, etc.).

Minha abordagem atual:

  1. Agente de IA com OpenAI Vision analisa a imagem e retorna coordenadas de corte em percentuais (left, right, focal_y)

  2. Um nó JavaScript converte percentuais em pixels com base nas dimensões da imagem e tamanho da parede

  3. Um nó Python/Pillow executa o corte real

O problema é que o GPT Vision estima coordenadas visualmente e às vezes é impreciso — assuntos como folhas ou flores acabam ligeiramente cortados nas bordas.

O que eu já tentei:

  • Definir temperature: 0 para determinismo :white_check_mark:

  • Prompt detalhado com princípios de design e exemplos :white_check_mark:

  • focal_y para posicionamento vertical :white_check_mark:

Minha pergunta: Qual seria a melhor abordagem para melhorar a precisão em um catálogo grande e variado?

  • Refinar o prompt ainda mais?

  • Adicionar OpenCV no nó Python para detectar limites de objetos precisos após o GPT dar a área aproximada?

  • Algo completamente diferente?

Versão n8n: 2.12.2 (Self Hosted) Executado via: Docker SO: Windows Processo de execuções: External task runner (Python)"}

Oi @Alessio_Jeshili, bem-vindo!
Acho que usar isso:

melhoraria seu projeto.

Além disso, prompts são tudo em agentes de IA, então você precisa verificar seus prompts aqui:

Sua ideia de projeto é incrível, mas 7 mil imagens são muito preocupantes. Em vez disso, por que você não deixa a IA gerar a imagem com base no requisito do usuário? Acho que seria mais barato do que realmente escolher uma imagem desse catálogo enorme.

Oi Alessio,

Esbarrei no seu tópico enquanto pesquisava o mesmo problema por um ângulo diferente — usando Claude (não GPT) para retornar coordenadas de corte para fotografia editorial de esportes, depois aplicando o corte via ImageMagick no n8n. Mesma arquitetura, mesma frustração: o modelo estima visualmente e ocasionalmente perde o assunto.

Algumas perguntas se você teve tempo de iterar desde abril:

  1. Você acabou adicionando OpenCV para refinamento de limites após o passe do LLM, ou a engenharia de prompt foi suficiente?
  2. Você tentou mudar para um modelo diferente (Gemini, Claude) ou uma API dedicada de corte como Imagga?
  3. Algum aprendizado sobre como você estruturou a saída de coordenadas — percentuais vs. pixels, bounding box vs. ponto focal?

Ficarei feliz em compartilhar minhas iterações de prompt se for útil em troca.

Obrigado
Anders