Oferta de trabajo

Busco experto/a en n8n, IA y automatización para escalar flujo avanzado de análisis de planos PDF

Estoy buscando una persona experta en n8n, automatizaciones con IA y arquitectura de flujos complejos para ayudarme a llevar un proyecto ya funcional al siguiente nivel.

Actualmente tengo desarrollado un flujo en n8n que trabaja con planos PDF, leyendas técnicas, modelos de IA, extracción estructurada de datos, conteo/desglose de elementos por zonas, conexión con Google Sheets y validaciones posteriores. El flujo ya funciona, pero quiero mejorar su precisión, robustez, escalabilidad y preparación para un uso más profesional/comercial.

El objetivo no es crear un flujo desde cero, sino auditar, optimizar y escalar lo que ya existe.

Busco a alguien que pueda ayudarme con:

  • Revisión completa de la arquitectura actual del flujo en n8n.

  • Mejora del análisis de PDFs y conversión a imágenes de alta resolución si es necesario.

  • Optimización de prompts y estructura de entrada/salida para modelos de IA.

  • Mejora de conteos, validaciones y control de errores.

  • Uso correcto de nodos Code, HTTP Request, Merge, Google Sheets, manejo de binarios y JSON.

  • Diseño de un flujo más robusto, modular y fácil de mantener.

  • Implementación de logs, trazabilidad, revisión humana y control de calidad.

  • Recomendaciones para escalar el sistema hacia un producto más profesional.

  • Posible integración futura con bases de datos, APIs externas, OCR, visión artificial o herramientas complementarias.

Perfil ideal:

  • Experiencia demostrable con n8n en proyectos reales.

  • Buen nivel con APIs, JSON, JavaScript básico para nodos Code y manejo de errores.

  • Experiencia integrando modelos de IA/LLMs en flujos automatizados.

  • Capacidad para entender procesos complejos y convertirlos en sistemas fiables.

  • Mentalidad de producto: no solo “hacer que funcione”, sino hacerlo escalable, limpio y mantenible.

  • Se valorará experiencia con análisis documental, PDFs, OCR, visión artificial, presupuestos de obra, ingeniería, arquitectura o construcción.

El proyecto está relacionado con automatización para el sector construcción/obra, especialmente análisis de planos técnicos y generación de partidas o mediciones.

Modalidad:

  • Trabajo freelance/remoto.

  • Primera fase: auditoría del flujo actual y propuesta de mejora.

  • Segunda fase: implementación de mejoras concretas.

  • Posibilidad de colaboración continuada si encaja bien.

Importante:

No busco una persona junior ni alguien que solo haya hecho automatizaciones simples. Busco alguien con criterio técnico, experiencia real y capacidad para ayudarme a escalar un flujo complejo que ya está en marcha.

Si te interesa, envíame:

  1. Experiencia previa con n8n.

  2. Ejemplos de flujos o automatizaciones similares.

  3. Experiencia integrando IA/LLMs en n8n.

  4. Disponibilidad.

  5. Tarifa aproximada por hora o por fase de proyecto.

  6. Cómo enfocarías una primera auditoría de este flujo.

Gracias.

3 Likes

If you need I am available here

I am one of top 50 verified template creators:

https://n8n.io/creators/iamvaar/

I am also capable of building custom community n8n nodes too:

  1. https://www.npmjs.com/package/n8n-nodes-pdfbro

  2. https://www.npmjs.com/package/n8n-nodes-ocrbro

  3. https://www.npmjs.com/package/n8n-nodes-ttsbro

  4. https://www.npmjs.com/package/n8n-nodes-emailscraper-pro

  5. https://www.npmjs.com/package/n8n-nodes-barcode-scanner

Apart from that I’m also a full-stack developer with the right Gen AI experience, which makes me a solid plus for your team[but right now only vibecoding]

Check my recent gen ai projects… I built a native Android automation agent too. It’s worth a look:

https://gist.github.com/iamvaar-dev/f0f2a38ab3a6c860be83118ef8513a9f

I can build complex AI automations directly in code, not just inside n8n

I recently started posting my n8n work on YouTube with explanations:

https://youtube.com/@blankarray

You can schedule a quick call with me: https://cal.com/abhi.vaar/n8n

Fun fact… I even made an n8n workflow to find a few n8n project leads for myself so I truly believe in what I do…

I started asking My recent clients for honest feedbacks so here is one testimonial: https://www.youtube.com/watch?v=TqBy3SVCHgQ&list=PLAJltY5bp6yiZ3sFBjm7bfrkLXSGtJX8m

Here is my linktree: https://linktr.ee/iamvaar

And I am also capable of building gohighlevel automations and other CRM’s too, here are my recent gohighlevel integrated automation videos:

https://youtube.com/playlist?list=PLAJltY5bp6yiBDPfdLytuzo7XwMItqate&si=ta7oIieBBhFeGJUg

And I also built low latency voice appointment scheduler with live ai avatar[in code]:

https://www.linkedin.com/posts/iamvaar_ai-voiceai-projectshowcase-activity-7419340701680836609-Q9Xu?utm_source=social_share_send&utm_medium=android_app&rcm=ACoAADOpj3wB58OOghpmQ45y5e5p_9n5Vt3sd5o&utm_campaign=copy_link

I built AI search visibility tracker[I am capable of building complex web scraping automations in python too]:

https://www.linkedin.com/posts/iamvaar_geo-aisearch-shareofvoice-activity-7416900797705179136-OsMD?utm_source=social_share_send&utm_medium=android_app&rcm=ACoAADOpj3wB58OOghpmQ45y5e5p_9n5Vt3sd5o&utm_campaign=copy_link

And done many other big projects too which are under NDA’s so technically I can’t reveal them.

1 Like

Hola, vi tu post buscando a alguien experto en n8n e IA para auditar, optimizar y escalar tu flujo actual de análisis de planos PDF.

Tienes un flujo que ya funciona con extracción de datos, conteo por zonas, Google Sheets y modelos de IA, pero quieres llevarlo a un nivel mucho más robusto, escalable y profesional sin tener que reconstruirlo desde cero.

He trabajado con flujos similares de análisis documental y automatizaciones con PDFs en n8n, y sé lo importante que es revisar bien la arquitectura, mejorar los prompts, manejar mejor los binarios y añadir trazabilidad y control de errores para que sea mantenible.

Estoy dispuesto a hacer una auditoría pequeña y gratuita de tu flujo actual (revisión de arquitectura + propuestas concretas de mejora) para que veas exactamente cómo lo enfocaría antes de seguir adelante.

¿Quieres que te haga esa primera revisión del flujo que tienes ahora mismo

Hola,

Gracias por escribirme y por el interés en el proyecto.

Sí, el enfoque que planteas encaja con lo que estamos buscando: no queremos rehacer el flujo desde cero, sino auditar lo que ya tenemos, detectar puntos débiles y valorar qué mejoras tienen más impacto para hacerlo más robusto, escalable y fiable.

Me parece bien lo de hacer una primera auditoría pequeña del workflow actual. De momento, la idea sería que lo revisaras sin hacer cambios y nos devolvieras una valoración con:

  1. Qué partes del flujo mantendrías.

  2. Qué puntos ves frágiles o mejorables.

  3. Qué cambios harías primero como quick wins.

  4. Qué mejoras plantearías para una segunda fase más profesional.

  5. Una estimación aproximada de tiempo/coste si más adelante decidiéramos implementarlo.

La parte más crítica del proyecto es el análisis de planos PDF técnicos: lectura de leyenda, manejo de binarios, posible conversión del PDF a imagen de alta resolución, análisis por zonas, conteo de símbolos pequeños, validaciones y trazabilidad de resultados en Google Sheets.

Antes de pasarte nada, ¿podrías enviarme algún ejemplo, captura o breve explicación de algún flujo similar que hayas trabajado con PDFs, OCR, IA, binarios o extracción estructurada en n8n?

Gracias.

Hi Abhi,

Thanks for reaching out and for sharing all the references.

Your n8n background looks very strong, especially the verified creator profile, custom community nodes and experience with PDFs/OCR, which are highly relevant for what we are trying to improve.

We already have an n8n workflow working as an MVP. It takes a technical electrical PDF plan and a separate legend PDF, extracts the legend into a structured dictionary, analyzes the plan with AI, counts symbols by zones, validates the output and sends the results to Google Sheets.

We are not looking to rebuild everything from scratch without a reason. The main goal is to audit the current architecture and improve reliability, especially around PDF processing, binary handling, conversion of technical plans into high-resolution images, zone-based visual analysis, symbol counting, validation, logging and traceability.

Before moving forward, I would like to understand how you would approach this specific problem:

How would you improve the accuracy of an n8n workflow that needs to analyze technical PDF drawings, read a legend, detect small symbols across the plan and count them by zones?

Also, have you worked on anything similar involving technical PDFs, OCR, computer vision, image preprocessing or structured extraction from complex documents?

If the fit is good, we can schedule a quick call to review the workflow and discuss the best next steps.

Thanks.

Hola Roger,

Este proyecto me llamó mucho la atención porque está mucho más cerca de una ingeniería de flujos complejos que de automatizaciones simples.

He desarrollado sistemas con n8n, IA, APIs, flujos de reserva, procesamiento de datos, validaciones, manejo de errores y arquitecturas modulares para producción.

Te envío un mensaje privado con más información y algunos ejemplos de proyectos.

¡Saludos!
Folafoluwa

Hi! I’m Misha, an automation and LLM integration expert. I’ll begin with a comprehensive audit of your existing n8n workflow, analyzing its architecture, data flow, AI interactions, PDF processing, and error handling to identify bottlenecks and opportunities for improvement. From there, I’ll optimize PDF analysis and high-resolution image conversion, refine prompts and structured LLM outputs, strengthen validation logic, improve Code nodes, HTTP requests, Merge operations, Google Sheets integrations, and binary/JSON handling, while introducing modular architecture, logging, traceability, human review checkpoints, and quality control. I’ll also prepare the system for future integrations with databases, OCR, computer vision, and external APIs, ensuring it is scalable, maintainable, and production-ready. My focus is not just making the workflow work, but engineering a reliable platform that delivers higher accuracy, minimizes manual intervention, simplifies future development, and can confidently evolve into a commercial-grade solution for technical drawing analysis and construction estimation.

Connect on WhatsApp: +375293761570 | View My Portfolio: https://mikedevai.netlify.app/

Hola Roger,

Puedo ayudarte con una primera auditoría técnica del flujo existente y luego con mejoras concretas si encaja.

Experiencia relevante: trabajo con automatizaciones n8n/API/webhooks, nodos Code/HTTP Request, Google Sheets/CRM, manejo de JSON, logs, retries y handoff técnico. También he trabajado con flujos de IA/LLM para extracción/clasificación de datos, prompts con salida estructurada y validaciones para reducir errores.

Cómo enfocaría la primera auditoría:

  1. Mapear el flujo actual: entradas/salidas por nodo, binarios PDF/imágenes, prompts, estructura JSON y puntos de fallo.
  2. Revisar precisión, trazabilidad, manejo de errores, validaciones y pasos donde conviene añadir revisión humana.
  3. Probar con 2-3 PDFs reales o anonimizados para separar problemas de prompt, OCR/imagen, datos o arquitectura.
  4. Entregar una lista priorizada: quick wins, cambios de arquitectura, riesgos, estimación de fase 2 y orden de implementación.

Disponibilidad: puedo empezar con una fase pequeña de auditoría esta semana.
Tarifa orientativa: auditoría inicial fija USD 120-180 según acceso/material; implementación posterior USD 25/h o por hitos cerrados.

Portfolio/proof: SHAL Engineering Portfolio - S23 Ultra Proof, Backend, Android, AI API Rescue
GitHub: ashalafan (shalafan) · GitHub

No necesito credenciales de producción para la primera revisión; con una copia/export del workflow y ejemplos anonimizados es suficiente para empezar.

Hola Anton,

Gracias por tu mensaje y por detallar el enfoque de auditoría.

Nos parece interesante la forma en que planteas la primera fase, especialmente mapear entradas y salidas por nodo, revisar binarios PDF/imágenes, prompts, estructura JSON, puntos de fallo, trazabilidad y validaciones. También encaja con lo que buscamos la idea de probar con 2-3 PDFs reales o anonimizados para diferenciar si los problemas vienen del prompt, OCR/imagen, datos o arquitectura.

Actualmente tenemos un MVP funcional en n8n: recibe un plano PDF técnico y una leyenda PDF, extrae la leyenda como diccionario estructurado, analiza el plano con IA, cuenta símbolos por zonas, marca dudas/revisión y envía los resultados a Google Sheets.

No buscamos rehacer todo desde cero sin motivo, sino auditar lo que ya existe, mantener lo que esté bien y mejorar los puntos críticos para hacerlo más fiable y escalable.

La parte más delicada es mejorar la precisión en el análisis visual de planos técnicos: conversión del PDF a imagen de alta resolución, posible división por zonas, detección/conteo de símbolos pequeños, validaciones y reducción de infraconteos.

Ahora mismo estamos valorando diferentes perfiles. Antes de avanzar, nos ayudaría saber si has trabajado antes con casos similares relacionados con planos técnicos, OCR avanzado, computer vision, extracción visual de elementos pequeños o conteo de símbolos dentro de PDFs/imágenes.

También revisaremos tu portfolio/GitHub para valorar mejor el encaje. Durante los próximos días te diremos algo para ver si avanzamos con una primera auditoría acotada.

Gracias.

Hi,

I’m very interested in your project.

I’m a Software Architect with over 7 years of experience in backend development, enterprise automation, and AI-powered solutions. Over the last few years, I’ve been designing production-grade automation platforms using n8n, Python, RabbitMQ, Databricks, and Large Language Models (LLMs), focusing on scalable, maintainable, and enterprise-ready architectures.

Regarding your requirements:

  • Extensive experience designing complex n8n workflows for enterprise automation.
  • Integration of OpenAI, Google Gemini, and AI Agents into production workflows.
  • Strong background with REST APIs, JSON transformations, JavaScript (Code nodes), HTTP Request, Merge nodes, Google Sheets, binary data handling, and custom integrations.
  • Experience designing event-driven architectures, asynchronous processing, error handling, monitoring, logging, and workflow modularization.
  • Backend development expertise with Python, FastAPI, Django, PostgreSQL, Oracle, SQL Server, MongoDB, and Redis.
  • Experience with OCR, Computer Vision, document processing, and image analysis, including previous projects involving satellite imagery and object recognition.

How I would approach the first audit

  1. Review the current n8n architecture and identify bottlenecks.
  2. Analyze AI prompts, model selection, and structured output consistency.
  3. Evaluate PDF processing and image conversion quality.
  4. Review error handling, retries, logging, and observability.
  5. Validate data flow consistency between nodes.
  6. Identify opportunities to modularize and simplify the workflow.
  7. Deliver a technical report with recommendations, priorities, and an implementation roadmap before making changes.

My goal is not only to make the workflow work better, but to make it production-ready, scalable, maintainable, and easier to evolve over time.

I’m available to start with the architecture review and then continue with the implementation if we’re a good fit.

I’d be happy to discuss the project in more detail.

Best regards,

Paulo Lima

Hola Roger,

Sí — he trabajado con una clase de problemas muy parecida: extracción AI-assisted desde documentos/imágenes, outputs JSON estructurados, arquitectura de workflows, capas de validación, trazabilidad, logs y revisión humana para casos ambiguos.

Para ser totalmente preciso: no voy a decir que ya he entregado exactamente vuestro caso final — conteo de símbolos pequeños dentro de planos técnicos de construcción con vuestro stack actual de n8n — como producto comercial cerrado. Pero los problemas técnicos principales me resultan muy familiares:

  • manejo de PDFs / imágenes / binarios;
  • renderizado en alta resolución y preprocesamiento;
  • división de imágenes grandes en zonas o regiones;
  • extracción estructurada desde una leyenda;
  • prompts y modelos AI/LLM con salida JSON estricta;
  • reducción de hallucinations, omisiones y conteos incompletos;
  • validación contra diccionarios, reglas y outputs esperados;
  • trazabilidad entre zona/fuente del PDF y filas finales en Google Sheets;
  • revisión humana para baja confianza o casos ambiguos;
  • modularidad, debugging y mantenibilidad en workflows complejos.

En SHAL trabajo con arquitectura AI-native y sistemas donde el modelo no debe inventar datos: la IA puede razonar o clasificar, pero la verdad debe venir de backend, reglas, APIs, datos estructurados, validaciones y logs. Ese mismo enfoque aplica muy bien a vuestro caso: separar interpretación visual, validación determinista, trazabilidad y revisión humana.

Para este workflow no empezaría cambiando prompts al azar. Mi primera auditoría buscaría exactamente dónde se pierde precisión:

  1. mapear el workflow actual nodo por nodo;
  2. revisar cómo se manejan PDFs, imágenes y binarios;
  3. comprobar resolución/DPI y estrategia de conversión PDF → imagen;
  4. revisar cómo la leyenda se convierte en diccionario estructurado;
  5. revisar prompts, schemas JSON, inputs/outputs y casos de fallo;
  6. probar 2-3 PDFs reales o anonimizados;
  7. clasificar errores: símbolos omitidos, zona incorrecta, mal mapping con leyenda, baja resolución, ambigüedad del prompt, parsing o salida a Sheets;
  8. proponer quick wins y una segunda fase de implementación.

Para el conteo de símbolos en planos técnicos miraría especialmente:

  • renderizado controlado en alta resolución;
  • estrategia de zonas/tiles en vez de mandar una imagen enorme sin control;
  • uso de la leyenda como diccionario estricto;
  • thresholds de confianza;
  • guardado de crops/referencias para trazabilidad;
  • separación entre interpretación AI y validación determinista;
  • cola de revisión humana para zonas dudosas.

Un buen primer entregable sería una auditoría acotada, no una reconstrucción grande:

  • revisar el workflow actual;
  • probar 2-3 PDFs anonimizados;
  • identificar los puntos débiles principales;
  • proponer quick wins;
  • estimar una fase 2 clara para implementación.

Puedo hacer esa primera auditoría por USD 150 fijo. Después, si la auditoría muestra un camino claro, la implementación puede continuar a USD 25/hora o por milestone cerrado.

Para empezar solo necesitaría:

  • export del workflow n8n si es posible;
  • 2-3 planos PDF anonimizados;
  • PDF de la leyenda;
  • ejemplo de output esperado en Google Sheets;
  • prompts actuales;
  • ejemplos donde ahora el sistema falla o cuenta de menos.

No necesito credenciales de producción ni secretos privados para esta primera fase.

Gracias,
Anton

Hola Roger :waving_hand: (sigo en inglés para ser preciso — happy to continue in Spanish).

This is squarely what I do: document → structured-data pipelines in n8n + LLMs, with exactly the reliability focus you describe. The hard part isn’t the wiring — it’s precision at scale: correct counts per zone, handling messy/varied PDFs, and making sure the model never invents a value when a legend or symbol is ambiguous.

Directly relevant: I just built a document→structured-output agent for the construction/quoting side — free-text/PDF in, a fully structured cost estimate out (matched line items, quantities, totals), where anything it can’t match against the reference gets flagged for human review instead of being made up. Same problems you’re hitting: extraction accuracy, validation, human-in-the-loop, zero hallucinated data.

On your asks:

  • n8n: real production flows — Code/HTTP/Merge/Sheets, binary+JSON handling, retries/error control/logging.
    • AI/LLM: OpenAI/Claude/Gemini in live workflows with strict structured output + validation.
      • First audit: map the current architecture and find bottlenecks → review the PDF→image step and the prompt/IO structure → tighten counts, validation and error control → add logging/traceability + a human-review gate → deliver a written report with prioritized fixes and a roadmap before changing anything.
    • I’d start exactly as you framed it: a paid audit phase first, then a fixed quote for the implementation once I’ve seen the flow. If it fits, we continue here or by DM.

Hi Paulo,

Thanks for reaching out. Your background in software architecture, backend systems, n8n, OCR and computer vision looks very relevant.

We already have a working MVP in n8n. It receives a technical PDF drawing and a separate legend PDF, extracts the legend into a structured dictionary, analyzes the drawing with AI, counts symbols by zones, validates the output and sends the results to Google Sheets.

We are not looking to rebuild everything from scratch without a reason. The main challenge is improving visual accuracy: high-resolution PDF rendering, image slicing with overlap, detecting small symbols across technical drawings, avoiding undercounting, and validating results before exporting them.

Before moving forward, I’d like to understand how you would approach this specific problem:

How would you design the PDF/image processing pipeline to improve symbol counting accuracy in technical drawings? Would you use high-DPI rendering, image tiling/slicing, OCR, computer vision/object detection, multimodal LLMs, or a combination?

Also, have you worked on any similar project involving technical drawings, object detection, OCR, or structured extraction from complex visual documents?

We are currently comparing different profiles and will decide the next steps in the coming days.

Thanks.

Hi,

Thanks for your message. Your approach sounds very aligned with what we are trying to build, especially the focus on precision, structured outputs, validation, human review and avoiding hallucinated values when the legend or symbols are ambiguous.

The construction/quoting project you mentioned is also relevant, because our goal is not only to count symbols, but eventually to turn technical drawings and legends into reliable quantities/line items that can support construction estimates.

We already have a working MVP in n8n: it receives a technical PDF drawing and a separate legend PDF, extracts the legend into a structured dictionary, analyzes the drawing with AI, counts symbols by zones, validates the output and sends the results to Google Sheets.

The main challenge now is improving visual accuracy: high-resolution PDF rendering, possible image slicing/tiling with overlap, detecting small symbols across the drawing, avoiding undercounting, validating results and keeping traceability.

Before moving forward, I’d like to understand one specific point: have you worked on technical drawings, OCR/computer vision, or visual detection/counting of small elements inside PDFs/images?

And how would you approach the PDF/image processing step to improve symbol counting accuracy before sending the data to the LLM?

We are currently comparing different profiles and will decide the next steps in the coming days.

Thanks.

Hola Roger, tu caso me queda especialmente cerca: mi proyecto principal es justamente automatización de procesamiento de PDFs. Construí una herramienta en Python que convierte documentos administrativos gubernamentales (PDF → documento estructurado), en producción en una oficina pública en Argentina. Trabajo a diario con n8n + LLMs (Claude/OpenAI); workflows open-source acá: sebastianquinteros08-cmyk (Sebastian) · GitHub .
Del lado visual estoy construyendo una herramienta de computer vision (segmentación con SAM2), la detección de elementos dentro de imágenes es un problema en el que estoy trabajando activamente (está en desarrollo, te lo digo tal cual es).

Leí tus respuestas en el hilo y coincido con el enfoque: auditar y mejorar, no reconstruir. Cómo encararía esa primera auditoría:

  1. Mapear la arquitectura actual (nodos Code/HTTP/Merge, manejo binario/JSON) para ubicar en qué parte del flujo se pierde precisión o hay margen de mejora hoy
  2. El paso visual: render de alta resolución con DPI controlado + slicing de la imagen con solapamiento entre tiles, para que los símbolos chicos nunca queden cortados en un borde ni comprimidos en una página entera.
  3. Salida estructurada (JSON schema) + validación del conteo por zona: lo que no se puede verificar va al gate de revisión humana que mencionás, nunca se acepta un valor alucinado.
  4. Logging y trazabilidad por documento y por zona (retries, alertas), que es lo que separa el prototipo de algo comercial.

Disponibilidad: inmediata, part-time o dedicado según el scope. Tarifa: USD 25/h para implementación, o precio fijo para la auditoría inicial si preferís scope cerrado. Soy de Buenos Aires, español nativo, async-first con documentación clara de cada decisión (si necesitas reuniones lo charlamos, me hago tiempo).

Cualquier duda técnica te la respondo acá mismo en el hilo. — Sebastián

Hi Roger — glad it resonates. The accuracy problem you’re describing (small-symbol detection, no undercounting, validation before export) is where these systems live or die, and it’s rarely a prompt tweak — it’s the pipeline around the model.

How I’d attack the visual accuracy:

  • Rendering: push the PDF to high DPI (300–600) before the model sees it — most undercounting starts with a blurry raster.
    • Tiling with overlap: slice the drawing into tiles with ~10–15% overlap, detect per tile, then dedup symbols in the overlap band by position so boundary symbols aren’t missed or double-counted.
      • Legend as a strict dictionary: only count symbols that match a legend entry; anything ambiguous goes to a review queue, never a guessed count.
        • Validation layer: cross-check per-zone totals against expected ranges, flag off-looking zones, and keep a crop of each detected symbol for fast human verification.
          • The key is separating visual detection from deterministic validation — the model interprets, but the truth comes from rules + the legend, not the model’s own tally.
        • Since you already have a working MVP, the cleanest first step is a scoped audit — fixed USD 120: I go through the flow node by node with 2–3 real (anonymized) drawings, pinpoint exactly where accuracy is lost (rendering, tiling, prompt/IO or validation), and come back with quick wins + a clear phase-2 plan for the implementation. No production credentials needed for that. Want me to start there?

Hi Roger,

Thank you for the detailed context. The problem is clear, and I agree this is less about rebuilding the MVP and more about improving the precision and reliability of the visual extraction pipeline.

For this kind of technical drawing workflow, I would not rely on a single technique. In my experience, the best results usually come from combining high-resolution rendering, intelligent image slicing, and a dedicated detection layer, with OCR and LLMs used in supporting roles rather than as the core counting engine.

The first step would be to render the PDF pages at a sufficiently high DPI so that small symbols and thin line structures are preserved. If the source image is too compressed or too low-resolution, the model will inevitably miss small elements, especially in dense areas of the drawing. From there, I would split the page into overlapping tiles so symbols near borders are not lost during inference. That overlap is important because undercounting often happens exactly at tile boundaries.

For the actual symbol counting, I would use a computer vision detection approach rather than depending on OCR or a multimodal LLM to identify the symbols directly. OCR is useful for extracting text, zone labels, and legend content, but it is not the right tool for counting graphical elements. A detection model gives you a much more deterministic output, and it is easier to validate and trace.

After detection, I would apply deduplication logic across overlapping tiles, using coordinate mapping and suppression rules to avoid double counting the same symbol. I would also add confidence thresholds and consistency checks by zone, so the pipeline can flag suspicious results before anything is exported.

For the legend PDF, OCR makes sense because the goal there is structured text extraction into a dictionary. Then the extracted legend can be used as a reference layer to validate the detected symbols against the expected schema. I would treat a multimodal LLM as a reasoning and validation component, not as the primary extractor. In practice, that means using it to cross-check whether the output is consistent with the legend, the zone structure, and the expected symbol distribution, rather than asking it to do the counting itself.

So the architecture I would recommend is a hybrid one: high-DPI rasterization, overlapping tiling, CV-based symbol detection, OCR for text and legend extraction, and a final validation layer before sending the results to Google Sheets. The main objective is not only better detection, but also traceability and confidence in the final output.

I have worked on backend and automation systems where structured extraction and data validation were critical, including n8n-based workflows and OCR/computer vision pipelines. My focus in these cases is always the same: reduce missed detections, make the output auditable, and keep the pipeline stable enough for production use.

If useful, I can also outline how I would structure the pipeline step by step, including preprocessing, detection strategy, deduplication, and validation rules.

Best regards,
Paulo

Hola Roger — te había respondido más arriba (post #16), pero el filtro automático del foro lo ocultó por ser cuenta nueva y recién ahora los mods lo restauraron. Te lo re-menciono por si no lo llegaste a ver.
Sobre tus dos preguntas: experiencia con OCR/visión — mi proyecto principal en producción es procesamiento de PDFs administrativos en Python, y además estoy construyendo una herramienta de computer vision con segmentación (SAM2), así que detección de elementos en imágenes es algo que trabajo activamente. Para la fase PDF→imagen: render con DPI controlado + tiling con solapamiento (los símbolos chicos nunca quedan cortados en un borde) + validación determinística del conteo por zona contra la leyenda, el detalle está en mi post de arriba.
Si te sirve verlo en concreto: pasame una página de ejemplo con su leyenda y te devuelvo el resultado del render+tiling sobre esa página, así lo evaluás sobre tu caso real.

Hola Sebastián,

Gracias por avisar, sí, ahora he visto el mensaje.

El enfoque que planteas nos encaja bastante, especialmente la parte de render con DPI controlado, tiling con solapamiento y validación del conteo por zona contra la leyenda. Creemos que uno de los principales problemas del MVP actual puede estar precisamente en la calidad de entrada visual y en que el plano completo llega demasiado comprimido al modelo.

Nos parece muy interesante tu propuesta de hacer una prueba concreta con una página de ejemplo y su leyenda. Vamos a preparar material anonimizado para compartirlo de forma segura: una página de plano, su leyenda y, si es posible, una salida/conteo de referencia para comparar.

La idea sería que nos devuelvas el resultado del render+tiling sobre esa página, para poder valorar si mejora la calidad visual antes de entrar en la auditoría completa del workflow.

Durante los próximos días terminaremos de preparar los archivos y te los enviaremos.

Gracias de nuevo.

Hola Sebastián,

Antes de avanzar, solo quería aclarar una cosa para organizar bien la primera fase.

Nos interesa mucho tu propuesta de probar una página de ejemplo con su leyenda y devolvernos el resultado del render high-DPI + tiling con solapamiento.

¿Esa primera prueba técnica puntual la planteas como una prueba inicial sin coste para validar encaje, o prefieres definir un precio fijo para esta mini auditoría?

La idea sería algo muy acotado: una página de plano, su leyenda y, si podemos, una referencia parcial de conteo para comparar.

Gracias.