Amazon mostrou pipeline com Nova, SAM 3 e Textract para ocultação automática de PII em fotos
O AWS Machine Learning Blog apresentou um pipeline de várias etapas para ocultação automática de dados pessoais em imagens, orquestrado pela Amazon Nova. O modelo coordena múltiplas ferramentas através de raciocínio visual contextual: o Segment Anything Model (SAM 3) aberto do Meta, implantado na Amazon SageMaker AI para segmentação em nível de pixel, e Amazon Textract para reconhecimento óptico de caracteres. Segundo a AWS, o pipeline lida com casos complexos — impressões digitais, documentos de identidade e placas de licença de veículos em orientações arbitrárias.
Processado por IA de AWS Machine Learning Blog; editado por Hamidun News
AWS Machine Learning Blog apresentou um pipeline de múltiplas etapas para mascarar automaticamente dados pessoais em imagens, controlado pelo modelo Amazon Nova.
Como o pipeline funciona
No núcleo da solução está o raciocínio visual contextual do Amazon Nova, que coordena o trabalho de várias ferramentas complementares em vez de depender de um único algoritmo universal. Nova direciona requisições a dois sistemas especializados e combina seus resultados em um único processo de edição de imagem.
- Orquestrador do pipeline — Amazon Nova, raciocínio visual contextual
- Segmentação — Segment Anything Model aberto (SAM 3) do Meta
- Implantação de SAM 3 — na plataforma Amazon SageMaker AI, segmentação em nível de pixel
- Reconhecimento de texto — Amazon Textract, reconhecimento óptico de caracteres (OCR)
- Casos complexos — impressões digitais, documentos de identidade, placas de veículos em orientação arbitrária
Por que duas ferramentas adicionais são necessárias
O SAM 3 do Meta lida com segmentação em nível de pixel — destaque preciso de áreas de imagem que precisam ser mascaradas, até objetos não-padrão como uma impressão digital em um documento. Amazon Textract, por sua vez, reconhece texto em imagens, encontrando fragmentos como números de documentos ou assinaturas que a segmentação baseada em forma pode perder. Nova vincula essas duas fontes de sinal em uma única decisão sobre quais áreas exatas precisam ser editadas, garantindo que o resultado seja completo e em conformidade legal.
Os autores enfatizam especificamente que o pipeline foi projetado para casos raros e complexos — imagens onde dados pessoais estão localizados fora do modelo padrão: em ângulo, parcialmente obscurecidos ou pertencentes a tipos de dados inusuais como impressões digitais.
O que isso significa
A combinação do raciocínio visual de Nova com a segmentação aberta SAM 3 do Meta e o mecanismo OCR do Textract demonstra como os pipelines modernos de conformidade estão cada vez mais sendo construídos não em um único modelo, mas em orquestração de vários sistemas especializados, cada um fechando sua própria classe de erros.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.