Um promotor de vendas tira uma foto da gôndola de bebidas. Em segundos, um sistema aponta quantas frentes cada marca ocupa, quais produtos estão ausentes e se o preço de uma etiqueta está desatualizado. Não houve contagem manual, planilha ou conferência por um analista. Isso é visão computacional aplicada ao varejo.
Neste artigo explicamos o conceito sem fórmulas, os principais usos no ponto de venda, as limitações reais da tecnologia e como começar.
O que é visão computacional
Visão computacional é um ramo da inteligência artificial que ensina máquinas a interpretar imagens e vídeos. Em vez de seguir regras escritas por um programador ("se o pixel for vermelho, é a marca X"), os sistemas modernos usam redes neurais treinadas com milhares de exemplos rotulados. Depois de treinado, o modelo reconhece padrões em imagens novas.
Para o varejo, três tarefas são centrais:
- Detecção de objetos: encontrar onde está cada produto na imagem e desenhar uma caixa ao redor.
- Classificação e reconhecimento: dizer o que é cada objeto (marca, variante, SKU).
- Leitura de texto (OCR): extrair números e letras, como o preço de uma etiqueta.
Como funciona na prática: da foto ao indicador
O processo pode ser entendido em cinco etapas.
1. Captura
O promotor fotografa a gôndola pelo aplicativo de campo. O app orienta o enquadramento (distância, ângulo, luz) e registra data, hora e localização. Quanto melhor a foto, melhor a leitura, então esta etapa importa muito.
2. Pré-processamento
A imagem é ajustada: correção de brilho, alinhamento, remoção de distorções. Em fotos panorâmicas ou de várias prateleiras, o sistema pode dividir a imagem em partes.
3. Detecção
Um modelo de detecção localiza cada produto e cada espaço vazio. O resultado é um conjunto de caixas com coordenadas e uma pontuação de confiança.
4. Reconhecimento
Cada caixa passa por um segundo modelo que identifica a marca e o SKU. Para isso, o sistema precisa conhecer as embalagens do portfólio, normalmente por meio de um catálogo de imagens de cada item, em diferentes ângulos.
5. Cálculo de indicadores
Com todos os produtos identificados, o sistema calcula indicadores como:
- Share de gôndola por marca, em número de frentes;
- Ruptura (itens esperados que não aparecem);
- Conformidade com o planograma;
- Preço lido nas etiquetas.
Veja um passo a passo do cálculo em como a IA mede share de gôndola a partir de uma foto.
Quais problemas ela resolve no varejo
Auditoria de gôndola sem contagem manual
Contar frentes, conferir posições e comparar com o planograma consome tempo e varia de pessoa para pessoa. A IA padroniza a leitura: a mesma foto gera o mesmo resultado.
Detecção de ruptura enquanto o promotor está na loja
Se o sistema aponta o buraco na prateleira em segundos, o promotor pode agir na hora (repor, avisar o gerente, registrar a causa), em vez de a ruptura aparecer só no relatório do dia seguinte. O impacto financeiro é discutido em ruptura de gôndola: causas, custo e como reduzir.
Leitura de preço
O OCR extrai o preço de etiquetas e permite comparar com o praticado pela concorrência. Veja também pesquisa de preço no varejo: como automatizar a coleta.
Prova de execução
Para a indústria, a foto deixa de ser apenas um comprovante visual e passa a ser uma fonte de dados estruturados. Em vez de olhar centenas de imagens, o time vê indicadores.
Análise da concorrência
Como o modelo enxerga a gôndola inteira, ele também mede o espaço ocupado por concorrentes, o que ajuda a negociar exposição com os varejistas.
O que a tecnologia ainda não faz bem
Ser honesto sobre limitações ajuda a evitar frustrações:
- Fotos ruins geram dados ruins. Reflexos, ângulos extremos, pouca luz e produtos parcialmente cobertos reduzem a precisão.
- Embalagens parecidas (mesma marca, sabores diferentes) exigem treino cuidadoso e boa base de imagens.
- Lançamentos e embalagens novas precisam ser adicionados ao catálogo antes de serem reconhecidos.
- Nada substitui a revisão humana em casos de baixa confiança. Bons sistemas indicam quando não têm certeza.
Esses pontos são detalhados em reconhecimento de SKU em prateleiras reais: desafios técnicos.
Do que você precisa para começar
Você não precisa de câmeras especiais nem de uma reforma na operação. Normalmente os pré-requisitos são:
- Um fluxo de coleta de fotos já existente (ou um app de campo que o crie). Se a sua equipe ainda não fotografa a gôndola, esse é o primeiro passo.
- Um catálogo de produtos com imagens e códigos do portfólio.
- Definição clara dos indicadores que importam (share, ruptura, planograma, preço).
- Um piloto em poucas redes e lojas, para medir a precisão e ajustar o modelo.
A abordagem mais segura é começar pelo indicador de maior valor (muitas vezes, ruptura ou share em uma categoria) e expandir depois.
Visão computacional e machine learning: como se complementam
A visão computacional transforma imagem em dado. O machine learning transforma dado em previsão. Juntos, formam um ciclo: as fotos geram indicadores de execução; os indicadores, somados a vendas e histórico, alimentam modelos que preveem onde a ruptura vai acontecer e quais lojas visitar primeiro. Veja o segundo passo em previsão de ruptura com machine learning.
A Koomp trabalha nessas duas camadas: o Koomp Vision, para leitura de gôndola por foto, e o Koomp Predict, para previsão. Conheça a solução de visão computacional para gôndola.
Cuidados com privacidade e uso responsável
Fotos de ponto de venda podem capturar pessoas por acidente (clientes e funcionários). Boas práticas incluem orientar o promotor a evitar rostos, aplicar anonimização quando necessário e definir prazos de retenção. O tema é tratado em LGPD em apps de campo.
Casos de uso por etapa da operação
A visão computacional não precisa ser implantada de uma vez. Muitas operações avançam por etapas, cada uma entregando valor próprio:
| Etapa | O que a IA faz | Valor para a operação |
|---|---|---|
| 1. Organização das fotos | Classifica a foto (gôndola, ponta, ilha) e checa se está legível | Menos fotos inúteis e retrabalho |
| 2. Presença e ruptura | Detecta se o item está na prateleira e aponta espaços vazios | Reposição mais rápida |
| 3. Share de gôndola | Conta frentes por marca e calcula participação | Dado objetivo para negociar espaço |
| 4. Planograma | Compara a gôndola real com a planejada | Conformidade medida sem auditoria presencial |
| 5. Preço | Lê a etiqueta e compara com o esperado | Monitoramento de preço em escala |
Começar pela etapa 1 ou 2 costuma ser a rota mais segura, porque exige menos treino específico do portfólio e entrega resultados visíveis rapidamente.
Como medir o retorno do investimento
Como qualquer tecnologia, a visão computacional precisa se justificar. Três perguntas ajudam a estimar o retorno:
- Quanto tempo a equipe gasta hoje conferindo fotos e contando frentes? Esse tempo pode ser realocado.
- Quanto a empresa perde com ruptura não detectada? Mesmo uma pequena redução na ruptura, multiplicada pelo número de lojas, costuma ser significativa.
- Quanto vale negociar exposição com dados? Um relatório de share objetivo, por rede, fortalece a conversa com o varejista.
Evite prometer ganhos genéricos. O mais honesto é definir, no piloto, a linha de base atual e comparar depois.
Perguntas que vale fazer a um fornecedor de visão computacional
- O modelo é treinado com as embalagens do meu portfólio ou é genérico?
- Como a precisão é medida e reportada? Existe uma revisão humana para casos de baixa confiança?
- O que acontece quando lanço um produto novo ou mudo uma embalagem?
- As imagens e os dados continuam sendo meus? Por quanto tempo ficam armazenados?
- É possível integrar o resultado ao painel e ao app que já uso?
Exemplo prático: uma gôndola de bebidas, passo a passo
Para tornar o conceito concreto, imagine uma gôndola de refrigerantes e sucos com três marcas relevantes e uma área de produtos de marca própria. O promotor fotografa o corredor em duas imagens, uma para cada metade da gôndola. O que o sistema entrega depois é bem diferente de uma pilha de fotos:
- Contagem de frentes por marca, por prateleira, com a posição de cada item (altura e lado da gôndola).
- Espaços vazios destacados, indicando em qual prateleira e perto de qual produto está o buraco.
- Produtos fora do lugar, como um item de outra categoria misturado na prateleira.
- Preços lidos das etiquetas, quando legíveis, e sinalização das que estão divergentes do esperado.
Com esse resultado, o supervisor não precisa abrir cada foto. Ele filtra as lojas com ruptura acima de um limite, prioriza a reposição e leva ao comercial um relatório de share por rede com dados que podem ser auditados: basta clicar no indicador para ver a foto original com as caixas desenhadas.
Esse vínculo entre o número e a imagem é o que dá confiança ao dado. Quando alguém questiona um indicador, a resposta é a própria evidência da loja, e não a opinião de quem preencheu uma planilha.
Perguntas frequentes
Visão computacional e inteligência artificial são a mesma coisa?
Não. Inteligência artificial é o campo amplo; visão computacional é uma de suas áreas, focada em interpretar imagens. Machine learning é a técnica mais usada para construir sistemas de visão computacional.
Preciso de câmeras fixas nas lojas?
Não necessariamente. Muitas soluções para trade marketing usam fotos tiradas pelo celular do promotor durante a visita, o que dispensa instalação de equipamentos nas lojas.
Qual a precisão da leitura de produtos em gôndola?
Varia conforme a qualidade da foto, a base de imagens do portfólio e a complexidade da categoria. Por isso, o recomendado é medir a precisão em um piloto com as suas lojas e acompanhar continuamente, em vez de aceitar um número genérico.
