Visão Computacional¶
O que é¶
Visão computacional é a área da inteligência artificial dedicada a fazer computadores "enxergarem" — isto é, identificarem, interpretarem e extraírem informação de imagens e vídeos. Segundo a Enciclopédia Britannica, visão computacional é "um campo da inteligência artificial em que programas tentam identificar objetos representados em imagens digitalizadas fornecidas por câmeras, permitindo assim que computadores 'vejam'". Boa parte dos avanços recentes em visão computacional usa redes neurais artificiais treinadas com grandes quantidades de imagens.
Por que isso importa?¶
Muitas ferramentas usadas em pesquisa histórica que lidam com fontes visuais — digitalização de documentos, reconhecimento de escrita, organização automática de fotografias de acervo — dependem de visão computacional. Entender esse campo ajuda a interpretar por que ferramentas desse tipo podem ter dificuldade com imagens de baixa qualidade, danificadas ou com características visuais pouco comuns nos dados usados para treinar os modelos.
Exemplo¶
Ferramentas de OCR e HTR, como o Tesseract e o eScriptorium, aplicam técnicas de visão computacional para identificar onde, numa imagem de página digitalizada, estão os caracteres ou palavras escritas, antes de convertê-los em texto — a etapa de visão computacional acontece antes, e é a base, do reconhecimento de caracteres propriamente dito.
Não confunda com¶
Visão computacional não é sinônimo de OCR: OCR é uma aplicação específica de visão computacional voltada ao reconhecimento de caracteres; visão computacional é o campo mais amplo, que inclui também tarefas como reconhecimento facial, detecção de objetos e análise de vídeo, sem relação com texto.
Termos relacionados¶
Referências¶
- Encyclopaedia Britannica. Computer vision. britannica.com/technology/computer-vision