Introducción
Completado100 XP
2 minutos
Computer Vision es una de las áreas centrales de la inteligencia artificial (IA) y se enfoca
en crear soluciones que permitan a las aplicaciones habilitadas de IA "ver" el mundo y
darle sentido.
Por supuesto, los equipos informáticos no tienen ojos biológicos que funcionen como los
nuestros, pero son capaces de procesar imágenes, ya sea desde una fuente de cámara
en vivo o desde fotografías o videos digitales. Esta capacidad de procesar imágenes es
la clave para crear un software que pueda emular la percepción visual humana.
En este módulo, examinaremos algunos de los principios y técnicas fundamentales que
subyacen a la visión por ordenador. También presentaremos Visión de Azure AI de
Microsoft, un servicio en la nube que los desarrolladores pueden usar para crear una
amplia gama de soluciones de visión por ordenador.
Imágenes y procesamiento de
imágenes
Completado100 XP
8 minutos
Antes de explorar el procesamiento de imágenes y otras posibilidades de la visión por
ordenador, conviene considerar qué es realmente una imagen en el contexto de los
datos para un programa informático.
Imágenes como matrices de píxel
En un equipo, una imagen es una matriz de valores numéricos de píxeles. Por ejemplo,
considere la siguiente matriz:
Copiar
0 0 0 0 0 0 0
0 0 0 0 0 0 0
0 0 255 255 255 0 0
0 0 255 255 255 0 0
0 0 255 255 255 0 0
0 0 0 0 0 0 0
0 0 0 0 0 0 0
La matriz consta de siete filas y siete columnas, que representan los valores de píxel de
una imagen de 7x7 píxeles (que se conoce como la resolución de la imagen). Cada píxel
tiene un valor comprendido entre 0 (negro) y 255 (blanco); los valores entre estos
límites representan tonos de gris. La imagen representada por esta matriz es similar a la
siguiente imagen (magnificada):
La matriz de valores de píxeles de esta imagen es bidimensional (representa filas y
columnas, o coordenadas x e y) y define un único rectángulo de valores de píxeles. Una
sola capa de valores de píxeles como esta representa una imagen de escala de grises.
En realidad, la mayoría de las imágenes digitales son multidimensionales y constan de
tres capas (conocidas como canales) que representan los tonos de color rojo, verde y
azul (RGB). Por ejemplo, podríamos representar una imagen a color definiendo tres
canales de valores de pixel que creen la misma forma cuadrada que el ejemplo anterior
en escala de grises:
Copiar
Red:
150 150 150 150 150 150 150
150 150 150 150 150 150 150
150 150 255 255 255 150 150
150 150 255 255 255 150 150
150 150 255 255 255 150 150
150 150 150 150 150 150 150
150 150 150 150 150 150 150
Green:
0 0 0 0 0 0 0
0 0 0 0 0 0 0
0 0 255 255 255 0 0
0 0 255 255 255 0 0
0 0 255 255 255 0 0
0 0 0 0 0 0 0
0 0 0 0 0 0 0
Blue:
255 255 255 255 255 255 255
255 255 255 255 255 255 255
255 255 0 0 0 255 255
255 255 0 0 0 255 255
255 255 0 0 0 255 255
255 255 255 255 255 255 255
255 255 255 255 255 255 255
Esta es la imagen resultante:
Los cuadrados púrpuras se representan mediante la combinación:
Copiar
Red: 150
Green: 0
Blue: 255
Los cuadrados amarillos del centro se representan mediante la combinación:
Copiar
Red: 255
Green: 255
Blue: 0
Uso de filtros para procesar imágenes
Una manera común de realizar tareas de procesamiento de imágenes es
aplicar filtros que modifican los valores de píxel de la imagen para crear un efecto
visual. Un filtro se define mediante una o varias matrices de valores de píxel,
denominados kernels de filtro. Por ejemplo, podría definir el filtro con un kernel 3x3
como se muestra en este ejemplo:
Copiar
-1 -1 -1
-1 8 -1
-1 -1 -1
A continuación, el kernel se convoluciona a través de la imagen, calculando una suma
ponderada para cada revisión de 3x3 píxeles y asignando el resultado a una nueva
imagen. Es más fácil entender cómo funciona el filtrado explorando un ejemplo paso a
paso.
Empecemos con la imagen en escala de grises que exploramos anteriormente:
Copiar
0 0 0 0 0 0 0
0 0 0 0 0 0 0
0 0 255 255 255 0 0
0 0 255 255 255 0 0
0 0 255 255 255 0 0
0 0 0 0 0 0 0
0 0 0 0 0 0 0
En primer lugar, aplicamos el kernel del filtro a la revisión superior izquierda de la
imagen, multiplicando el valor de cada píxel por el valor de peso correspondiente en el
kernel y agregando los resultados:
Copiar
(0 x -1) + (0 x -1) + (0 x -1) +
(0 x -1) + (0 x 8) + (0 x -1) +
(0 x -1) + (0 x -1) + (255 x -1) = -255
El resultado (-255) se convierte en el primer valor de una nueva matriz. A continuación,
movemos el kernel del filtro un píxel hacia la derecha y repetimos la operación:
Copiar
(0 x -1) + (0 x -1) + (0 x -1) +
(0 x -1) + (0 x 8) + (0 x -1) +
(0 x -1) + (255 x -1) + (255 x -1) = -510
De nuevo, el resultado se agrega a la nueva matriz, que ahora contiene dos valores:
Copiar
-255 -510
El proceso se repite hasta que el filtro se ha convolucionado en toda la imagen, como se
muestra en esta animación:
El filtro se convoluciona a través de la imagen, calculando una nueva matriz de valores.
Algunos de los valores pueden estar fuera del intervalo de valores de 0 a 255 píxeles,
por lo que los valores se ajustan para ajustarse a ese intervalo. Debido a la forma del
filtro, no se calcula el borde exterior de los píxeles, por lo que se aplica un valor de
relleno (normalmente 0). La matriz resultante representa una nueva imagen en la que el
filtro ha transformado la imagen original. En este caso, el filtro ha tenido el efecto de
resaltar los bordes de las formas de la imagen.
Para ver más claramente el efecto del filtro, aquí tiene un ejemplo del mismo filtro
aplicado a una imagen real:
Expandir tabla
Imagen original Imagen filtrada
Debido a que el filtro se convoluciona a través de la imagen, este tipo de manipulación
de la imagen se conoce a menudo como filtrado convolucional. El filtro usado en este
ejemplo es un tipo determinado de filtro (denominado filtro laplace) que resalta los
bordes de los objetos de una imagen. Hay muchos otros tipos de filtros que se pueden
usar para crear desenfoques, dar nitidez, invertir el color y otros efectos.
Aprendizaje automático para
Computer Vision
Completado100 XP
10 minutos
La capacidad de usar filtros para aplicar efectos a imágenes resulta útil en tareas de
procesamiento de imágenes, como podría realizar con software de edición de imágenes.
Sin embargo, el objetivo de Computer Vision suele ser extraer significado o, al menos,
información accionable de imágenes, lo que requiere la creación de modelos de Machine
Learning entrenados para reconocer características basadas en grandes volúmenes de
imágenes existentes.
Sugerencia
En esta unidad se supone que está familiarizado con los principios fundamentales del
aprendizaje automático y que tiene conocimientos conceptuales de aprendizaje
profundo con redes neuronales. Si no está familiarizado con el aprendizaje automático,
considere la posibilidad de completar el módulo Aspectos básicos del aprendizaje
automático en Microsoft Learn.
Redes neuronales convolucionales (CNN)
Una de las arquitecturas de modelo de Machine Learning más comunes para Computer
Vision es una red neuronal convolucional (CNN). Las CNN usan filtros para extraer mapas
numéricos de características de imágenes y, a continuación, introducen los valores de
características a un modelo de aprendizaje profundo para generar una predicción de
etiquetas. Por ejemplo, en un escenario de clasificación de imágenes, la etiqueta
representa el asunto principal de la imagen (es decir, ¿de qué es esta imagen?). Podría
entrenar un modelo de CNN con imágenes de diferentes tipos de fruta (como manzanas,
plátanos y naranjas) para que la etiqueta que se prediga sea el tipo de fruta en una
imagen determinada.
Durante el proceso de entrenamiento de una CNN, los kernel de filtro se definen
inicialmente mediante valores de peso generados aleatoriamente. Entonces, a medida
que avance el proceso de entrenamiento, las predicciones de los modelos se evaluarán
con los valores de etiqueta conocidos y los pesos de filtro se ajustarán para mejorar la
precisión. Finalmente, el modelo entrenado de clasificación de imágenes de fruta usará
los pesos de filtro que mejor extraigan las características que ayuden a identificar
diferentes tipos de fruta.
En el diagrama siguiente se muestra cómo funciona una CNN para un modelo de
clasificación de imágenes:
1. Las imágenes con etiquetas conocidas (por ejemplo, 0: manzana; 1: plátano o 2: naranja)
se introducen en la red para entrenar el modelo.
2. Una o varias capas de filtros se usan para extraer características de cada imagen a medida
que se alimentan a través de la red. Los kernel de filtro comienzan con pesos asignados
aleatoriamente y generan matrices de valores numéricos denominados mapas de
características.
3. Los mapas de características se aplanan en una matriz unidimensional de valores de
características.
4. Los valores de características se introducen en una red neuronal totalmente conectada.
5. La capa de salida de la red neuronal usa una función softmax o similar para generar un
resultado que contenga un valor de probabilidad para cada clase posible. Por ejemplo: [0.2,
0.5, 0.3].
Durante el entrenamiento, las probabilidades de salida se comparan con la etiqueta de
clase real. Por ejemplo: una imagen de un plátano (clase 1) debería tener el valor [0.0,
1.0, 0.0]. La diferencia entre las puntuaciones de clase predichas y reales se usa para
calcular la pérdida en el modelo, mientras que los pesos de la red neuronal totalmente
conectada y los kernel de filtro de las capas de extracción de características se
modifican para reducir la pérdida.
El proceso de entrenamiento se repetirá en varias épocas hasta que se haya aprendido
un conjunto óptimo de pesos. A continuación, se guardarán los pesos y el modelo se
podrá usar para predecir las etiquetas de las nuevas imágenes de las que se desconozca
la etiqueta.
Nota
Normalmente, las arquitecturas de CNN incluyen varias capas de filtros convolucionales
y capas adicionales para reducir el tamaño de los mapas de características, restringir los
valores extraídos y manipular los valores de las características. Estas capas se han
omitido en este ejemplo simplificado para focalizar el concepto de clave, que consiste en
que los filtros se usan para extraer características numéricas de imágenes, que luego se
usan en una red neuronal para predecir etiquetas de imagen.
Transformadores y modelos multimodales
Las CNN han estado en el núcleo de las soluciones de Computer Vision durante muchos
años. Aunque normalmente se usan para resolver problemas de clasificación de
imágenes como se ha descrito anteriormente, también son la base de modelos de
Computer Vision más complejos. Por ejemplo, los modelos de detección de
objetos combinan capas de extracción de características de CNN con la identificación
de regiones de interés en imágenes para localizar varias clases de objeto en la misma
imagen.
Transformadores
La mayoría de los avances de Computer Vision durante décadas han sido impulsados por
mejoras en los modelos basados en CNN. Sin embargo, en otra materia de inteligencia
artificial: procesamiento del lenguaje natural (NLP), otro tipo de arquitectura de red
neuronal denominado transformador ha habilitado el desarrollo de modelos sofisticados
para el lenguaje. Los transformadores funcionan mediante el procesamiento de grandes
volúmenes de datos y tokens de lenguaje de codificación (que representan palabras o
frases individuales) como incrustaciones basadas en vectores (matrices de valores
numéricos). Puede pensar en una inserción como una representación de un conjunto de
dimensiones donde cada una representa algún atributo semántico del token. Las
incrustaciones se crean de tal forma que los tokens que se usan habitualmente en el
mismo contexto están más cerca dimensionalmente que las palabras no relacionadas.
Como ejemplo sencillo, en el diagrama siguiente se muestran algunas palabras
codificadas como vectores tridimensionales y trazadas en un espacio 3D:
Los tokens que son semánticamente similares se codifican en posiciones similares,
creando un modelo de lenguaje semántico que permite crear soluciones sofisticadas de
NLP para el análisis de texto, la traducción, la generación de lenguajes y otras tareas.
Nota
Solo se usaron tres dimensiones porque es fácil de visualizar. En realidad, los
codificadores de las redes transformadoras crean vectores con muchas más
dimensiones, definiendo relaciones semánticas complejas entre tokens basados en
cálculos algebraicos lineales. Las matemáticas implicadas son complejas, al igual que la
arquitectura de un modelo de transformador. Nuestro objetivo es proporcionar un
reconocimiento conceptual de cómo la codificación crea un modelo que encapsula las
relaciones entre entidades.
Modelos multimodales
El éxito de los transformadores como una manera de crear modelos de lenguaje ha
llevado a los investigadores de inteligencia artificial a considerar si el mismo enfoque
sería eficaz para datos de imagen. El resultado es el desarrollo de
modelos multimodales, en los que el modelo se entrena mediante un gran volumen de
imágenes con descripción, sin etiquetas fijas. Un codificador de imágenes extrae
características de imágenes basadas en valores de píxeles y las combina con
incrustaciones de texto creadas por un codificador de lenguaje. El modelo general
encapsula las relaciones entre las incrustaciones de tokens de lenguaje natural y las
características de imagen, tal y como se muestra aquí:
El modelo de Microsoft Florence es simplemente un modelo de este tipo. Entrenado con
grandes volúmenes de imágenes con descripción de Internet, incluye un codificador de
idioma y un codificador de imágenes. Florence es un ejemplo de un modelo de base. Es
decir, un modelo general entrenado previamente en el que se pueden crear varios
modelos adaptables para tareas especializadas. Por ejemplo, se puede usar Florence
como modelo de base para los modelos adaptables que realizan:
Clasificación de imágenes: Identificación de la categoría a la que pertenece una imagen.
Detección de objetos: Buscar objetos individuales dentro de una imagen.
Subtitulado: Generar descripciones adecuadas de imágenes.
Etiquetado: Compilar una lista de etiquetas de texto relevantes para una imagen.
Los modelos multimodales, como Florence, están a la vanguardia de la visión general
sobre informática e inteligencia artificial, y se espera que lideren los avances de
aquellos tipos de soluciones que la inteligencia artificial haga posible.
Visión de Azure AI
Completado100 XP
3 minutos
Aunque puede entrenar sus propios modelos de Machine Learning para Computer Vision,
la arquitectura de los modelos de Computer Vision podría resultar compleja; y necesita
volúmenes significativos de imágenes de entrenamiento y potencia de proceso para
realizar el proceso de entrenamiento.
El servicio Visión de Azure AI de Microsoft proporciona modelos de Computer Vision
precompilados y personalizables basados en el modelo de base Florence y proporcionan
diversas funcionalidades eficaces. Con Visión de Azure AI, es posible crear soluciones
sofisticadas de Computer Vision de forma rápida y sencilla; aprovechando la
funcionalidad "listo para usar" para muchos escenarios comunes de Computer Vision, a
la vez que se conserva la capacidad de crear modelos personalizados con sus propias
imágenes.
Recursos de Azure para el servicio Visión de Azure AI
Para usar Visión de Azure AI, debe crear un recurso para él en la suscripción de Azure.
Se puede usar cualquiera de los siguientes tipos de recursos:
Visión de Azure AI: Recurso específico para el servicio Visión de Azure AI. Utilice este tipo
de recurso si no tiene intención de utilizar otros servicios de Azure AI o si desea realizar un
seguimiento de la utilización y los costes de su recurso de Visión de Azure AI por separado.
Servicios de Azure AI: Un recurso general que incluye Visión de Azure AI junto con
muchos otros servicios de Azure AI, como Lenguaje de Azure AI, Custom Vision de Azure AI,
Traductor de Azure AI y otros. Utilice este tipo de recurso si tiene previsto utilizar varios
servicios de IA y desea simplificar la administración y el desarrollo.
Analizar imágenes con el servicio Visión de Azure AI
Después de crear un recurso adecuado en su suscripción, puede enviar imágenes al
servicio Visión de Azure AI para realizar una amplia variedad de tareas analíticas.
Visión de Azure AI admite varias funcionalidades de análisis de imágenes, entre las que
se incluyen:
Reconocimiento óptico de caracteres (OCR): extrayendo texto de imágenes.
Generar subtítulos y descripciones de imágenes.
Detección de miles de objetos comunes en imágenes.
Etiquetado de características visuales en imágenes
Estas tareas y muchas más, se pueden realizar en Estudio de filmación de Visión de
Azure AI.
Reconocimiento óptico de caracteres
El servicio Visión de Azure AI puede utilizar las funcionalidades de reconocimiento óptico
de caracteres (OCR) para detectar texto en imágenes. Por ejemplo, considere la
siguiente imagen de una etiqueta de nutrición en un producto de una tienda de
comestibles:
El servicio Visión de Azure AI podría analizar esta imagen y extraer el texto siguiente:
Copiar
Nutrition Facts Amount Per Serving
Serving size:1 bar (40g)
Serving Per Package: 4
Total Fat 13g
Saturated Fat 1.5g
Amount Per Serving
Trans Fat 0g
calories 190
Cholesterol 0mg
ories from Fat 110
Sodium 20mg
ntDaily Values are based on
Vitamin A 50
calorie diet
Sugerencia
Puede explorar aún más las funcionalidades de OCR de Visión de Azure AI en el
módulo Leer texto con Visión de Azure AI de Microsoft Learn.
Descripción de una imagen con subtítulos
Visión de Azure AI tiene la capacidad de analizar una imagen, evaluar los objetos que se
detectan y generar una frase legible para el usuario que pueda describir lo que se ha
detectado en la imagen. Por ejemplo, considere la imagen siguiente:
Visión de Azure AI devuelve los siguientes subtítulos para esta imagen:
Un hombre saltando en un monopatín
Detección de objetos comunes en una imagen
Visión de Azure AI puede identificar miles de objetos comunes en imágenes. Por
ejemplo, cuando se usa para detectar objetos en la imagen del patinador descrita
anteriormente, Visión de Azure AI devuelve las siguientes predicciones:
Monopatín (90,40 %)
Persona (95,5 %)
Las predicciones incluyen una puntuación de confianza que indica la probabilidad que el
modelo calculó para los objetos previstos.
Además de las etiquetas de objeto detectadas y sus probabilidades, Visión de Azure AI
devuelve coordenadas de rectángulo de selección que indican la parte superior,
izquierda, el ancho y el alto del objeto detectado. Es posible usar estas coordenadas
para determinar dónde se detectó cada objeto en la imagen de la siguiente manera:
Etiquetado de características visuales
Visión de Azure AI puede sugerir etiquetas para una imagen en función de su contenido.
Estas etiquetas se pueden asociar a la imagen como metadatos que resumen los
atributos de la imagen; y pueden ser útiles en caso de desear indexar una imagen junto
con un conjunto de términos clave que se puedan usar para buscar imágenes con
atributos o contenido específicos.
Por ejemplo, las etiquetas devueltas para la imagen del patinador (con puntuaciones de
confianza asociadas) incluyen:
deporte (99,60 %)
persona (99,56 %)
calzado (98,05 %)
patinaje (96,27 %)
deporte de tabla (95,58 %)
equipo de monopatinaje (94,43 %)
ropa (94,02 %)
pared (93,81 %)
monopatinaje (93,78 %)
patinador (93,25 %)
deportes individuales (92,80 %)
acrobacias callejeras (90,81 %)
saldo (90,81 %)
salto (89,87 %)
equipamiento deportivo (88,61 %)
deporte extremo (88,35 %)
kickflip (88,18 %)
acrobacia (87,27 %)
monopatín (86,87 %)
acróbata (85,83 %)
rodilla (85,30 %)
deportes (85,24 %)
longboard (84,61 %)
montar en longboard (84,45 %)
montar (73,37 %)
patinar (67,27 %)
aire (64,83 %)
joven (63,29 %)
exterior (61,39 %)
Entrenamiento de modelos personalizados
Si los modelos integrados proporcionados por Visión de Azure AI no satisfacen sus
necesidades, puede usar el servicio para entrenar un modelo personalizado para
la clasificación de imágenes o la detección de objetos. Visión de Azure AI compila
modelos personalizados en el modelo básico entrenado previamente, lo que significa
que podrá entrenar modelos sofisticados con relativamente pocas imágenes de
entrenamiento.
Clasificación de imágenes
Un modelo de clasificación de imágenes se usa para predecir la categoría o la clase de
una imagen. Por ejemplo, podría entrenar un modelo para determinar qué tipo de fruta
se muestra en una imagen de la siguiente manera:
Expandir tabla
Apple Banana Orange
Detección de objetos
Los modelos de detección de objetos detectan y clasifican objetos en una imagen y
devuelven coordenadas de rectángulo de selección para localizar cada objeto. Además
de las funcionalidades de detección de objetos integradas en Visión de Azure AI, es
posible entrenar modelos personalizados de detección de objetos con sus propias
imágenes. Por ejemplo, podría usar fotografías de frutas para entrenar un modelo que
detectase varias frutas en una imagen de esta forma:
Nota
Los detalles de cómo usar Visión de Azure AI para entrenar un modelo personalizado
están fuera del ámbito de este módulo. Puede encontrar información sobre el
entrenamiento de modelos personalizados en la documentación de Visión de Azure
AI.
Analizar imágenes en Vision Studio
Azure AI Vision incluye numerosas capacidades para comprender el contenido y el
contexto de las imágenes y extraer información de las imágenes. Azure AI Vision Studio
le permite probar muchas de las capacidades de análisis de imágenes.
En este ejercicio, utilizará Vision Studio para analizar imágenes mediante las
experiencias de prueba integradas. Supongamos que el minorista ficticio Northwind
Traders ha decidido implementar una “tienda inteligente”, en la que los servicios de
inteligencia artificial monitorean la tienda para identificar a los clientes que requieren
asistencia y dirigen a los empleados para que los ayuden. Al utilizar Azure AI Vision, las
imágenes tomadas por las cámaras de toda la tienda se pueden analizar para
proporcionar descripciones significativas de lo que representan.
Crear un recurso de servicios de Azure AI
Puede usar las capacidades de análisis de imágenes de Azure AI Vision con un recurso
multiservicio de servicios de Azure AI . Si aún no lo ha hecho, cree un recurso de
servicios de Azure AI en su suscripción de Azure.
1. En otra pestaña del navegador, abra el portal de Azure
en [Link] e inicie sesión con la cuenta de Microsoft asociada a su
suscripción de Azure.
2. Haga clic en el botón +Crear un recurso y busque servicios de Azure AI .
Seleccione crear un plan de servicios de Azure AI . Se le dirigirá a una página para
crear un recurso de servicios de Azure AI. Configúrelo con las siguientes configuraciones:
o Suscripción : Su suscripción a Azure .
o Grupo de recursos : seleccione o cree un grupo de recursos con un nombre
exclusivo .
o Región : Este de EE. UU.
o Nombre : Introduzca un nombre único .
o Nivel de precios : Estándar S0.
o Al marcar esta casilla reconozco que he leído y comprendido todos los
términos siguientes : Seleccionado .
3. Seleccione Revisar + crear , luego Crear y espere a que se complete la
implementación.
Conecte su recurso de servicio Azure AI a Vision Studio
A continuación, conecte el recurso del servicio Azure AI que aprovisionó anteriormente a
Vision Studio.
1. En otra pestaña del navegador, navegue hasta Vision Studio .
2. Inicie sesión con su cuenta y asegúrese de estar utilizando el mismo directorio en
el que creó su recurso de servicios de Azure AI.
3. En la página de inicio de Vision Studio, seleccione Ver todos los recursos en el
encabezado Introducción a Vision .
4. En la página Seleccione un recurso para trabajar , coloque el cursor del mouse
sobre el recurso que creó anteriormente en la lista y luego marque la casilla a la
izquierda del nombre del recurso, luego seleccione Seleccionar como recurso
predeterminado .
Nota : si su recurso no aparece en la lista, es posible que deba actualizar la página.
5. Cierre la página de configuración seleccionando la "x" en la parte superior derecha
de la pantalla.
Generar títulos para una imagen
Ahora está listo para usar Vision Studio para analizar imágenes tomadas con una
cámara en la tienda Northwind Traders .
Veamos la funcionalidad de subtítulos de imágenes de Azure AI Vision. Los títulos de
imágenes están disponibles a través de las funciones Subtítulos y Subtítulos
densos .
1. En un navegador web, navegue hasta Vision Studio .
2. En la página de inicio Introducción a Vision , seleccione la pestaña Análisis de
imagen y luego seleccione el mosaico Agregar títulos a imágenes .
3. Bajo el subtítulo Pruébelo , reconozca la política de uso de recursos leyendo y
marcando la casilla.
4. Seleccione [Link] para
descargar [Link] . Abra la carpeta en su computadora y busque el
archivo llamado [Link] ; que contiene la siguiente imagen:
5. Cargue la imagen [Link] arrastrándola al cuadro Arrastrar y
soltar archivos aquí , o buscándola en su sistema de archivos.
6. Observe el texto del título generado, visible en el panel de atributos
detectados a la derecha de la imagen.
La función Título proporciona una única frase en inglés legible por humanos que
describe el contenido de la imagen.
7. A continuación, utilice la misma imagen para realizar subtítulos densos .
Regrese a la página de inicio de Vision Studio y, como lo hizo antes, seleccione
la pestaña Análisis de imagen y luego seleccione el mosaico Subtítulos
densos .
La función Subtítulos densos se diferencia de la capacidad Subtítulos en que
proporciona múltiples subtítulos legibles por humanos para una imagen, uno que
describe el contenido de la imagen y otros, cada uno de los cuales cubre los
objetos esenciales detectados en la imagen. Cada objeto detectado incluye un
cuadro delimitador, que define las coordenadas de píxeles dentro de la imagen
asociada con el objeto.
8. Pase el cursor sobre uno de los títulos en la lista de atributos detectados y
observe lo que sucede dentro de la imagen.
Mueva el cursor del mouse sobre los otros títulos de la lista y observe cómo el
cuadro delimitador se desplaza en la imagen para resaltar la parte de la imagen
utilizada para generar el título.
Etiquetar imágenes
La siguiente característica que probará es la funcionalidad Extraer etiquetas . La
extracción de etiquetas se basa en miles de objetos reconocibles, incluidos seres vivos,
paisajes y acciones.
1. Regrese a la página de inicio de Vision Studio, luego seleccione el
mosaico Extraer etiquetas comunes de imágenes en la pestaña Análisis de
imagen .
2. En Elija el modelo que desea probar , deje seleccionado Producto
prediseñado versus modelo de brecha . En Elige tu idioma ,
selecciona inglés o un idioma de tu preferencia.
3. Abra la carpeta que contiene las imágenes que descargó y busque el archivo
llamado [Link] , que se ve así:
4. Sube el archivo [Link] .
5. Revise la lista de etiquetas extraídas de la imagen y la puntuación de confianza de
cada una en el panel de atributos detectados. Aquí, la puntuación de confianza es
la probabilidad de que el texto del atributo detectado describa lo que realmente
hay en la imagen. Observe en la lista de etiquetas que incluye no solo objetos,
sino también acciones, como comprar , vender y estar de pie .
Detección de objetos
En esta tarea, utilizará la función de detección de objetos de Análisis de imágenes. La
detección de objetos detecta y extrae cuadros delimitadores basados en miles de
objetos y seres vivos reconocibles.
1. Regrese a la página de inicio de Vision Studio, luego seleccione el
mosaico Detectar objetos comunes en imágenes en la pestaña Análisis de
imagen .
2. En Elija el modelo que desea probar , deje seleccionado Producto
prediseñado versus modelo de brecha .
3. Abra la carpeta que contiene las imágenes que descargó y busque el archivo
llamado [Link] , que se ve así:
4. Sube el archivo [Link] .
5. En el cuadro Atributos detectados , observe la lista de objetos detectados y sus
puntuaciones de confianza.
6. Pase el cursor del mouse sobre los objetos en la lista de atributos
detectados para resaltar el cuadro delimitador del objeto en la imagen.
7. Mueva el control deslizante Valor umbral hasta que se muestre un valor de 70 a
la derecha del control deslizante. Observe lo que sucede con los objetos de la lista.
El control deslizante de umbral especifica que solo se deben mostrar los objetos
identificados con una puntuación de confianza o una probabilidad mayor que el
umbral.
Limpiar
Si no tiene intención de hacer más ejercicios, elimine los recursos que ya no necesite.
Esto evita acumular costes innecesarios.
1. Abra Azure Portal y seleccione el grupo de recursos que contiene el recurso que creó.
2. Seleccione el recurso y seleccione Eliminar y luego Sí para confirmar. Luego se elimina el
recurso.
Resumen
Completado100 XP
1 minuto
La visión por ordenador se basa en el análisis y la manipulación de valores numéricos de
píxeles en imágenes. Los modelos de Machine Learning se entrenan mediante un gran
volumen de imágenes para habilitar escenarios comunes de visión por ordenador, como
la clasificación de imágenes, la detección de objetos, el etiquetado automatizado de
imágenes, el reconocimiento óptico de caracteres, etc.
Aunque puede crear sus propios modelos de Machine Learning para la visión por
ordenador, el servicio Visión de Azure AI proporciona muchas funcionalidades
previamente entrenadas que puede usar para analizar imágenes, como la generación de
un subtítulo descriptiva, la extracción de etiquetas pertinentes, la identificación de
objetos, etc.