El proceso completo para producir tours digitales (denominado TOUR DIGITAL y se muestra en figura 3) es como sigue.
2.1 Colocación de etiquetas y captura de imágenes
Al crear un recorrido digital para cualquier propiedad inmobiliaria, es esencial hacer clic en imágenes de 360◦ desde diferentes ubicaciones de la propiedad, como dormitorio, sala de estar, cocina, etc., y luego unirlas automáticamente para tener un “tutorial“Experiencia sin estar físicamente presente en el lugar. Por lo tanto, para conectar múltiples imágenes equirectangulares, proponemos colocar etiquetas de papel en el piso que cubran cada ubicación de la propiedad y colocar la cámara (en nuestro caso utilizamos Ricoh-Theta) en el medio de la escena para capturar todo el sitio (delante, detrás, izquierda, derecha y abajo).
Además, nos aseguramos de que la escena esté libre de elementos ruidosos como iluminación tenue y ‘no deseado‘ artefactos para un mejor entrenamiento e inferencia del modelo. Como se muestra en Figura 4hemos estandarizado las etiquetas con dimensiones de 6” × 6” con dos propiedades:
- Están numerados, lo que ayudará al fotógrafo a colocar las etiquetas en secuencia y
- son bicolores para formular el problema de reconocimiento de dígitos como tarea de clasificación y facilitar un mejor aprendizaje de las tareas posteriores de visión por computadora (es decir, detección de etiquetas y reconocimiento de dígitos).
Tenga en cuenta que se asignan diferentes colores a cada dígito (de 0 a 9) que utiliza el esquema de color HSV y el dígito inicial de una etiqueta tiene un círculo negro para distinguirlo del dígito final, como se muestra en Figura 4. La intuición detrás de la estandarización de las etiquetas de papel es que permite entrenar modelos de detección de etiquetas y reconocimiento de dígitos, que son invariantes a las distorsiones, el ángulo de colocación de las etiquetas, el reflejo de las fuentes de iluminación, las condiciones de desenfoque y la calidad de la cámara.
2.2 Mapeo de una imagen equirectangular a una proyección de mapa cúbico
Una imagen equirectangular consta de una sola imagen cuyo ancho y alto se correlacionan como 2: 1 (como se muestra en Figura 1). En nuestro caso, se hace clic en las imágenes utilizando una cámara Ricoh-Theta que tiene dimensiones 4096 × 2048 × 3. Normalmente, cada punto en una imagen equirectangular corresponde a un punto en una esfera, y las imágenes se estiran en el ‘latitud‘ dirección. Dado que el contenido de una imagen equirectangular está distorsionado, resulta difícil detectar etiquetas y reconocer dígitos directamente a partir de ella. Por ejemplo, en Figura 1, la etiqueta se extiende en la parte media inferior de la imagen. Por lo tanto, es necesario mapear la imagen en una proyección menos distorsionada y volver a la imagen equirectangular original para construir el recorrido digital.
En este trabajo proponemos utilizar la proyección cartográfica de cubos, que es un conjunto de seis imágenes que representan seis caras de un cubo. Aquí, cada punto en el espacio de coordenadas esféricas corresponde a un punto en la cara del cubo. Como se muestra en Figura 5asignamos la imagen equirectangular a seis caras (izquierda, derecha, adelante, atrás, arriba y abajo) de un cubo que tiene dimensiones 1024 × 1024 × 3 usando la biblioteca de Python vrProjector.
2.3 Detección de etiquetas
Una vez que obtenemos las seis imágenes correspondientes a las caras de un cubo, detectamos la ubicación de las etiquetas colocadas en cada imagen. Para la detección de etiquetas, hemos utilizado el modelo YOLOv5 de última generación. Inicializamos la red con pesos COCO seguidos de entrenamiento en nuestro conjunto de datos. Como se muestra en Figura 6, el modelo toma una imagen como entrada y devuelve la etiqueta detectada junto con las coordenadas del cuadro delimitador y la confianza de la predicción. El modelo se entrena en nuestro conjunto de datos durante 100 épocas con un tamaño de lote de 32.
2.4 Reconocimiento de dígitos
Para las etiquetas detectadas, necesitamos reconocer los dígitos de la etiqueta. En un entorno real, las etiquetas detectadas pueden tener una orientación incorrecta, poca luminosidad, reflejos de las bombillas de la habitación, etc. Por estas razones, es un desafío utilizar motores de reconocimiento óptico de caracteres (OCR) para tener un buen reconocimiento de dígitos. actuación. Por lo tanto, hemos utilizado un modelo MobileNet personalizado inicializado en pesos de Imagenet, que utiliza información de color en etiquetas para el reconocimiento de dígitos. En la arquitectura propuesta, hemos reemplazado el bloque de clasificación final del MobileNet original con la capa de abandono y la capa densa con 20 nodos que representan nuestras etiquetas del 1 al 20. Figura 7 ilustra la arquitectura propuesta. Para entrenar el modelo, utilizamos Adam como optimizador con una tasa de aprendizaje de 0,001 y un factor de descuento (𝜌) de 0,1. Hemos utilizado la entropía cruzada categórica como función de pérdida y establecimos el tamaño del lote en 64 y el número de épocas en 50.
2.5 Asignación de coordenadas de etiquetas a la imagen original de 360◦ y creación del recorrido virtual
Una vez que hemos detectado las etiquetas y reconocido los dígitos, utilizamos la biblioteca de Python vrProjector para asignar las coordenadas del mapa del cubo a la imagen equirectangular original. Un resultado de ejemplo se muestra en Figura 8. Para cada imagen equirectangular, las etiquetas detectadas forman los nodos de un gráfico con un borde entre ellos. En las imágenes equirectangulares posteriores de una propiedad, el gráfico se completa con más nodos a medida que se detectan más etiquetas. Finalmente, conectamos múltiples imágenes equirectangulares en secuencia según los dígitos reconocidos escritos en ellas y el gráfico resultante es el
recorrido virtual como se muestra en Figura 2(b).
Hemos recopilado datos colocando etiquetas y haciendo clic en imágenes equirectangulares usando la cámara Ricoh-Theta para varias propiedades residenciales en Gurugram, India (ciudad de nivel 1). Mientras recopilamos imágenes, nos aseguramos de que se cumplieran ciertas condiciones, como que todas las puertas estuvieran abiertas y las luces encendidas.no deseado‘Se retiraron los objetos y se colocaron las etiquetas cubriendo cada área del inmueble. Siguiendo estas instrucciones, el número promedio de imágenes equirectangulares en las que se hizo clic por propiedad residencial fue 7 u 8. Finalmente, validamos nuestro enfoque en los siguientes conjuntos de datos generados (basado en el color de fondo de las etiquetas).
- Etiquetas de color verde: Hemos mantenido el color de fondo de estas etiquetas (numerados del 1 al 20) para ser verde. Hemos recopilado 1572 imágenes equirectangulares de 212 propiedades. Una vez que convertimos estas imágenes equirectangulares a proyección de mapa de cubos, obtenemos 9432 imágenes (correspondiente a las caras del cubo). Como no todas las caras del cubo tienen etiquetas (por ejemplo, cara superior), obtenemos 1503 imágenes con al menos una etiqueta.
- Etiquetas bicolores propuestas (ver Figura 4): Para estas etiquetas, hemos recopilado 2654 imágenes equirectangulares de 350 propiedades. Finalmente, obtuvimos 2896 imágenes (correspondiente a las caras del cubo) con al menos una etiqueta.
Finalmente, etiquetamos las etiquetas presentes en las imágenes de proyección de mapas cúbicos usando EtiquetaImg que es una herramienta de código abierto para etiquetar imágenes en varios formatos, como Pascal VOC y YOLO. Para todos los experimentos, reservamos el 20% de los datos para pruebas y el resto para entrenamiento.
Para cualquier imagen de entrada, primero detectamos las etiquetas y finalmente reconocemos los dígitos escritos en las etiquetas. A partir de esto pudimos identificar los verdaderos aspectos positivos (etiquetas detectadas y leídas correctamente), falsos positivos (etiquetas detectadas pero leídas incorrectamente) y falsos negativos (etiquetas no detectadas). El mAP, la precisión, la recuperación y la puntuación f1 obtenidos en el umbral de 0,5 IoU son 88,12, 93,83, 97,89 y 95,81 respectivamente. Tenga en cuenta que todas las métricas se promedian (ponderado) en las 20 clases. Si todas las etiquetas en todas las imágenes equirectangulares de una propiedad se detectan y leen correctamente, recibimos un recorrido virtual 100% preciso ya que todos los nodos del gráfico se detectan y conectan con sus bordes apropiados. En nuestros experimentos, pudimos generar recorridos virtuales 100% precisos para el 94,55% de las propiedades. Las imprecisiones se debieron a la presencia de artefactos coloridos que fueron detectados falsamente como etiquetas; y malas condiciones de iluminación.
Figura 9 demuestra el rendimiento del modelo Yolov5 para la detección de etiquetas basado en etiquetas de color verde y bicolores. Además, los experimentos y la comparación de modelos sobre reconocimiento de dígitos se muestran en Figura 10.
Proponemos un canal de extremo a extremo (DIGITOUR) para generar automáticamente recorridos digitales para propiedades inmobiliarias. Para cualquier propiedad de este tipo, primero colocamos las etiquetas de papel bicolor propuestas que cubren cada área de la propiedad. Luego, hacemos clic en imágenes equirectangulares y luego asignamos estas imágenes a imágenes de mapas de cubos menos distorsionadas. Una vez que obtenemos las seis imágenes correspondientes a las caras del cubo, detectamos la ubicación de las etiquetas usando el modelo YOLOv5, seguido del reconocimiento de dígitos usando el modelo MobileNet. El siguiente paso es asignar las coordenadas detectadas junto con los dígitos reconocidos a las imágenes equirectangulares originales. Finalmente, unimos todas las imágenes equirectangulares para crear un recorrido virtual. Validamos nuestra canalización en un conjunto de datos del mundo real y demostramos que el rendimiento de la canalización de extremo a extremo es 88,12 y 95,81 en términos de mAP y puntuación f1 con un umbral de 0,5 IoU promediado (ponderado) en todas las clases.
Si encuentra nuestro trabajo beneficioso y lo utiliza en sus proyectos, le rogamos que lo cite. 😊
@inproceedings{chhikara2023digitour,
title={Digitour: Automatic digital tours for real-estate properties},
author={Chhikara, Prateek and Kuhar, Harshul and Goyal, Anil and Sharma, Chirag},
booktitle={Proceedings of the 6th Joint International Conference on Data Science \& Management of Data (10th ACM IKDD CODS and 28th COMAD)},
pages={223--227},
year={2023}
}
[1] Dragomir Anguelov, Carole Dulong, Daniel Filip, Christian Frueh, Stéphane Lafon, Richard Lyon, Abhijit Ogale, Luc Vincent y Josh Weaver. 2010. Google Street View: Capturando el mundo a pie de calle. Computadora 43, 6 (2010), 32–38.
[2] Mohamad Zaidi Sulaiman, Mohd Nasiruddin Abdul Aziz, Mohd Haidar Abu Bakar, Nur Akma Halili y Muhammad Asri Azuddin. 2020. Matterport: recorrido virtual como nuevo enfoque de marketing en el negocio inmobiliario durante la pandemia COVID-19. En Congreso Internacional de Innovación en Medios y Diseño Visual (IMDES 2020). Prensa Atlantis, 221–226.
[3] Chinu Subudhi. 2021. Visitas virtuales de 360 grados de vanguardia. https://www.mindtree.com/insights/resources/cutting-edge-360-value-virtual-tours
[4] Glenn Jocher, Ayush Chaurasia, Alex Stoken, Jirka Borovec, NanoCode012, Yonghye Kwon, TaoXie, Jiacong Fang, imyhxy, Kalen Michael, Lorna, Abhiram V, Diego Montes, Jebastin Nadar, Laughing, tkianai, yxNONG, Piotr Skalski, Zhiqiang Wang, Adam Hogan, Cristi Fati, Lorenzo Mammana, AlexWang1900, Deep Patel, Ding Yiwei, Felix You, Jan Hajek, Laurentiu Diaconu y Mai Thanh Minh. 2022. ultralytics/yolov5: v6.1 — TensorRT, TensorFlow Edge TPU y OpenVINO Export and Inference.
[5] Mark Sandler, Andrew Howard, Menglong Zhu, Andrey Zhmoginov y LiangChieh Chen. 2018. Mobilenetv2: residuos invertidos y cuellos de botella lineales. En Actas de la conferencia IEEE sobre visión por computadora y reconocimiento de patrones. 4510–4520.