Cargando...
 
Skip to main content

Multimedia Flujos y diacronías: Buenos Aires - Tucumán


A partir de la necesidad de armar una instalación con el archivo multimedia del viaje desde BsAs a Tucumán para el 7° Foro Argentino de la Bicicleta (FAB) surge este software que en este momento está alojado en https://github.com/cheperico/flujosydiacronias.

Flujosydiacronias Tucuman01

El archivo multimedia del viaje está compuesto por miles de imágenes, videos, textos, tracks de gps, un chat de telegram que también incluye más imágenes, más textos, más audios, etc.

Para poder "mostrar" todos esos medios se decidió que se iban a generar pequeñas presentaciones en la que los medios se seleccionen de forma aleatoria después de pasar por un filtro. Esos filtros, en un principio, serían los contenidos de los medios.

Acá ya nos enfrentamos a una primera serie de preguntas. Algunas se responden con decisiones, otras con investigación.

  • ¿Cómo hacemos filtrables los contenidos de miles de archivos multimedia?
  • ¿Es conveniente dedicar la mayoría del esfuerzo en estudiar estos archivos multimedia o es mejor elaborar una serie de procesos que se pueda utilizar con diferentes archivos de medios?
  • ¿Qué información tenemos disponible? ¿Qué otra información se puede conseguir?
  • ¿En qué nos pueden ayudar hoy en día las comptuadoras para estas tareas?
  • ¿Qué puedo hacer con la computadora que tengo en casa, que no es una computadora demasiado potente?


Lo primero que se decidió fue generar una base de datos con la gran mayoría de los medios y enriquecerlos con metadatos para poder armar relaciones que nos permitan armar visualizaciones accesibles. Lo segundo fue pensar alguna clase de sistema reutilizable con cualquier archivo multimedia, o al menos tratar de acercarnos a algo así.

¿Qué datos ya tienen los medios? Por lo general las cosas tienen mucha metadata incrustada o de fácil acceso. Por ejemplo, cada mensaje de Telegram tiene fecha y hora, las fotografías tomadas con el celular tienen ubicación de gps, fecha y hora (entre otros datos), los videos 360° generados con la cámara Insta360 tienen la fecha y hora en su nombre de archivo (que es correcto si la cámara tiene bien configurada la hora), etc.

Toda esa información permite deducir más información comparando con otras fuentes. El track de gps permite saber en dónde estaba la caravana en cada minuto (si no estaba el track de gps, se podría inferir con los datos de geolocalización de las fotografías siempre que hubieran fotografías de más o menos de todo el trayecto). Con esa información ya se puede saber dónde estaba la caravana cuando salió un mensaje de Telegram o dónde es que se comenzó a filmar un video. La información que contiene cada medio se puede ir completando y complementando entre sí.

Si ya tenemos ubicaciones y fechas. ¿Qué otra información podemos conseguir? ¿Hay bases de datos accesibles con el clima? ¿Podemos ubicar las imágenes según la división geográfica del país (provincias, departamentos, municipios)? ¿Es posible saber la ubicación del sol y otros astros en cada punto del viaje? ¿Podemos con la fecha deducir el día de la semana en que una imagen fue obtenida?

Todas esas, y muchas más, pueden ser nuevos enriquecimientos de la base de datos que permitirían armar nuevos criterios de visualizaciones. ¿Qué pudieron ver los días lunes? ¿Qué pasó en el viaje cada vez que se puso el sol? ¿Cómo le fue a los viajantes los días de lluvia? (La verdad que tuvieron suerte, nunca les tocó lluvia.)

Podemos decir que hasta ahora, con todo lo que se hizo, no fue necesario ver ninguna fotografía, ver ningún video, escuchar ningún audio. Ahora nos tocaría ver las 1327 fotografías que sacó Fabian, las 936 que sacó la Negra, las 537 imágenes que se pasaron por Telegram, las no sé cuántas fotografías que sacaron Juan Pablo, Nahuel, Agustín, Juan Marco, etc, etc. Ver si hay varias fotos de lo mismo y hacer una limpieza, después podemos etiquetar las fotos según su contenido ("atardecer", "camión", "campo", "ciudad", "basílica", "rancho", "animales rurales", "río", "puente", "reparación", "equipaje", "campamento", "taller", etc, etc, etc. Y luego hacer lo mismo con los sonidos (qué se escucha, de qué habla la gente) y los videos.

Hoy en día es posible delegar esas tareas a una máquina. Hay modelos de inteligencia artificial que pueden "ver" imágenes y describirlas o sacar etiquetas. Lo mismo con videos o con sonidos (incluso pueden transcribir lo que la gente dice). Los problemas son, al menos al día y hora en que se escribe este artículo y sin entrar en cuestiones éticas ni de soberanía tecnológica ni de soberanía de datos e información, que los modelos potentes requieren hardware potente, el cual es caro (ya sea para tenerlo o para alquilarlo). Gastar grandes sumas de dinero no es parte de la idea de este proyecto.

Sin embargo, es posible correr en local algunos modelos específicos de IA para diversas tareas. Solo hay que poner empeño en su configuración (o en cómo se promtea). Por ejemplo, los modelos para describir imágenes funcionaron mejor en inglés y luego traduciendo, que pidiendo directamente la descripción en español. O, por ejemplo, para los fines de este proyecto era suficiente con sacar algunos fotogramas de los videos y que el modelo de IA analice esos fotogramas en vez de hacerle analizar un video completo.

(en desarrollo)

Categoría: PedaLúdico