Ebam
14 a 18 de septiembre de 2020. João Pessoa …
Accesibilidad de contenidos digitales: políticas de información institucionales
Durante esta formación reflexionaremos sobre la misión de la biblioteca pública como agente
social, como espacio de empoderamiento de los ciudadanos, sean cuales sean sus capacidades
intelectua-les o cognitivas, así como físicas.
Los alumnos podrán detectar sus fortalezas para empoderarse ellos mismos como profesionales
de la información, ya que nadie puede dar lo que no tiene. Se capacitarán para diseñar,
programar y coordinar un club de lectura fácil, pudiendo delegar su dinamización a otras
personas que sigan sus directrices.
lectura facil
Bibliotecarios y profesionales de la información del siglo XXI. Competencias y capacidades. Código
de ética de la IFLA.
• Características de los ciudadanos con discapacidades a los que da servicio la biblioteca
pública.
• Conocimiento y práctica de habilidades de comunicación orientada a la atención al usuario
con discapacidad.
• Definición de lectura fácil, características y proceso de producción. Normativa y
recomendaciones. Tratado de Marrakech.
• El proceso de selección bibliográfica para la lectura fácil. Criterios y orientaciones.
Principales editoriales, plataformas y productores.
• El club de lectura fácil. Características y recomendaciones. Diseño, programación y
ejecución de sesiones de lectura fácil para diferentes colectivos.
La plata
Esta mesa tiene por objetivo reflexionar sobre las posibilidades de acción y de resistencia de
las instituciones como brazo ejecutor de las políticas públicas de la información y la cultura, con
especial énfasis en la situación y las perspectivas de desarrollo a nivel nacional y regional. Por
otro lado, se propiciará como un espacio de encuentro para poner en diálogo variadas
experiencias y campos de acción de los y las profesionales de la información y la cultura, a
través de una puesta en común de problemáticas y expectativas. Se parte de la idea de que las
políticas de información son parte del amplio entramado de políticas públicas que propone el
Estado, donde convergen iniciativas estatales con intereses del mercado y demandas de la
sociedad civil, en procesos tensionados que habilitan o censuran derechos culturales colectivos
e individuales como el acceso a la información, a la privacidad, a la libre expresión y la
educación. Estos ejes guían el trabajo de unidades de información que se articulan, a su vez,
con las políticas públicas a través de programas, proyectos y servicios. En esta mesa se
sugieren las líneas siguientes temáticas para la presentación de ponencias: políticas
nacionales y regionales de información; iniciativas de bibliotecas, museos y archivos desde una
perspectiva de derechos humanos; políticas de información y gestión de datos; políticas de
información desde una perspectiva de género; el rol del profesional de la información y los
derechos ciudadanos; tensiones en una economía basada en la información y el conocimiento
y los productores y protectores de bienes culturales; iniciativas de bibliotecas frente a las
tensiones del paradigma informacional.
políticas de información
Inteligencia artificial en GLAM: políticas de información
Resumen
El artículo analiza los desarrollos en Inteligencia Artificial (IA) en Galerías, Bibliotecas, Archivos y
Museos (GLAM) y las implicancias de su uso concluyendo la necesidad de la formulación de una
política en IA.
El aprendizaje automático (machine learning) constituye un tipo de inteligencia artificial específica
capaz de ser entrenada, enseñada o programada sin una acción humana directa. Una aplicación de
aprendizaje automático es alimentada con datos que son consumidos y éstos determinan la
respuesta. Este sistema es diseñado para identificar ciertos patrones a través del entrenamiento con
un conjunto de datos grande, realizando iteraciones en donde el sistema presenta su propia salida
reprogramando sus acciones y adhiriendo a procesos cooperativos o competitivos entre distintos
agentes.
Se detallan algunos casos del uso de IA en GLAM:
• Servicios sobre colección de tesis: recomendador de contenidos similares a uno elegido,
búsqueda de contenido similar a uno presentado y revisión bibliográfica
• Servicio de referencia asistido por un bot
• Asignación temática
• Revisión por pares: asignación de revisores, asignación de palabras clave, asignación de
tópicos, chequeo gramatical
• Edición académica
Se analizan los problemas de sesgo que se producen por ejemplo por el uso preponderante del
idioma inglés en los conjuntos de datos lo que sesga otros idiomas y por transitiva a autores o
revisores que no son de habla inglesa. Aunque los algoritmos se generen sin sesgo intencional, esto
igual puede producirse por la naturaleza de los datos con que son alimentados.
Los profesionales de la información deberán formar parte de grupos interdisciplinarios que busquen
desarrollar iniciativas que legislen obligaciones legales para forzar a las instituciones a asegurarse el
impacto de los algoritmos para realizar decisiones y corregir los errores si se detecta sesgo.
Asimismo los profesionales de la información tienen un papel importante en asesorar a los usuarios
de sistemas de IA sobre las limitaciones de éstos y sobre la interpretación de los resultados que no
son objetivos, completos o totalmente correctos y que representan una declaración de probabilidad.
Inteligencia artificial en GLAM: políticas de información
1. Inteligencia artificial (IA)
Determinar que constituye la inteligencia es un tema que ha sido largamente debatido y en
particular si es que puede considerarse inteligencia la actividad de los autómatas. En ese sentido ha
habido iniciativas en los juegos donde un humano y una computadora juegan ajedrez (Deep Blue) o
Go (AlphaGo).
Turing (Turing,1950) planteó que si en una conversación entre un humano y una máquina, el
humano no puede discernir que su interlocutor es una máquina entonces se podría considerar que la
máquina es inteligente.
En un principio los desarrollos en IA fueron en la línea de representar el conocimiento humano a
través de enunciados lógicos y conjunto de reglas como en los sistemas expertos, esto es emular el
conocimiento humano.
El aprendizaje automático (machine learning) constituye un tipo de inteligencia artificial específica
capaz de ser entrenada, enseñada o programada sin una acción humana directa. Una aplicación de
aprendizaje automático es alimentada con datos que son consumidos y éstos determinan la
respuesta. Este sistema es diseñado para identificar ciertos patrones a través del entrenamiento con
un conjunto de datos grande, realizando iteraciones en donde el sistema presenta su propia salida
reprogramando sus acciones y adhiriendo a procesos cooperativos o competitivos entre distintos
agentes.
En este punto aparece un elemento a considerar que es la privacidad de los datos y su posterior
manipulación en un sistema de inteligencia artificial y el problema de sesgar los datos.
Estos sistemas de IA son cajas negras, no corresponden a sistemas clásicos que son predecibles sino
que actúan a partir de datos y algoritmos complejos como los de redes neuronales, que no pueden
ser analizados en forma procedural y que tienen una expectativa de comportamiento de probabilidad
estadística.
Las redes neuronales emulan el comportamiento biológico en el que cada neurona realiza una
pequeña parte de razonamiento que responde a un determinado estímulo y comunica su respuesta a
otras neuronas a las que se conecta, y el resultado se forma con pequeñas acciones o decisiones de
una manera flexible en un conjunto muy grande de neuronas. Los resultados a los estímulos, que
pueden provenir de un conjunto de datos, o de los resultados del procesamiento de los datos por
otras neuronas, en una red neuronal, se ajustan en un proceso que se denomina entrenamiento. El
entrenamiento de un conjunto de datos - idealmente un gran conjunto de datos - en una red
neuronal se realiza codificando estructuras que el software puede usar para crear sus propias reglas
y esto converge a un modelo que puede realizar inferencias o predicciones, aunque en un contexto
de especialización, en un dominio
Estas aproximaciones delinean lo que se denomina IA fuerte e IA débil. La diferencia entre la IA
simbólica () y el aprendizaje automático es que en el primer caso se aplican una serie de reglas que
se programan – que están fijas y no pueden ser cambiadas - mientras que en el aprendizaje
automático el programa aprende a partir de los datos creando y refinando las reglas.
2. IA en Galerías, Bibliotecas, Archivos Museos (GLAM)
En lo que sigue se detallan algunos casos de interés de utilización de IA en GLAM
2.1 Servicios de búsqueda: HAMLET (“How about Machine Learning Enhancing Theses?”)
(Boman, 2019)
[Link]
Es una red neuronal entrenada en 2017 con una colección de tesis de grado del MIT para testear
interfaces de descubrimiento. Tiene tres servicios, un recomendador que dada una tesis busca tesis
de contenido conceptual similar, otro que dado un contenido textual busca tesis que tengan
contenido similar y un tercero que realiza una revisión de literatura sobre un contenido textual.
Hamlet utiliza un algoritmo para estimar similaridad entre documentos que se basa en otro que
estima la similaridad entre palabras.
El algoritmo de similaridad entre palabras se basa en la presunción de que si dos palabras ocurren
en contextos similares entonces tienen significados similares. Por ejemplo si tenemos las frases:
• Las bibliotecas cumplen una función de importancia social
• Los archivos cumplen una función de importancia social
Entonces se concluye que bibliotecas y archivos deben tener significados similares.
En la medida que la red se entrena con un corpus de tesis y se ajusta se van realizando inferencias y
predicciones. Si sabemos que bibliotecas y archivos tienen un significado similar, entonces a partir
de la frase:
• Las bibliotecas son importantes para la educación
Se puede inferir que:
• Los archivos son importantes para la educación
aunque esta última frase no esté en el corpus.
La idea de similaridad tiene que ver con la coordinación o distancia de las palabras en los textos y
no incursiona en la semántica, se trata de un modelo matemático.
La similaridad entre documentos es una extensión que se basa en la idea de que los documentos
tienen un significado global y que las palabras dentro del documento definen ese significado global.
Este proceso de construcción de similaridades genera clusters de documentos, es decir agrupaciones
que no son categorías temáticas pero que se aproximan.
2.2 Servicios de referencia web (Young, 2019)
La biblioteca de la Universidad de Oklahoma tiene un servicio de referencia que es contestado por
un bot (aféresis de robot). Un chatbot o bot es un simulador de conversaciones que proporciona
respuestas automáticas.
La mayoría de las preguntas que el chatbot gestiona son sencillas y de tipo administrativo como el
horario de la biblioteca, cuando la complejidad es mayor el bot escala a un humano para la
contestación
La IA en un bot se construye utilizando conceptos del lenguaje natural que son diseñados para
simular una conversación, Natural Language Interaction (NLI). La ventaje del procesamiento NLI
es la habilidad de usar frases (verbos, nombres, adjetivos, etc.) de la entrada para proporcionar una
salida o contestación que corresponde a la intención de la pregunta. Por otra parte la información
actualizada de la web, la biblioteca, la base de datos que se elija está disponible y se presenta de una
manera más humana que a través de un buscador (Allison, 2011).
2.3 Generación de metadatos (KB Biblioteca Nacional de Holanda, 2019)
La biblioteca Nacional de Holanda, desarrolló una serie de pruebas para la asignación temática con
su tesauro – materias Brinkman - y encontró un resultado adecuado utilizando el método de las
“palabras embebidas”, basado en una red neurológica. Esta red coloca el significado de las palabras
en un vector continuo que permite buscar por la palabra u otras palabras que están relacionadas
respecto al significado. Se ajustó esta metodología para trabajar con varios idioma simultáneamente
ya que el acervo está mayoritariamente en inglés y holandés.
Otro método que funcionó adecuadamente fue el “FastText” que consiste en tomar como entrada el
título, el resumen, las palabras clave y el nombre de la Institución de investigación.
Usaron aplicaciones que combinan estrategias de recuperación de información TF-IDF con bola de
nieve.
El resultado puede verse en una demo en [Link]
El estudio comparó la asignación automáticas de términos contra la manual, y como conclusión se
establece que es necesario tener un conjunto de datos mayor.
Una prueba que se propone realizar es comparar no solo las dos asignaciones (manual y utomática),
sino ver si las asignaciones automáticas no establecidas manualmente son relevantes.
Otra investigación propuesta es la asignación de metadatos estructurales y metadatos de contenido.
Para los metadatos de contenido se plantea usar Named Entity Recognition (NER) para la
extracción de entidades de un texto. Estos elementos se enlazarán a un tesauro, tomando en cuenta
la polisemia y las variantes ortográficas.
Los datos estructurales se relacionan con marcadores de elementos estructurales, tales como
encabezados, número de página, tablas, etc. Con algunos géneros la estructura es clara, pero con
ensayos y periódicos es más complejo.
La propuesta de la utilización de estas herramientas es facilitar el trabajo a los catalogadores pero
no reemplazarlos, la perspectiva humana, con las habilidades y la experiencia son una garantía de
calidad para la Biblioteca Nacional de Holanda.
2.4 Laboratorios de inteligencia artificial en bibliotecas
En la Universidad de Rhode Island se ubicó el laboratorio de inteligencia artificial en la biblioteca
porque se parte de la idea de que es un lugar compartido, interdisciplinario e inclusivo que
fomentará el trabajo de forma colaborativa y abrirá la posibilidad de participación en un plano de
igualdad.
En este caso no se trata de una aplicación de la biblioteca, sino de la utilización del espacio de la
biblioteca para un laboratorio de IA con el contenido simbólico que esto implica.
De acuerdo a (Dudley, 2013) las bibliotecas no son solo proveedoras de información sino
proveedoras de experiencias, espacios para realizar aprendizaje o producción de conocimiento,
favoreciendo la innovación, ofreciendo un lugar y los medios para su desarrollo. Se concibe este
espacio inclusivo, creativo y comunitario como un servicio del la biblioteca, como un espacio de
aprendizaje activo.
[Link]
inteligencia-artificial/
2.5 Revisión por pares (Thelwall, 2019)
Hay muchos aspectos que tienen que ver con la revisión por pares que pueden ser automatizadas
con IA:
• algoritmos que sugieran revisores al cotejar los artículos publicados que ya han sido
asignados a un revisor y que tienen contenido similar o se relacionan por las referencias
bibliográficas; o a través de los metadatos.
• algoritmos que generen palabras clave para un artículo, que puede utilizarse para artículos
viejos que no los tengan
• algoritmos que realicen extracción de tópicos a partir del texto completo
• algoritmos de chequeo gramatical
entre muchos otros.
En estos algoritmos la calidad del lenguaje es un tema complejo, porque si bien la mayoría de los
documentos se escriben en un lenguaje académico bastante estandarizado, un algoritmo que
encuentre términos poco usuales puede cometer errores.
Un algoritmo que utilice palabras clave para encontrar revisores apropiados tendrá dificultades con
autores que no son nativos de habla inglesa y que eligen términos que no son los más usados en
inglés pero si en su ámbito.
Los problemas de idiomas pueden causar sesgos contra los autores que no tienen el inglés como su
lengua nativa, porque la cantidad de documentos con que se alimenta el algoritmo posiblemente
sean preponderantemente de origen de habla inglesa. Esto produce una discriminación “transitiva”
porque los autores cuya lengua nativa no es el inglés provendrán en gran parte de países del tercer
mundo.
Un algoritmo que no sea de IA aplica un conjunto de reglas en un proceso que puede ser auditado
porque es transparente. En el caso de algoritmos de IA es más complejo, ya que los algoritmos son
“opacos” y abstractos por lo que no son comprensibles para los humanos. La opacidad tiene que
ver con el proceso de decisión del algoritmo que depende de reglas que se extraen de su aprendizaje
y la interacción de esas reglas con el conjunto de datos. Aunque los algoritmos se generen sin sesgo
intencional, esto igual puede producirse por la naturaleza de los datos con que son alimentados.
Cuando los algoritmos son usados para apoyar la toma de decisiones deben ser testeados de la
misma manera que un humano en la misma situación. Es responsabilidad de los que emplean el
software asegurarse que el comportamiento es ético y que no hay sesgos aún en forma no
intencional.
2.6 Edición académica (UNISILO, 2019)
Se realizó una encuesta entre julio y setiembre de 2019 sobre el uso de inteligencia artificial en la
edición académica a nivel de la empresa UNSILO que es una compañía de software danesa de
herramientas de IA que se presentó en la feria del Libro de Frankfurt.
De esta encuesta resultó que el análisis textual es uno de los usos más importantes entendido éste
como etiquetado automático, identificación de entidades y generación de metadatos como título o
autor. Las técnicas más usadas son el aprendizaje automático y el procesamiento del lenguaje
natural (PLN).
El uso de taxonomías y ontologías es de interés en la publicación académica y la IA se puede usar
en este campo a través de un conjunto de prueba para expandir el etiquetado de documentos en un
conjunto mayor o con otros sistema que no requieren una taxonomía preexistente (aprendizaje
automático no supervisado) pero tiene una adopción restringida.
Los grandes editores han empezado a usar IA aunque en general la utilización es aún incipiente.
3. Transformaciones en GLAM con AI
El caso de Hamlet que opera en la asistencia o mediación entre el usuario y la búsqueda y
recuperación de información es significativo. Hay otras áreas en las que AI puede intervenir como
la catalogación, la indexación y la elaboración de resúmenes. También en el área de referencia ya se
están utilizando chatbots o servicios de asesoramiento a lectores.
El aprendizaje automático es apropiado para aplicarse en la creación de metadatos en todo tipo de
medios: texto, fotos y video. También se prevé la aplicación de su uso en la determinación de
encabezamientos de materia o categorías.
Al principio los resultados pueden no ser buenos, pero como ocurre en todos los campos de
desarrollo de tecnología, rápidamente éstos van mejorando. En el caso de IA los resultados
mejorarán significativamente a medida que los conjuntos de datos se acrecienten.
La incorporación de IA en los denominados procesos técnicos en la ciencia de la información irá
desplazando el trabajo profesional en estas áreas pero abrirá la incorporación de los profesionales en
otras áreas como la creación del conjunto de datos de entrenamiento, el entrenamiento y la
evaluación del resultado del entrenamiento y su ajuste (Bell, 2016).
Estos cambios alcanzarán otras muchos ámbitos ya que si la IA puede desarrollarse para se puedan
procesar textos, establecer conexiones entre ellos, realizar resúmenes, establecer comunicación en
una conversación en la que resulte indistinguible que el interlocutor es un equipo informático, más
adelante el equipo podrá confeccionar un texto, un reporte de investigación incluso con el estilo de
un investigador.
Actualmente se experimenta con la escritura de noticias y generación de música:
[Link]
[Link]
En 2016 un grupo de museos de Holanda tuvo iniciativas con la creación artística y un cuento corto
escrito por un programa de computadora ganó un premio literario en Japón. Estos asuntos abren un
debate nuevo sobre quien tiene la autoría intelectual de estas obras y aparecerán reclamos de
protección por copyright [Link]
[Link]
En (GOSHINA, DUBROVSKAYA,2019) se plantea el desafío de procesar una colección museística digitalizada y
rescatar las relaciones entre los libros, sus dedicatorias, las personas que realizaban las dedicatorias, las mismas
dedicatorias, entre otros elementos. Se plantea con claridad la falta de una solución técnica para desarrollar la
cohesión semántica de los objetos del museo pertenecientes a departamentos diferentes y los vínculos a fuentes
externas.
Al no disponerse de una búsqueda federada, o un tratamiento de datos semánticos enlazados que
permita navegar los vínculos entre los distintos recursos, se debería realizar la búsqueda en los
distintos sistemas de biblioteca, archivo, museo y fuentes externas y lo que se plantea es una
solución de IA que integre todos los sistemas.
4. Políticas de información en IA en GLAM
Los resultados de IA tiene un vínculo directo con la calidad de los datos y del sesgo que pueda estar
subyacente en ellos. Por otra parte están las limitaciones de los algoritmos que es algo que no hay
que perder de vista. Un modelo matemático no es un indizador humano que discierne la semántica.
Otra cuestión es que la IA es buena en el dominio para la cual ha sido entrenada y mejora con el
entrenamiento y la utilización de una cantidad importante de datos.
Los usuarios de sistemas de IA tienen que tener claras estas limitaciones, los resultados no pueden
ser interpretados como objetivos, completos o totalmente correctos. Los resultados representan una
declaración de probabilidad.
En este sentido dentro de las actividades que se llevan a cabo en las instituciones como bibliotecas,
archivos o museos de formación de usuarios, es necesario extender esta formación a la comprensión
de como deben interpretarse los resultados de IA.
No podemos asegurar que los algoritmos de IA no repliquen o aumenten los sesgos y los prejuicios
( O’Neil, 2016; Gianfrancesco) y actúen influyendo socialmente causando impacto negativo en los
sectores socialmente desfavorecidos y por tanto hay una implicancia ética en la forma en que se usa
IA.
Podemos citar el caso de análisis de sentimientos con algoritmos y lexicones de amplio uso con
resultados de segregación étnica sin un propósito específico.
[Link]
Elon Musk (Musk, 2014) , el CEO de Tesla, opinó que debemos tener cuidado en regular el
desarrollo de la IA porque esta constituye nuestra mayor amenaza existencial.
Las GLAM deberán formar parte de grupos interdisciplinarios que busquen desarrollar iniciativas
que legislen obligaciones legales para forzar a las compañías a asegurarse el impacto de los
algoritmos para realizar decisiones y corregir los errores si se detecta sesgo.
Existe una línea de utilización de IA en la personalización en los equipos móviles y esto acrecentará
los problemas de aislamiento de las personas en sus guetos culturales,lo cual puede tener un
impacto social muy negativo.
(Bourg, 2017) plantea que los profesionales de la información son especialmente adecuados para
lidiar con asuntos como la privacidad, el contexto, la autoridad y el asegurar que los datos de
entrenamiento de IA sean inclusivos, diversos y de alta calidad.
(Padilla, 2019) planea que en la práctica bibliotecaria hay precedentes de actividades de gobernanza
del sesgo, en el desarrollo de colecciones, la descripción de colecciones, el soporte a la
investigación, entre otras y siempre está la preocupación de respetar la diversidad.
Como profesionales de la información debemos involucrarnos en los desarrollos en nuestra área y
participar activamente en ellos para asegurar el acceso a la información, actuar en pos de la
inclusión, la imparcialidad, y todos los valores sociales que estén desfavorecidos.
Las implicancias del uso de IA necesitan ser entendidas y la neutralidad en los datos debe ser
garantizada por lo que se concluye la necesidad de la formulación de una política en IA.
Bibliografia
DUDLEY, M. (2019) Public Libraries and Resilient Cities. Edtion ed.
New York: American Library Association, 2013. ISBN 978- 0-8389-1136-5. Disponible en:
GOSHINA, Ekaterina; DUBROVSKAYA, Juliya (2019) Bringing Library and Museum Resources Together:
How Can Artificial Intelligence Help (based on the Ivan Tsvetaev’s Book Collection Project)?. IFLA WLIC
2019 - Athens, Greece - Libraries: dialogue for change
[Link]
Boman, C. (2019). An Exploration of Machine Learning in [Link] Technology Reports, 55(1), 21.
Turing, Alan (1950). Computing machinery and intelligence. Mind, 59,433-60.
[Link]
For many excellent examples of algorithmic biases,
see Cathy O’Neil, Weapons of Math Destruction: How
Big Data Increases Inequality and Threatens Democ-
racy, 1 edition (New York: Crown, 2016) and Safiya
Umoja Noble, Algorithms of Oppression: How Search
Engines Reinforce Racism (NYU Press, 2018)
Gianfrancesco, M. A., Tamang, S., Yazdany, J., & Schmajuk, G. (2018). Potential biases in machine learning
algorithms using electronic health record data. JAMA internal medicine, 178(11), 1544-1547.
[Link]
Bourg, Chris (2017) What Happens to Libraries and Librarians When Machines Can
Read All the Books?. Feral Librarian (blog),
[Link]
librarians-when-machines-can-read-all-the-books
Musk, Elon (2014) Entrevista en el MIT: Compares Building Artificial Intelligence To “Summoning
The Demon” [Link]
intelligence-to-summoning-the-demon/
Bell, Steven (2016) Promise and Peril of AI for Academic Librarians. [Link]
detailStory=promise-and-peril-of-ai-for-academic-librarians-from-the-bell-tower#_
Young, Jeffrey (2019) Bots in the Library? Colleges Try AI to Help Researchers (But With Caution).
[Link]
with-caution
KB National Library of the Nederlands (2019) Exploration possibilites: automated generation of metadata
[Link]
_metadata_eng_online.pdf
Padilla, Thomas. “Responsible Operations: Data Science, Machine Learning, and AI in
Libraries”. Ohio: OCLC Research, 2019
Thelwall, Mike. Artificial Intelligence, Automation and
Peer Review. London: JISC, 2019
[Link]
UNSILO (2019) AI in Academic Publishing Survey 2019
[Link]
Allison, DeeAnn, "Chatbots in the Library: is it time?" (2011). Faculty Publications, UNL Libraries.
280. [Link]