0% encontró este documento útil (0 votos)
17 vistas32 páginas

Etiquetado Morfosintáctico en PLN

El documento aborda el etiquetado morfosintáctico (POS tagging) dentro del procesamiento del lenguaje natural, destacando su importancia en la identificación de categorías gramaticales. Se exploran métodos como los modelos ocultos de Markov (HMM) y técnicas de aprendizaje automático para realizar este etiquetado. Además, se discuten las características del etiquetado y su funcionamiento, incluyendo ejemplos prácticos de aplicación.

Cargado por

Erica Gonzalez
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
17 vistas32 páginas

Etiquetado Morfosintáctico en PLN

El documento aborda el etiquetado morfosintáctico (POS tagging) dentro del procesamiento del lenguaje natural, destacando su importancia en la identificación de categorías gramaticales. Se exploran métodos como los modelos ocultos de Markov (HMM) y técnicas de aprendizaje automático para realizar este etiquetado. Además, se discuten las características del etiquetado y su funcionamiento, incluyendo ejemplos prácticos de aplicación.

Cargado por

Erica Gonzalez
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Tema 3

Procesamiento del Lenguaje Natural

Etiquetado
morfosintáctico (POS
tagging)
Índice
Esquema 3

Ideas clave 4
3.1. Introducción y objetivos 4
3.2. Categorías morfosintácticas o gramaticales 4
3.3. Funcionamiento y características del etiquetado
morfosintáctico 7
3.4. Etiquetado morfosintáctico basado en modelos
ocultos de Markov (HMM) 10
© Universidad Internacional de La Rioja (UNIR)

3.5. Etiquetado morfosintáctico basado en


aprendizaje automático 22
3.6. Named Entity Recognition 24
3.7. Referencias bibliográficas 25

A fondo 28

Test 29
Esquema
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


3
Tema 3. Esquema
Ideas clave

3.1. Introducción y objetivos

A continuación, se estudiará el etiquetado morfosintáctico y cómo calcularlo,


haciendo hincapié en los modelos ocultos de Markov (Hidden Markov Models).

Objetivos

 Identificar las diferentes categorías morfosintácticas o también llamadas


gramaticales.
 Entender el funcionamiento y las características del etiquetado morfosintáctico.
 Aplicar un método estocástico basado en modelos ocultos de Markov (HMM) para
realizar el etiquetado morfosintáctico.
 Describir diversos métodos basados en aprendizaje automático para realizar el
etiquetado morfosintáctico.

3.2. Categorías morfosintácticas o gramaticales

La Real Academia Española (RAE, s. f.) en su diccionario de la lengua española define


la palabra morfosintaxis como: «1. f. Ling. Parte de la gramática que integra la
morfología y la sintaxis». Tal como se ha presentado en los temas anteriores:
© Universidad Internacional de La Rioja (UNIR)

La morfología estudia la estructura de las palabras y la sintaxis, el modo en


que se combinan las palabras. Por lo tanto, la morfosintaxis aúna la
morfología y la sintaxis para determinar las diferentes partes de la oración,
llamadas part-of-speech (POS) en inglés.

Procesamiento del Lenguaje Natural


4
Tema 3. Ideas clave
Las categorías morfosintácticas del lenguaje, que en español también se llaman
categorías gramaticales, proporcionan una clasificación de las diferentes partes de la
oración, es decir, una clasificación de las palabras según su tipo.

Las categorías gramaticales del español, según la clasificación clásica, son nueve:
sustantivo o nombre, determinante, adjetivo, pronombre, verbo, adverbio,
preposición, conjunción e interjección. Las definiciones de las diferentes clases de
palabras o categorías gramaticales se presentan en la siguiente tabla.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


5
Tema 3. Ideas clave
Tabla 1. Definiciones de las diferentes categorías morfosintácticas. Fuente: elaboración propia adaptado de la
Real Académica Española (RAE).

En el vídeo Morfosintaxis y partes de la oración se presentará qué es la morfosintaxis,


© Universidad Internacional de La Rioja (UNIR)

parte de la gramática que integra la morfología y la sintaxis.

Procesamiento del Lenguaje Natural


6
Tema 3. Ideas clave
Conocer las partes de la oración (categorías morfosintácticas o gramaticales) es útil
debido a la gran cantidad de información que brindan sobre una palabra y sus
vecinos.

 Saber si una palabra es un sustantivo o un verbo nos dice mucho acerca de las
palabras vecinas, por ejemplo, los sustantivos pueden ir precedidos de
determinantes o seguidos de adjetivos.
 Y también sobre la estructura sintáctica, por ejemplo, los sustantivos son
generalmente parte de los sintagmas nominales.

Por estas razones, el etiquetado morfosintáctico es un componente muy


importante del análisis sintáctico que se va a estudiar a continuación.

3.3. Funcionamiento y características del


etiquetado morfosintáctico

El etiquetado morfosintáctico, llamado POS tagging (part-of-speech tagging) en


inglés, es el proceso para identificar las diferentes partes de la oración y consiste en
asignar una etiqueta (tag) sobre la categoría gramatical a cada una de las palabras
de un texto de entrada.

La entrada del algoritmo de etiquetado morfosintáctico es una secuencia de palabras


y la salida del algoritmo es una secuencia de pares formados por la palabra y la
correspondiente etiqueta indicando la categoría gramatical a la que pertenece dicha
palabra. Ante esto:
© Universidad Internacional de La Rioja (UNIR)

 Existen diferentes conjuntos de etiquetas que se pueden utilizar en el análisis


morfosintáctico.

Procesamiento del Lenguaje Natural


7
Tema 3. Ideas clave
 Algunos etiquetadores morfosintácticos permiten indicar a su entrada el conjunto
de etiquetas que:
• Identifican cada categoría gramatical.
• Se van a utilizar en el proceso de etiquetado de cada parte de la oración.

Hoy en día, la mayoría de los algoritmos de procesamiento del lenguaje natural que
procesan palabras en inglés utilizan el Penn Treebank (Marcus, Santorini y
Marcinkiewicz, 1993).

El Penn Treebank es un conjunto de 45 etiquetas que identifican las diferentes partes


de la oración, tal como se muestra en la siguiente imagen.
© Universidad Internacional de La Rioja (UNIR)

Figura 1. Etiquetas para las categorías gramaticales en el Penn Treebank. Fuente: Jurafsky y Martin, 2009.

En el etiquetado morfosintáctico se identifican las diferentes partes de la oración y


se asigna una etiqueta a cada una de las palabras, tal y como se ha comentado
anteriormente.

Procesamiento del Lenguaje Natural


8
Tema 3. Ideas clave
La forma más habitual para representar la salida del etiquetador
morfosintáctico es colocar, después de cada palabra, la etiqueta para la
categoría gramatical separada por una barra.

Por ejemplo, si el etiquetador morfosintáctico analiza la frase:

 Bebo un vaso del vino tinto.

Suponiendo que se utilizan las etiquetas para las categorías gramaticales definidas en
el Penn Treebank, la salida sería:

bebo/VBP un/DT vaso/NN de/IN el/DT vino/NN tinto/JJ

Para la frase:

 Vino de un lugar lejano.

El etiquetado morfosintáctico sería:

vino/VBZ de/IN un/DT lugar/NN lejano/JJ

En estos dos ejemplos de etiquetado morfosintáctico se observa que la misma


palabra «vino» se etiqueta de forma distinta para las dos frases.

En el primer ejemplo, la palabra «vino» pertenece a la categoría gramatical de los


sustantivos o nombres (NN). Mientras que, en el segundo ejemplo, pertenece a la
© Universidad Internacional de La Rioja (UNIR)

categoría gramatical de los verbos (VBZ).

Procesamiento del Lenguaje Natural


9
Tema 3. Ideas clave
Así, el etiquetado morfosintáctico realiza durante su funcionamiento un
proceso de desambiguación: una palabra, que es ambigua y puede pertenecer
a más de una categoría gramatical, se etiqueta correctamente según el
contexto de la frase analizada.

Además, es importante notar que el algoritmo que realiza el etiquetado


morfosintáctico ha separado la palabra «del» (que aparece en la frase «bebo un vaso
del vino tinto») en las palabras de y el antes de etiquetarlas respectivamente como
una preposición (IN) y un determinante (DT).

Identificar que una palabra es una contracción y separarla en las dos que la
constituyen forma parte del proceso previo de preprocesado de la oración, que
permite separar la frase en las diferentes palabras.

La identificación de las palabras de una oración también es llamada proceso


de obtención de los tokens, porque token es el nombre inglés para definir una
cadena de caracteres que representa una palabra y se realiza siempre
previamente al etiquetado morfosintáctico y a otras tareas de procesamiento
del lenguaje natural.

3.4. Etiquetado morfosintáctico basado en


modelos ocultos de Markov (HMM)

Una de las técnicas más utilizadas en el etiquetado morfosintáctico es los modelos


ocultos de Markov o HMM (por sus siglas del inglés, Hidden Markov Model). Esta
© Universidad Internacional de La Rioja (UNIR)

técnica consiste en construir un modelo de lenguaje estadístico que se utiliza para


obtener, a partir de una frase de entrada, la secuencia de etiquetas gramaticales que
tiene mayor probabilidad.

Procesamiento del Lenguaje Natural


10
Tema 3. Ideas clave
Un modelo oculto de Markov es un modelo estadístico que se puede
representar como una máquina de estados finitos, pero donde las
transacciones entre estados son probabilísticas y no determinísticas. El
objetivo es determinar los parámetros desconocidos (ocultos) a partir de los
parámetros observables.

Por ejemplo, si hemos etiquetado una palabra como determinante, la próxima


palabra será un nombre con un 40 % de probabilidad, un adjetivo con otro 40 % y un
número el 20 % restante. Conociendo esta información, un sistema puede decidir que
la palabra «vino» en la frase «el vino» es más probable que sea un nombre a que sea
un verbo.

Para el etiquetado morfosintáctico, los HMM son entrenados en un conjunto de


datos totalmente etiquetados. Esto es un conjunto de frases con cada palabra
anotada con una etiqueta describiendo su categoría gramatical. A partir de los datos
de entrenamiento, los HMM fijan estimaciones de máxima verosimilitud para cada
uno de los estados y determina las diferentes probabilidades que rigen el modelo.

Para llevar a cabo el proceso de estimación de probabilidades se usa el algoritmo de


decodificación de Viterbi (Forney, 1973).

El objetivo de decodificación HMM es elegir la secuencia de etiquetas más probable


dada la secuencia de observación 𝑛𝑛 palabras 𝑤𝑤1𝑛𝑛 :

𝑡𝑡1̂ 𝑛𝑛 = argmax 𝑃𝑃(𝑡𝑡1𝑛𝑛 |𝑤𝑤1𝑛𝑛 )


𝑡𝑡1𝑛𝑛

Esta ecuación la podemos reescribir mediante el uso de la regla de Bayes de la


© Universidad Internacional de La Rioja (UNIR)

siguiente forma:

𝑃𝑃(𝑤𝑤1𝑛𝑛 |𝑡𝑡1𝑛𝑛 )𝑃𝑃(𝑡𝑡1𝑛𝑛 )


𝑡𝑡1̂ 𝑛𝑛 = argmax
𝑡𝑡1𝑛𝑛 𝑃𝑃(𝑤𝑤1𝑛𝑛 )

Procesamiento del Lenguaje Natural


11
Tema 3. Ideas clave
También podemos simplificar esta ecuación eliminando el denominador 𝑃𝑃(𝑤𝑤1𝑛𝑛 ):

𝑡𝑡1̂ 𝑛𝑛 = argmax 𝑃𝑃(𝑤𝑤1𝑛𝑛 |𝑡𝑡1𝑛𝑛 )𝑃𝑃(𝑡𝑡1𝑛𝑛 )


𝑡𝑡1𝑛𝑛

Los etiquetadores HMM hacen dos suposiciones que permiten simplificar estas
ecuaciones aún más:

1. La primera es que la probabilidad de aparición de una palabra depende solo de su


propia etiqueta y es independiente de las palabras y etiquetas vecinas:
𝑛𝑛

𝑃𝑃(𝑤𝑤1𝑛𝑛 |𝑡𝑡1𝑛𝑛 ) ≈ � 𝑃𝑃(𝑤𝑤𝑖𝑖𝑛𝑛 |𝑡𝑡𝑖𝑖𝑛𝑛 )


𝑖𝑖=1

2. La segunda suposición, también llamada bigrama o digrama, es que la


probabilidad de una etiqueta solo depende de la etiqueta anterior, en lugar de
toda la secuencia de etiquetas:
𝑛𝑛

𝑃𝑃𝑡𝑡𝑖𝑖𝑛𝑛 ≈ � 𝑃𝑃(𝑡𝑡𝑖𝑖 |𝑡𝑡𝑖𝑖−1 )


𝑖𝑖=1

Aplicando estas suposiciones a las ecuaciones anteriores terminamos con la siguiente


ecuación para la secuencia de etiquetas más probable de un etiquetador bigrama, las
cuales corresponden a la probabilidad de emisión y la probabilidad de transición de
un HMM:

𝑛𝑛
𝒆𝒆𝒆𝒆𝒆𝒆𝒆𝒆𝒔𝒔𝒊𝒊𝒊𝒊𝒊𝒊 𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕𝒕
𝑡𝑡1̂ 𝑛𝑛 = argmax 𝑃𝑃(𝑡𝑡1𝑛𝑛 |𝑤𝑤1𝑛𝑛 ) ≈ argmax � �� ���
𝑃𝑃(𝑤𝑤 𝑛𝑛 �� 𝑛𝑛 �� �����
𝑖𝑖 |𝑡𝑡𝑖𝑖 ) 𝑃𝑃(𝑡𝑡𝑖𝑖 |𝑡𝑡𝑖𝑖−1 )
𝑡𝑡1𝑛𝑛 𝑛𝑛
𝑡𝑡1
𝑖𝑖=1

Ejemplos de probabilidad de transición y probabilidad de emisión


© Universidad Internacional de La Rioja (UNIR)

Veamos a través de un ejemplo cómo se calculan y se utilizan en una tarea de


etiquetado estas probabilidades. En el etiquetado HMM, las probabilidades se
estiman simplemente a partir de un corpus de entrenamiento etiquetado; para este
ejemplo vamos a utilizar el corpus etiquetado WSJ, una colección de un millón de

Procesamiento del Lenguaje Natural


12
Tema 3. Ideas clave
palabras que se publicaron en los artículos del Wall Street Journal (WSJ) en 1989 y
que están anotadas utilizando las etiquetas morfosintácticas del Penn Treebank.

Un corpus lingüístico es una colección de textos representativos de una


lengua que se utilizan para el análisis lingüístico. Los corpus pueden estar
anotados o etiquetados de forma que las palabras que lo conforman
presentan, además, algún tipo de información lingüística.

Accede al corpus a través del aula virtual o desde la siguiente dirección web:
[Link]

Probabilidades de transición

Las probabilidades de transición de etiqueta 𝑃𝑃(𝑡𝑡𝑖𝑖 |𝑡𝑡𝑖𝑖−1 ) representan la probabilidad


de una etiqueta dada la etiqueta anterior. Por ejemplo, los verbos modales (etiqueta
MD) como «can» (poder) son muy probablemente seguidos por un verbo en la forma
base (etiqueta VB) como «run» (correr), por lo que espera que esta probabilidad sea
alta.

La estimación de máxima verosimilitud de una probabilidad de transición se calcula


por recuento de las veces que vemos la primera etiqueta en un corpus etiquetado y
la frecuencia con que esta primera etiqueta es seguida por la segunda según la
siguiente fórmula:

𝐶𝐶(𝑡𝑡𝑖𝑖−1 , 𝑡𝑡𝑖𝑖 )
𝑃𝑃(𝑡𝑡𝑖𝑖 |𝑡𝑡𝑖𝑖−1 ) =
𝐶𝐶(𝑡𝑡𝑖𝑖−1 )
© Universidad Internacional de La Rioja (UNIR)

En el corpus WSJ, por ejemplo, los MD aparecen 13 124 veces, de las cuales son
seguidos por un VB 10 471 veces, lo cual resulta en una estimación de máxima
probabilidad de:

Procesamiento del Lenguaje Natural


13
Tema 3. Ideas clave
𝐶𝐶(𝑀𝑀𝑀𝑀, 𝑉𝑉𝑉𝑉) 10471
𝑃𝑃(𝑉𝑉𝑉𝑉|𝑀𝑀𝑀𝑀) = = = .80
𝐶𝐶(𝑀𝑀𝑀𝑀) 13124

Probabilidades de emisión

Las probabilidades de emisión 𝑃𝑃(𝑤𝑤1𝑛𝑛 |𝑡𝑡1𝑛𝑛 ) representan la probabilidad de que, dada


una etiqueta (digamos MD), esta se asocie con una palabra concreta (digamos «will»).
La estimación de máxima verosimilitud de la probabilidad de emisión en general se
define como:

𝐶𝐶(𝑡𝑡𝑖𝑖 , 𝑤𝑤𝑖𝑖 )
𝑃𝑃(𝑤𝑤𝑖𝑖 |𝑡𝑡𝑖𝑖 ) =
𝐶𝐶(𝑡𝑡𝑖𝑖 )

De los 13 124 casos de MD en el corpus WSJ, estas se asocian o refieren a «will» en


4046 ocasiones, por tanto:

𝐶𝐶(𝑀𝑀𝑀𝑀, 𝑤𝑤𝑤𝑤𝑤𝑤𝑤𝑤) 4046


𝑃𝑃(𝑤𝑤𝑤𝑤𝑤𝑤𝑤𝑤|𝑀𝑀𝑀𝑀) = = = .31
𝐶𝐶(𝑀𝑀𝑀𝑀) 13124

Como aclaración, hemos de decir que esta probabilidad no se refiere a cuál es la


etiqueta más probable para la palabra «will», ya que esta sería la probabilidad a
posteriori 𝑃𝑃(𝑀𝑀𝑀𝑀|𝑤𝑤𝑤𝑤𝑤𝑤𝑤𝑤). En su lugar, 𝑃𝑃(𝑤𝑤𝑤𝑤𝑤𝑤𝑤𝑤|𝑀𝑀𝑀𝑀) responde a una pregunta
ligeramente menos intuitiva, concretamente si vamos a generar una etiqueta MD,
¿qué probabilidades hay de que este MD sea «will»?

Los dos tipos de probabilidades mencionados anteriormente, la probabilidad de


transición 𝑃𝑃(𝑉𝑉𝑉𝑉|𝑀𝑀𝑀𝑀) y la probabilidad de emisión 𝑃𝑃(𝑤𝑤𝑤𝑤𝑤𝑤𝑤𝑤|𝑀𝑀𝑀𝑀), se corresponden al
conjunto A de probabilidades de transición del HMM y al conjunto B de
© Universidad Internacional de La Rioja (UNIR)

probabilidades de observación B del HMM.

La Figura 2 ilustra algunas de las probabilidades de transición A para tres estados en


un etiquetador morfosintáctico HMM; el etiquetador completo tendría un estado

Procesamiento del Lenguaje Natural


14
Tema 3. Ideas clave
para cada etiqueta. En esta imagen, las probabilidades de transición A se utilizan para
calcular la probabilidad a priori.

Figura 2. Cadena de Markov correspondiente a los estados ocultos del HMM. Fuente: Jurafsky y Martin, 2009.

La Figura 3 muestra otra vista de estos tres estados, pero centrándose en algunas de
las probabilidades de observación B de cada palabra. Cada estado oculto está
asociado con un vector de probabilidades para cada palabra en observación.
© Universidad Internacional de La Rioja (UNIR)

Figura 3. Probabilidades de observación B para el HMM de la Figura 2. Fuente: Jurafsky y Maritn, 2009.

Procesamiento del Lenguaje Natural


15
Tema 3. Ideas clave
Como indicábamos sobre esta última imagen, cada estado está asociado con un
vector de probabilidades con una probabilidad para cada posible palabra en
observación, a excepción de los estados no emisores de inicio y fin.

En el vídeo Construcción de un etiquetador morfosintáctico basado en un HMM


bigrama a partir de un corpus etiquetado se explicará cómo crear un etiquetador
morfosintáctico a partir de un corpus etiquetado.

Finalmente, vamos a trabajar a través de un ejemplo de cálculo de la mejor secuencia


de etiquetas que corresponde a la siguiente secuencia de palabras:

 Janet will back the Bill (en español, «Janet respaldará la ley»).

La secuencia de etiquetas correcta es:

Janet/NNP will/MD back/VB the/DT bill/NN

Sea el modelo HMM el definido por el conjunto A de probabilidades de transición


(Figura 4), y el conjunto B de probabilidades de observación (Figura 5). Cada elemento
𝑎𝑎𝑖𝑖𝑖𝑖 del conjunto A describe la probabilidad de transitar de un estado oculto 𝑖𝑖
(etiqueta 𝑖𝑖) a otro estado oculto 𝑗𝑗 (etiqueta 𝑗𝑗). Cada elemento 𝑏𝑏𝑖𝑖 (𝑜𝑜𝑡𝑡 ) describe la
probabilidad de observar las palabras dadas las etiquetas.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


16
Tema 3. Ideas clave
Figura 4. Conjunto A de probabilidades de transición 𝑃𝑃(𝑡𝑡𝑖𝑖 |𝑡𝑡𝑖𝑖−1 ) calculadas a partir del corpus WSJ. Fuente:
Jurafsky y Martin, 2009.

En la imagen anterior vemos que cada fila representa el evento condicionante; por
ejemplo:

𝑃𝑃(𝑉𝑉𝑉𝑉|𝑀𝑀𝑀𝑀) = 0.7968.

La siguiente imagen (Figura 5) se obtiene a partir del recuento de apariciones de una


palabra en el corpus. Así:

 La palabra «Janet» solo aparece como un nombre propio (NNP).


 La palabra «will» aparece en el corpus como tres categorías gramaticales
diferentes, puede ser:
• Un verbo modal (MD) para generar el futuro de los verbos en inglés.
• Un verbo (VB) que significa «desear» en español.
• O un nombre (NN) que significa «deseo» o «voluntad» en español.
© Universidad Internacional de La Rioja (UNIR)

Figura 5. Conjunto B de probabilidades de observación calculadas a partir del corpus WSJ. Fuente: Jurafsky y
Martin, 2009.

Procesamiento del Lenguaje Natural


17
Tema 3. Ideas clave
La Figura 6 muestra un esquema con las posibles etiquetas para el ejemplo anterior,
así como la correcta secuencia de etiquetado final. Esta secuencia del etiquetado
morfosintáctico se ha calculado aplicando el algoritmo de Viterbi, cuyo
pseudocódigo se presenta en la Figura 7.

Figura 6. Diagrama de la tarea de etiquetado para la frase ejemplo. Fuente: Jurafsky y Martin, 2009.

Figura 7. Pseudocódigo del algoritmo de Viterbi para encontrar la secuencia óptima de tags en un etiquetador
© Universidad Internacional de La Rioja (UNIR)

morfosintáctico basado en HMM. Fuente: Jurafsky y Martin, 2009.

El algoritmo de Viterbi crea una matriz de probabilidades con una columna para cada
observación 𝑡𝑡 y una fila para cada estado 𝑞𝑞𝑖𝑖 de la máquina de estados finitos (o
autómata finito) que representa el HMM. Para el ejemplo, el algoritmo crea N = 5

Procesamiento del Lenguaje Natural


18
Tema 3. Ideas clave
columnas de estado, la primera para la observación de la primera palabra «Janet», la
segunda para «will» y así sucesivamente hasta completar las cinco palabras que
conforman la frase, tal como se muestra en la Figura 8.

Se empieza en la primera columna para establecer el valor de Viterbi en cada celda


𝑣𝑣𝑡𝑡 (𝑖𝑖), que se calcula como el producto de la probabilidad de transición (hasta ese
estado desde el estado inicial) por la probabilidad de observación (de la primera
palabra). Entonces, se avanza columna a columna y, para cada estado en la columna
1, se calcula la probabilidad de transición a cada estado en la columna 2, y así
sucesivamente.

Para cada estado 𝑞𝑞𝑖𝑖 en el tiempo 𝑡𝑡, se calcula valor de Viterbi (representado como
viterbi[s,t] en el pseudocódigo de la Figura 7) tomando el máximo sobre las
extensiones de todas las rutas que conducen a la celda actual, según la siguiente
ecuación:

𝑁𝑁
𝑣𝑣𝑡𝑡 (𝑗𝑗) = 𝑣𝑣 (𝑖𝑖) 𝑎𝑎𝑖𝑖𝑖𝑖 𝑏𝑏𝑗𝑗 (𝑜𝑜𝑡𝑡 )
max 𝑡𝑡−1
𝑖𝑖=1

Donde:

 𝑣𝑣𝑡𝑡−1 (𝑖𝑖) es la probabilidad de la ruta de Viterbi previa, es decir, la ruta para el


tiempo anterior o en la observación 𝑡𝑡 − 1.
 𝑎𝑎𝑖𝑖𝑖𝑖 es la probabilidad de transición del estado anterior 𝑞𝑞𝑖𝑖 al estado actual 𝑞𝑞𝑗𝑗 .
 𝑏𝑏𝑗𝑗 (𝑜𝑜𝑡𝑡 ) es la probabilidad de observación del símbolo 𝑜𝑜𝑡𝑡 dado el estado actual 𝑞𝑞𝑗𝑗 .

Entonces, cada celda de la primera columna donde aparece la palabra «Janet» se


© Universidad Internacional de La Rioja (UNIR)

calcula multiplicando la probabilidad de Viterbi previa en el estado de inicio 𝑞𝑞0 , que


es 𝑣𝑣0 (0) = 1.0 por la probabilidad de transición desde el estado de inicio 𝑞𝑞0 hasta
la etiqueta para esa celda, por ejemplo:

𝑃𝑃(𝑁𝑁𝑁𝑁𝑁𝑁|𝑠𝑠𝑠𝑠𝑠𝑠𝑠𝑠𝑠𝑠) = 0.2767 para la celda en la que la etiqueta es NNP.

Procesamiento del Lenguaje Natural


19
Tema 3. Ideas clave
Y por la probabilidad de observación de la palabra «Janet» dada la etiqueta de esa
celda, por ejemplo:

𝑃𝑃(𝐽𝐽𝐽𝐽𝐽𝐽𝐽𝐽𝐽𝐽|𝑁𝑁𝑁𝑁𝑁𝑁) = 0.000032 para la celda en la que la etiqueta es NNP.

Por lo tanto:

 𝑣𝑣1 (1) = 1.0 · 0.2767 · 0.000032 = 0.000009 para la celda en la que la


etiqueta es NNP para la columna donde la palabra es «Janet».
 El resto de las celdas en esta columna son cero, ya que la palabra «Janet» no puede
tener asociada ninguna de las otras etiquetas gramaticales.

A continuación, cada celda en la columna «will» se actualiza con la ruta de


probabilidad máxima desde la columna anterior. En la Figura 8 se muestran los
valores para las celdas MD, VB y NN. Cada celda obtiene los siete valores de la
columna anterior multiplicados por la probabilidad de transición apropiada; se toma
el valor máximo, 𝑣𝑣1 (1) · 𝑃𝑃(𝑀𝑀𝑀𝑀|𝑁𝑁𝑁𝑁𝑁𝑁), que proviene del estado NNP en la columna
anterior y este valor se multiplica por la probabilidad de observación del símbolo
«will» dada la etiqueta correspondiente a la celda en cuestión. Por ejemplo, para la
celda MD el valor de Viterbi es:

𝑣𝑣2 (2) = 𝑣𝑣1 (1) · 𝑃𝑃(𝑀𝑀𝑀𝑀|𝑁𝑁𝑁𝑁𝑁𝑁) · 𝑃𝑃(𝑤𝑤𝑤𝑤𝑤𝑤𝑤𝑤|𝑀𝑀𝑀𝑀) = 0.00000002772

Se continúa aplicando el algoritmo columna a columna hasta llegar al final.

En el vídeo Creación de la matriz de probabilidades de la ruta de Viterbi se verá cómo


realizar la matriz de Viterbi para llevar a cabo el etiquetado morfosintáctico de una
© Universidad Internacional de La Rioja (UNIR)

oración.

Procesamiento del Lenguaje Natural


20
Tema 3. Ideas clave
Para la probabilidad máxima de Viterbi, se traza la inversa para obtener la ruta
concreta que ha llevado a ese valor y que se corresponde con la mejor secuencia de
etiquetas: NNP MD VB DT NN.

Entonces, esta secuencia de etiquetas se corresponde con el etiquetado


morfosintáctico de la frase:

Janet/NNP will/MD back/VB the/DT bill/NN

En el vídeo Obtención de la ruta de Viterbi con máxima probabilidad se verá cómo


obtener la ruta de Viterbi, lo que significa que cuando apliquemos el logaritmo
seamos capaces de decodificar y obtener la ruta más probable que nos dé el mejor
etiquetado morfosintáctico de una oración.
© Universidad Internacional de La Rioja (UNIR)

Figura 8. Matriz para la aplicación del algoritmo de Viterbi en el etiquetado morfosintáctico de la frase «Janet
will back the bill». Fuente: Jurafsky y Martin, 2009

Procesamiento del Lenguaje Natural


21
Tema 3. Ideas clave
3.5. Etiquetado morfosintáctico basado en
aprendizaje automático

Los modelos más vanguardistas de etiquetado morfosintáctico utilizan diversas


técnicas de aprendizaje automático tanto supervisado como no supervisado.
Ejemplos de modelos supervisados son, entre otros:

 El algoritmo perceptrón (Collins, 2002).


 El modelo logaritmo lineal bidireccional (Toutanova, Klein, Manning y Singer,
2003).
 Las máquinas de vectores soporte (Giménez y Márquez, 2004).

En estos casos de aprendizaje supervisado, el modelo recibe como entrada una serie
de parámetros extraídos del texto, y tiene como salida la predicción del POS tag de
una palabra en concreto. A modo de ejemplo, en (Giménez y Márquez, 2004) se
propone el uso de las siguientes variables de entrada:
© Universidad Internacional de La Rioja (UNIR)

Figura 9. Variables de entrada para predecir los POS tags con un modelo de aprendizaje supervisado. Fuente:
Giménez y Márquez, 2004.

Procesamiento del Lenguaje Natural


22
Tema 3. Ideas clave
Como se puede ver, se generan variables de entrada que hacen referencia tanto a la
palabra en sí sobre la que se quiere predecir el POS tag, como a palabras de su
contexto, tanto previas o posteriores. Se incluyen también variables que hacen
referencia a los posibles POS tags que tiene la palabra en cuestión y las palabras
previas o posteriores.

No obstante, tanto estos como los algoritmos presentados en el tema


dependen en gran medida del dominio de datos de entrenamiento, así como
el etiquetado marcado por los expertos.

Algunos trabajos recientes en etiquetado morfosintáctico se centran en buscar


alternativas que permitan relajar estas condiciones, es el caso de los algoritmos no
supervisados que etiquetan clústers de palabras en clases morfosintácticas
(Christodoulopoulos, Goldwater, y Steedman, 2010) (Sirts, Eisenstein, Elsner, y
Goldwater, 2014).

Muchos algoritmos se basan en la combinación de datos etiquetados con datos no


etiquetados, por ejemplo, usando coentrenamiento (Søgaard, 2010). La asignación
de etiquetas a texto de muy distintos tipos como, por ejemplo, aquellos provenientes
de Twitter, puede requerir la adición de nuevas etiquetas para las direcciones URL
(URL), nombre de usuario menciona (USR), retweets (RT), y hashtags (HT). La
normalización de las palabras no estándar y técnicas bootstrapping para emplear
datos no supervisados (Derczynski et al., 2013).

En estos ejemplos se lleva a cabo un etiquetado por clasificación, donde el objetivo


es, dada una secuencia, predecir una a una las etiquetas de sus palabras,
considerando información de la propia palabra y del contexto. Esto se refleja en la
© Universidad Internacional de La Rioja (UNIR)

siguiente ecuación, donde f() es la función que relaciona las variables de entrada para
una determinada palabra con la salida predicha con la estructura (token, POS tag):

f(w = they can fish, m = 2) = (can, V)

Procesamiento del Lenguaje Natural


23
Tema 3. Ideas clave
Finalmente, además de estos modelos de aprendizaje automático, existen otros
algoritmos estadísticos muy populares para tareas de POS tagging, como es el caso
del algoritmo Conditional Random Field (CRF) (Lafferty, 2001). También existen
métodos basados en la generación de reglas, como es el caso del algoritmo de Brill
para POS tagging (Brill, 1992).

3.6. Named Entity Recognition

Además de poder obtener el POS Tag de una palabra mediante el uso de algoritmos
estadísticos o técnicas de aprendizaje automático, también es posible identificar de
entre los distintos sustantivos a qué tipo de entidad nombrada hace referencia (a una
persona, a una organización o a una ubicación, por ejemplo).

Esta tarea se denomina NER (named-entity recognition), y con ella se suelen


identificar dentro de un texto categorías como las siguientes (a modo de ejemplo, ya
que se pueden usar más categorías):

 PER: categoría de personas, como por ejemplo el nombre de alguien (ej.: Frodo
Baggins)
 GPE: categoría para identificar países, ciudades o estados (ej.: Madrid).
 LOC: categoría para identificar ubicaciones concretas (ej.: Vesubio).
 ORG: categoría para identificar organizaciones o empresas (ej.: Microsoft).
 MONEY: categoría para identificar referencias a dinero (ej.: $ 5).
 DATE: categoría para identificar fechas (ej.: 05/02/2021 o «jueves»).
© Universidad Internacional de La Rioja (UNIR)

De esta manera, una frase en la que se ha llevado a cabo un NER daría como
resultado:

[PER Miguel López], de [ORG Microsoft], ha ido a una conferencia a [GPE Londres].

Procesamiento del Lenguaje Natural


24
Tema 3. Ideas clave
Existen distintas maneras de representar las NE (named entity) dentro de una frase,
donde aparecen representaciones para, incluso, diferenciar qué token representa el
comienzo de una NE, cuáles están en medio y cuáles están al final para casos en los
que varios tokens estén asociados a una misma NE.

Figura 10. Distintas representaciones de las NE. Fuente: Jurafksy y Martin, 2009.

De igual manera que ocurre con los algoritmos de POS tagging, la identificación de
las NER se puede realizar:

 Con diccionarios donde se tengan ya identificadas palabras (o combinaciones de


palabras) junto con su NE.
 Con sistemas basados en reglas que identifiquen las NE en base a ciertos patrones.
 Con modelos estadísticos o de aprendizaje automático, que en base a un
entrenamiento previo y a una serie de variables que modelen el contexto de las
palabras, puedan predecir qué token o tokens hacen referencia a una NER.

3.7. Referencias bibliográficas


© Universidad Internacional de La Rioja (UNIR)

Brill, E. (1992). A simple rule-based part of speech tagger. PENNSYLVANIA UNIV


PHILADELPHIA DEPT OF COMPUTER AND INFORMATION SCIENCE.

Procesamiento del Lenguaje Natural


25
Tema 3. Ideas clave
Christodoulopoulos, C., Goldwater, S. y Steedman, M. (2010). Two decades of
unsupervised POS induction: How far have we come? En Proceedings of the 2010
Conference on Empirical Methods in Natural Language Processing (EMNLP) (pp. 575-
584). Association for Computational Linguistics.

Collins, M. (2002). Discriminative training methods for hidden markov models:


Theory and experiments with perceptron algorithms. En Proceedings of the
Conference on Empirical Methods in Natural Language Processing (EMNLP) (pp. 1-8).
Association for Computational Linguistics.

Derczynski, L., Ritter, A., Clark, S. y Bontcheva, K. (2013). Twitter part-of-speech


tagging for all: Overcoming sparse and noisy data. En Proceedings of Recent Advances
in Natural Language Processing (pp. 198-206). Association for Computational
Linguistics.

Eisenstein, J. (2019). Introduction to Natural Language Processing (pp. 145-148). MIT


Press Ltd.

Forney, G. D. (1973). The viterbi algorithm. Proceedings of the IEEE, 61(3), 268-278.

Giménez, J. y Márquez, L. (2004). SVMTool: A general POS tagger generator based on


Support Vector Machines. En Proceedings of the 4th International Conference on
Language Resources and Evaluation. LREC.

Jurafsky, D. y Martin, J. H. (2009). Speech and Language Processing: An Introduction


to Natural Language Processing, Speech Recognition and Computational Linguistics.
Prentice-Hall.
© Universidad Internacional de La Rioja (UNIR)

Marcus, M. P., Santorini, B. y Marcinkiewicz, M. A. (1993). Building a large annotated


corpus of English: The Penn treebank. Computational Linguistics, 19(2), 313-330.

Procesamiento del Lenguaje Natural


26
Tema 3. Ideas clave
Lafferty, J., McCallum, A., and Pereira, F. (2001). Conditional random fields:
Probabilistic models for segmenting and labeling sequence data. En Proceedings of
the Eighteenth International Conference on Machine Learning, pages 282–289

RAE. (s. f.). Morfosintaxis. En Diccionario de la lengua española (actualización de la


23ª ed.). [Link]

Sirts, K., Eisenstein, J., Elsner, M., y Goldwater, S. (2014). POS induction with
distributional and morphological information using a distance-dependent Chinese
restaurant process. En Proceedings of the 52nd Annual Meeting of the Association for
Computational Linguistics (pp. 265-271). Baltimore, Estados Unidos.
[Link]

Søgaard, A. (2010). Simple semi-supervised training of part-of-speech taggers. En


Proceedings of the ACL 2010 Conference Short Papers (pp. 205-208). Uppsala, Suecia:
Association for Computational Linguistics.

Toutanova, K., Klein, D., Manning, C. D. y Singer, Y. (2003). Feature-rich part-of-


speech tagging with a cyclic dependency network. En Proceedings of HLT-NAACL (pp.
173-180). Association for Computational Linguistics.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


27
Tema 3. Ideas clave
A fondo
Etiquetado morfosintáctico basado en aprendizaje no supervisado

Christodoulopoulos, C., Goldwater, S. y Steedman, M. (2010). Two decades of


unsupervised POS induction: How far have we come? En Proceedings of the 2010
Conference on Empirical Methods in Natural Language Processing (EMNLP) (pp. 575-
584). Association for Computational Linguistics.
[Link]

El artículo presenta la evaluación de siete algoritmos que realizan el etiquetado


morfosintáctico basándose en técnicas de aprendizaje no supervisado.
Sorprendentemente, se muestra que los primeros algoritmos que aparecieron hace
ya más de veinticinco años proporcionan mejores resultados que otros más recientes.

Analizador morfológico automático de la Biblioteca Virtual Miguel de Cervantes

Analizador morfológico automático. [Link]


sintactico-automatico

Esta aplicación de la Biblioteca Virtual Miguel de Cervantes permite introducir un


texto en español y realizar el análisis morfosintáctico de forma automática, por lo que
se logra identificar la categoría gramatical de cada palabra.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


28
Tema 3. A fondo
Test
1. Indica las afirmaciones correctas sobre la morfosintaxis:
A. Determina las diferentes partes de la oración.
B. Estudia la estructura de las palabras.
C. Parte de la gramática que aúna la morfología y la sintaxis.
D. Estudia el modo en que se combinan las palabras.

2. La clasificación de las diferentes palabras según su tipo o clase se conocen como:


A. Categorías morfosintácticas.
B. Categorías gramaticales.
C. Partes de la oración.
D. Part-of-speech (POS) en inglés.

3. Indica las afirmaciones correctas sobre el etiquetado morfosintáctico:


A. Su salida es la secuencia de etiquetas de las categorías gramaticales.
B. Se llama POS tagging (part-of-speech tagging en ingles).
C. Asigna etiquetas sobre la categoría gramatical a cada una de las palabras de
la oración.
D. Su entrada solo es una secuencia de palabras.

4. Indica las afirmaciones correctas sobre el Penn Treebank:


A. Se utiliza en el etiquetado morfosintáctico en inglés.
B. Consiste en un conjunto de etiquetas gramaticales.
C. Etiqueta los signos de puntuación de la frase.
D. Etiqueta todos los verbos con una misma etiqueta.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


29
Tema 3. Test
5. Indica las afirmaciones correctas sobre el algoritmo implementado por un
etiquetador morfosintáctico:
A. No se ve afectado por problemas de ambigüedad gramatical de las palabras.
B. Aplica un proceso de desambiguación.
C. Etiqueta directamente la oración sin realizar ningún procesado previo.
D. Aplica un proceso de obtención de tokens.

6. Indica las afirmaciones correctas sobre un modelo oculto de Markov (HMM):


A. Es una máquina de estados finitos.
B. Es un modelo estadístico.
C. Su objetivo es determinar parámetros desconocidos a partir de parámetros
observables.
D. Es un autómata finito donde las transacciones entre estados son
probabilísticas.

7. Indica las afirmaciones correctas sobre un etiquetador morfosintáctico basado en


HMM:
A. Modelo de lenguaje estadístico que permite obtener la secuencia de
etiquetas gramaticales que tenga mayor probabilidad para una frase.
B. Se entrena con un conjunto de frases en la que cada palabra está anotada
con una etiqueta describiendo su categoría gramatical.
C. Se fijan las estimaciones de máxima probabilidad para cada una de las
condiciones de la máquina de estados finitos a partir de los datos de
entrenamiento.
D. Se usa el algoritmo de decodificación de Viterbi para estimar las
probabilidades.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


30
Tema 3. Test
8. Indica las afirmaciones correctas sobre la probabilidad de transición del HMM
utilizado en el etiquetado morfosintáctico:
A. Representa la probabilidad de la etiqueta anterior dada una etiqueta.
B. Representa la probabilidad de una etiqueta dada la etiqueta anterior.
C. La estimación de máxima verosimilitud de una probabilidad de transición se
calcula como la división entre el recuento de las veces que vemos la primera
etiqueta en un corpus etiquetado entre la frecuencia con que la primera
etiqueta es seguida por la segunda.
D. La estimación de máxima verosimilitud de una probabilidad de transición se
calcula como la división entre el recuento de las veces que vemos la primera
etiqueta seguida por la segunda en un corpus etiquetado entre la frecuencia
con que aparece la primera etiqueta.

9. Indica las afirmaciones correctas sobre la probabilidad de emisión del HMM


utilizado en el etiquetado morfosintáctico:
A. Permite identificar la palabra más probable para una etiqueta dada.
B. Representa la probabilidad de que, dada una palabra, esta se asocie a una
etiqueta concreta.
C. Representa la probabilidad de que, dada una etiqueta, esta esté asociada a
una palabra concreta.
D. Permite identificar la etiqueta más probable para una palabra dada.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


31
Tema 3. Test
10. Indica las afirmaciones correctas sobre la aplicación del algoritmo de Viterbi para
obtener la secuencia de etiquetas más probables en un etiquetador
morfosintáctico HMM:
A. Cada columna en la matriz de probabilidades corresponde a una palabra en
la frase a analizar y se llama observación.
B. Cada celda en una columna de la matriz de probabilidades corresponde a un
estado de la máquina de estados finitos y se corresponde a una etiqueta
morfosintáctica.
C. La probabilidad de Viterbi de una ruta se calcula como la multiplicación de
probabilidad de la ruta de Viterbi previa por la probabilidad de transición del
estado anterior al estado actual por la probabilidad de observación del símbolo
(etiqueta morfosintáctica), dado el estado actual.
D. La secuencia de etiquetas morfosintáctica correctas se obtiene de trazar la
rutan inversa que ha llevado a obtener el valor de Viterbi máximo en el estado
final.
© Universidad Internacional de La Rioja (UNIR)

Procesamiento del Lenguaje Natural


32
Tema 3. Test

También podría gustarte