Tema
1 – El estudio de los sonidos del
habla
1 Introducción
Fonética y Fonología son disciplinas complementarias que tienen como objetivo establecer el
componente fónico de las lenguas.
La fonética proporciona la base empírica, mientras que la fonología permite construir
generalizaciones de carácter abstracto.
2 Fonética. Definición, división y unidades
La fonética es la disciplina que estudia los mecanismos de producción, transmisión y percepción de
la señal sonora que constituye el habla. Atendiendo a esto, se suele dividir en fonética articularia,
fonética acústica y fonética perceptiva.
En cambio si se atiende al objeto de estudio, se puede dividir en fonética general, fonética
descriptiva y ortología (normas de pronunciación).
Las unidades básicas de la fonética son los sonidos del habla o elementos segmentales. Se
representan mediante corchetes [].
3 Fonética articulatoria
3.1 La fonación
Los sonidos del habla se producen mediante la acción coordinada del aparato fonador y resonador:
• Cavidad infraglótica: flujo de aire necesario para la producción de sonido. El aire se origina
en los pulmones, pasa por los bronquios, sube por la tráquea y luego por la zona subglótica
hasta la laringe.
• Zona glótica: es la responsable de la fonación. Está formada por la laringe (con 9 cartílagos) y
las cuerdas vocales (pliegues a cada lado de la laringe).
• Cavidades supraglóticas: donde se articulan los sonidos. Hay tres cavidades: orofaríngea,
oral y nasal. La oral tiene elementos fijos (dientes, maxilar superior, alveolos y paladar duro)
y elementos móviles (labios, maxilar inferior, lengua y paladar blando o úvula). A su vez la
lengua se divide en ápice, dorso y raíz.
En la producción del habla hay tres mecanismos:
• Respiración: crea la columna d aire necesaria para la emisión de sonidos del habla. En
español se producen en fase de espiración.
• Fonación: pliegues vocales dan sonoridad a la columna de aire, debido al efecto Bernoulli
(movimientos ondulatorios)
• Articulación: movimientos en las cavidades supraglóticas. En las vocales hay un canal sin
obstáculos, solo hay variaciones de forma. En las consonantes hay un obstáculo por contacto
o aproximación. La tensión es el mayor o menor esfuerzo muscular implicado en la
articulación del sonido.
3.2 La producción de los sonidos del habla
La lengua se divide en:
• Ápice
• Corona
• Predorso
• Mediodorso
• Postdorso
• Raíz
La configuración de la lengua puede ser:
• Cóncava
• Convexa
• Acanalada o retrofleja
4 Fonética acústica. La estructura física de los sonidos del habla.
Las ondas sonoras se caracterizan por tres parámetros: duración (ms), frecuencia (Hz) y amplitud
(dB). Pueden ser periódicas (como las vocales y las consonantes sonoras) a aperiódicas (como las
consonantes sordas), y algunas pueden estar constituidas por periódica compleja y aperiódica (como
las oclusivas sonoras y las fricativas sonoras). El timbre es la cualidad de los sonidos percibida por el
oyente.
En una onda compleja, se considera la frecuencia fundamental, la más grave, y se corresponde con
la frecuencia de vibración de los pliegues vocales. Las demás son armónicos, es decir, múltiplos de la
fundamental.
Función de filtro: determinado por la diversa configuración de las cavidades del tracto vocal
(incluyendo la cavidad nasal).
Formante: cada una de las zonas espectrales en las que se concentra la energía tras el filtrado.
Fuente y filtro son similares durante la producción de los sonidos no periódicos del habla: la fuente
se sitúa en el punto donde se produce el obstáculo o constricción.
Fuentes aperiódicas:
• Impulsional: ruido de explosión oclusivas
• Continua: ruido de cierta duración fricativas
El filtro puede ser:
• Variable: si la disposición de los órganos articulatorios varía durante la producción del
sonido. Por ej.: en oclusivas, que hay dos fases: la de cierre (se retiene el aire) y la de
explosión (el aire sale bruscamente).
• Fijo: si la disposición de los órganos no varía, por ej.: en vocales.
El análisis espectrográfico es la técnica de análisis más usual en fonética acústica y su
representación es el espectrograma. En las abscisas se representa la duración de los sonidos, en las
ordenadas la frecuencia, y la tonalidad representa la intensidad de la señal.
El Praat es una herramienta informática para el análisis espectrográfico. Permite analizar
acústicamente los sonidos del habla y diseñar estímulos sintetizados que facilitan el estudio de la
percepción.
Vocales: las cavidades de resonancia amplifican armónicos distintos cada vez, y por tanto la
frecuencia de los formantes es distinta para cada uno de los sonidos vocálicos. Las vocales se
caracterizan acústicamente por F1 y F2, pero para describir adecuadamente las vocales satélites es
necesario también F3.
F1 se relaciona con la abertura del maxilar inferior: a mayor abertura, mayor frecuencia y viceversa.
F2 se relaciona con la posición de la lengua: cuanto más adelantada, mayor frecuencia y viceversa.
Carta de formantes de las vocales
F2
i u
e o F1
Procesos de coarticulación fonética: movimientos realizados por órganos articulatorios para pasar
de un sonido a otro. Se reflejan en las características de la onda sonora.
Transiciones: cambios de frecuencia que provoca una consonantes en los formantes de las vocales
adyacente. Se ven formantes con una primera fase en forma de pendiente y una segunda fase
estable.
5 Fonética perceptiva
5.1 Definición
Es la disciplina lingüística encargada de estudiar los mecanismos de descodificación de los sonidos
del habla y su relación con el sistema de la lengua. (Esto último lo diferencia de otras disciplinas
como la psicoacústica o psicolingüística).
La lingüística refrenda los resultados de la fonética / fonología.
La descodificación del habla es una actividad compleja desde el punto de vista fisiológico y cognitivo,
y es la suma de una actividad de audición, percepción y comprensión.
5.2 Paso a paso
5.2.1 Procesos en la descodificación del habla
Hay tres procesos en la descodificación:
• Segmentación: es la división del continuo sonoro en unidades discretas. Requiere un
conocimiento sobre la organización de la lengua a nivel segmental y suprasegmental (si
escuchamos un idioma eslavo y chino, en el eslavo podemos detectar la segmentación, en el
chino nos cuesta).
Las claves para detectar el momento de segmentación son las pausas, las variaciones de
intensidad, los cambios espectrales rápidos o los pequeños altibajos en el tono.
• Reconocimiento: es la identificación de las unidades en todas sus presentaciones, es decir,
en diferentes contextos, hablantes, velocidades y variedades.
• Agrupación: es la detección entre elementos, que nos permite identificar la estructura
lingüística.
Unidades aisladas > sintagmas > oraciones > textos
5.2.2 Etapas en la descodificación lingüística
Hay tres etapas:
• Audición: la onda sonora genera unos patrones de activación nerviosa. Es innato y universal,
similar en muchos mamíferos.
o Es un mecanismo pasivo y automático, no lo podemos evitar
o Nos permite detectar sonidos
o Localización fisiológica: del oído externo al nervio auditivo
• Percepción: las representaciones neurológicas dan lugar a unidades lingüísticas.
o Es un mecanismo activo
o Nos permite discriminar e identificar sonidos
o Localización fisiológica: desde los núcleos auditivos a la corteza cerebral.
• Comprensión: De abajo a arriba, se extrae el significado desde la señal. De arriba abajo, se
dan restricciones gramaticales y estrategias de anticipación.
o Nos permite asignar significados e interpretación y entender la realidad y
comunicarnos
o Localización fisiológica: distintas áreas de la corteza cerebral, activación simultánea.
o Para esto se crean unos modelos mentales: hace falta uno o dos años de interacción
en cada lengua materna. Solo dispone de este mecanismo el ser humano.
5.2.3 Tareas en la descodificación lingüística
Hay tres tareas:
• Detección: ¿Hay señal?
o Comparamos la señal con el silencio o el ruido
o Detectamos estímulos en función de la duración, intensidad y frecuencia
• Discriminación: ¿Igual o diferente? ¿Igual a b o a c?
o Hace falta al menos dos estímulos que debemos comparar y determinar si se trata
del mismo elemento o no
o Reconocemos propiedades del estímulo y lo diferenciamos de otro de la misma
cualidad
• Identificación: ¿Es la unidad X?
o Relacionamos el estímulo que se nos presenta con la representación que tenemos
en memoria.
o Incluimos sonidos en categorías predeterminadas (categorización)
6 Los elementos de la cadena hablada. Segmentos y suprasegmentos.
Los elementos propios de la fonética son los segmentales (los sonidos del habla) y los
suprasegmentales (acento, entonación, ritmo, etc.).
6.1 Acento
Dota a una sílaba de prominencia con respecto a las sílabas adyacentes, y las divide en tónicas y
átonas.
• Grupo acentual: agrupación de una sílaba tónica y una o más átonas
• Acento léxico: recae sobre la sílaba tónica. Algunas palabras posee dos acentos: el primario
o léxico y el secundario.
• Acento de enunciado: recae al final de la frase, normalmente
• Acento enfático: otorga un relieve particular a una parte de la cadena.
6.2 Entonación
Es la suma de un conjunto de variaciones en el tono, duración e intensidad de los sonidos de un
enunciado.
• Curva melódica: variaciones de carácter tonal
• Unidad melódica: parte mínima del enunciado dotada de una forma entonativa
determinada y de un significado diferenciado.
• Grupo de entonación:
o Grupo demarcativo mayor: enunciado dotado de una cierta unidad sintáctica y
delimitado por pauses o movimientos melódicos
o Grupo demarcativo menor: “La casa, sola, en lo alto de la colina”
6.3 Pausa
Es la interrupción de la producción de la cadena hablada. Muchas veces el paso de una unidad a otra
se manifiesta por la depresión de la intensidad.
• Pausa vacía o silenciosa: si se manifiesta con silencio
• Pausa llena: si se manifiesta mediante un elemento vocal como mmmm o eeee
Los hablantes las suelen utilizar para disponer del tiempo necesario para estructurar el discurso.
6.4 Velocidad y otros
Velocidad de elocución: número de palabras o sílabas emitidas por unidad de tiempo (incluyendo
pausas)
Velocidad de articulación: número de palabras o sílabas emitidas por unidad de tiempo sin pausas
Timbre o cualidad de voz: resultado de la base de articulación propia de cada lengua y de factores
anatómicos individuales
Base de articulación: conjunto de hábitos articulatorios generales, condicionado por el predominio
de determinados lugares de articulación, por la preponderancia de sonidos sonoros o sordos, etc. Y
por la tensión general de la articulación.
Ritmo: en la lengua española se percibe por la recurrencia de elementos prominentes a lo largo de
un enunciado.
7 La transcripción fonética
La transcripción fonética es un sistema de notación escrita de los sonidos del habla cuyo objetivo es
representar siempre un mismo sonido con idéntico símbolo, de forma que se eviten las
ambigüedades existentes en los sistemas habituales de escritura.
Alfabeto Fonético Internacional (AFI): formado por una serie de caracteres alfabéticos a los que se
suma un conjunto de diacríticos. Se basa en criterios de carácter articulatorio: dispone de un
símbolo por cada vocal y consonante en función de los movimientos de los órganos fonatorios. Para
transcribir los sonidos de cada una de las lenguas naturales se utiliza únicamente un subconjunto del
AFI.
Transcripción estrecha: transcripción pormenorizada de las características fonéticas de un sonido
(uso abundante de signos diacríticos).
Transcripción ancha: de carácter más general, reproduce los segmentos contrastivos y algunos de
sus alófonos más característicos
8 Fonología. Definición y unidades.
La fonología estudia cómo se estructuran los segmentos y los elementos suprasegmentales de una
lengua para transmitir significados.
Coarticulación fonética: ajustar la realización de la consonante a las características de la vocal
siguiente, variando la articulación. Por ej.: la /k/ de copa se pronuncia como una velar, ya que la o es
retraída, mientras que la /k/ de quilo se pronuncia como una prevelar, ya que la i no es retraída.
Los hablantes consideran ambas iguales, son manifestaciones distintas de una misma unidad
mental, ya que las diferencias de tipo articulatorio y acústico no son relevantes para diferenciar
significados. Entre [p] y [b], en cambio, la sonoridad es un rasgo distintivo y cambia el significado:
bola – loba
La fonología, además de determinar que [b] y [β] constituyen manifestaciones distintas de una
misma categoría abstracta /b/, establece el proceso que conduce a pronunciar uno u otro, puesto
que su aparición está regida por reglas.
Fonética mecanismos de producción y percepción (características articulatorias de los sonidos)
Fonología forma en que las lenguas organizan la materia fónica (qué características son
relevantes para la significación de enunciados).
La fonología del español constituye una adaptación de un conjunto de categorías universales y los
fenómenos de variación que presenta pueden explicarse mediante reglas abstractas.
En la actualidad, la fonología se orienta hacia la evidencia fonética e intenta cimentar sus
explicaciones en patrones fonéticos observables.
9 Los segmentos y los rasgos distintivos
Las unidades básicas de la fonología clásica eran los fonemas. La fonología actual se basa en el
concepto de rasgo distintivo.
Par mínimo: conjunto de dos palabras de distinto significado que se diferencian solo por un fonema:
peso vs beso; tos vs dos
Los alófonos de un fonema ([b] o [β]) pueden encontrarse en:
• Distribución complementaria: los alófonos no son intercambiables. Cada uno de ellos
aparece en la posición del enunciado que más se adecua a sus características y porque su
presencia es predecible mediante reglas.
• Distribución libre: son alófonos cuya aparición no está determinada por reglas de carácter
fonológico, sino por factores de situación comunicativa, intención del hablante o contexto: sí
o ¿sí? manifestación de sorpresa, los dos alófonos de i están en distribución libre.
Rasgo distintivo: cada uno de los elementos constitutivos de un segmento cuya modificación puede
dar lugar a un contraste significativo. Por ej.: peso vs beso
/p/ /b/
• [+consonante] • [+consonante]
• [-sonante] • [-sonante]
• [-continuo] • [-continuo]
• [-sonoro] • [+sonoro]
• [-redondeado] • [-redondeado]
Así, el rasgo distintivo de la sonoridad provoca una variación de significado.
Clases de rasgos: organización jerárquica de rasgos distintivos. Los criterios son de carácter
articulatorio y difieren ligeramente de la caracterización articulatoria de los sonidos.
Raíz del segmento: la base sobre la que se establece el conjunto de las características del segmento.
Debajo de la raíz hay varias familias de rasgos de menor jerarquía.
• Rasgos raíz: [+/-consonante] y [+/-sonante]
o Los segmentos vocálicos son: [-consonante] y [+sonante]
o Las consonantes obstruyentes: [+consonante] y [-sonante]
o Las consonantes sonantes: [+consonante] y [+sonante]
• Rasgos laríngeos: según la disposición de los pliegues vocales y su acción. En español solo
[+/-sonoro]
• Rasos supralaríngeos: la acción se desarrolla en alguna de las cavidades supralaríngeas.
Puede definir:
• Modo de articulación: depende de cómo es expulsado el aire:
o Continuo: si hay obstáculo total a la salida del aire (oclusivos o nasales) [-
continuo]
o Estridente: si hay una obstrucción adicional, con turbulencias (/f/ y /s/)
[+estridente]
o Lateral: si el aire sale por los lados de la boca (laterales) [+lateral]
• Lugar de articulación: depende de dónde se produce el obstáculo:
o Labial: los labios se cierran (/p/, /b/, /f/ y /m/)
Redondeado: /o/ y /u/
o Coronal: la corona de la lengua se desplaza hasta los dientes o alveolos
Anterior
Distribuido: la lengua toca con la parte más amplia de la zona donde se
encuentra el obstáculo
o Dorsal: dorso de la lengua establece contacto con el velo del paladar (/k/, /g/ y
/x/)
Alto
Retraído
Bajo
Formas marcadas vs formas no marcadas: ciertas formas son más comunes por ser más fáciles de
articular.
Así, el esquema queda:
10 Otras unidades fonológicas
Los segmentos se combinan construyendo una primera unidad de rango superior que se denomina
sílaba.
Palabra fonológica: puede estar constituida por uno o más pies métricos y es imprescindible que
cuente con un acento primario. Es una definición diferente de la de morfología: [lapelicula]
Unidades melódicas: fragmentos de la cadena hablada que poseen determinados patrones
melódicos.
Patrón melódico: forma entonativa, musical, originada por las variaciones de la frecuencia del
fundamental o variaciones tonales, que son recurrentes en una lengua y que no dependen del
hablante ni del mensaje: ¿Qué hora es? ¿Cuánto cuesta?
Enunciados fonológicos: combinación de unidades y patrones melódicos.
11 Los procesos fonológicos
Los procesos fonológicos son variaciones que experimentan los segmentos cuando se realizan en el
habla.
Dominio: nivel o ámbito en el que se da un proceso: segmental, suprasegmental…
Posición: en la que se manifiesta ese proceso: sonido en posición inicial de sílaba, etc.
Contexto: produce efectos de la influencia entre los elementos contiguos-
Naturalidad: probabilidad de aparición de un proceso.
Dimensión social: un fenómeno de variación solo puede propagarse si la comunidad de habla los
adopta.
Así, los condicionamientos de carácter lingüístico son elementos importantes en la aparición de un
proceso, pero los condicionamientos sociales son determinantes para impulsar o limitar la
expansión del fenómeno en una lengua natural.
12 Retos para la descodificación del habla y sus respuestas
perceptivas
12.1 Retos para la descodificación: la variabilidad del habla
Cuando escuchamos, somos capaces de identificar el mensaje a pesar de la diferencia entre
interlocutores, o incluso entre el mismo interlocutor en dos situaciones distintas.
Las fuentes de variabilidad pueden ser:
• Factores individuales
o Características anatómicas (cualidad de la voz, estado órganos fonadores, etc.)
o Características del habla (hábitos articulatorios, velocidad de elocución, registro,
estilo, dialecto, sociolecto…)
• Factores lingüísticos:
o Reglas fonológicas y fonosintácticas
o Contexto: coarticulación…
12.2 Ayudas para la descodificación del habla: la redundancia
La descodificación es mucho más que un análisis de frecuencia, quizás es el reto mayor en la
percepción del habla. La señal es variable, pero tiene muchas más señales de las que necesitamos
(redundancia = reglas superfluas que contribuyen a facilitar la comunicación)
• En el código:
o Nivel fonético: basta el 1-2% de la amplitud del habla para reconocer el 80-90% de
las palabras. Además, si se eliminan todas las frecuencias por encima de 1800Hz se
identifica hasta el 67% de las palabras
o Nivel morfosintáctico: uso de flexión, etc.: “una niña saltó contenta”
• En la codificación: la percepción de los fonemas no depende de una única clave acústica, por
ej. el acento depende de la frecuencia, el tiempo y la amplitud. Cada lengua prioriza unas
claves frente a otras, pero si no se reciben se analiza la siguiente y luego la siguiente.
• En la descodificación: restauración de fonemas (de forma inductiva e inconsciente) para
restituir parte del mensaje que no hemos oído. Alrededor de un tercio de la información no
está en la señal, viene de nuestro cerebro.
12.3 Conclusiones
1. Resistencia: el habla está codificada de forma recia, robusta, resistente al ruido y de la
manera que mejor aprovecha las características del sistema auditivo
2. El receptor es un elemento activo que debe:
a. Extraer unidades de un continuo fónico
b. Generar expectativas sobre el mensaje
c. Compensar los ruidos
12.4 Respuestas a la variabilidad
1. A los efectos del contexto: compensación.
El contexto provoca coarticulación. Sin embargo, perceptivamente nos adelantamos a ese
efecto, y lo minimizamos para mantener las fronteras perceptivas que aproxima la señal al
modelo mental preexistente. Existen mecanismos perceptivos que compensan los efectos
acústicos producidos por la coarticulación.
2. A las diferencias individuales: la normalización.
Cada uno tiene un habla distinta. Sin embargo, somos capaces de entendernos. Es posible
gracias a un complejo mecanismo perceptivo que se consigue desde el primer trimestre de
vida: la compensación.
• Auditiva: a partir de 1000 Hz, el sistema auditivo pierde capacidad para distinguir
matices de frecuencias, que es justo donde residen las principales diferencias
individuales.
• Perceptiva: se realiza un escalado, campo máximo de dispersión vocálica.
• Cognitiva: información individual de las voces (memoria a largo plazo), secuencia de
sonidos (memoria fonética, desaparece en segundos)
3. A los cambios temporales: la integración temporal
La velocidad de elocución varía entre lenguas, dialectos, hablantes o la situación
comunicativa, y afecta a elementos suprasegmentales y a la diferencia entre sordas y
sonoras. La velocidad media es de 10-12 unidades/s, y la máxima de 40 a 50 unidades/s.
No afecta a nuestra comunicación porque contamos con un mecanismo de integración
temporal:
• Claves acústicas como “anclas” perceptivas: longitud de las sílabas, duración de las
pausas, cambios en F0
• Intervención de patrones memorizados: representaciones prototípicas de unidades
más frecuentes