0% fanden dieses Dokument nützlich (0 Abstimmungen)
23 Ansichten22 Seiten

Natural Language Processing

Document written by HTW-Berlin Applied Computer Science Students as a part of assignment in "Gesellschaftliche Aspekte der Informatik"

Hochgeladen von

Mouadh Khlifi
Copyright
© All Rights Reserved
Wir nehmen die Rechte an Inhalten ernst. Wenn Sie vermuten, dass dies Ihr Inhalt ist, beanspruchen Sie ihn hier.
Verfügbare Formate
Als PDF, TXT herunterladen oder online auf Scribd lesen
0% fanden dieses Dokument nützlich (0 Abstimmungen)
23 Ansichten22 Seiten

Natural Language Processing

Document written by HTW-Berlin Applied Computer Science Students as a part of assignment in "Gesellschaftliche Aspekte der Informatik"

Hochgeladen von

Mouadh Khlifi
Copyright
© All Rights Reserved
Wir nehmen die Rechte an Inhalten ernst. Wenn Sie vermuten, dass dies Ihr Inhalt ist, beanspruchen Sie ihn hier.
Verfügbare Formate
Als PDF, TXT herunterladen oder online auf Scribd lesen

Natural Language Processing

Ausarbeitung

Thema: Natural Language Processing (NLP)

Erstellt von:
Jan Kociok s0564660@[Link] s0564660
(Zuständig für NLP in der Medizin, NLG und Interaktion mit KIs)
Hamza Allali s0569877@[Link] s0569877
(Zuständig für Chatbots, Text Mining und MT)
Mouadh Khilifi s0570876@[Link] s0570876
(Zuständig für Stemming, Lemmatization, Part of speech Tagging,
Stop Words, Named Entity Recognition, Chunking )
Sebastian Liebl s0570949@[Link] s0570949
(Zuständig für Tokenization, Dependency Parsing, Coreference Resolution)

eingereicht am: 11. Juni 2019

1
Gliederung

1. Abstract .......................................................................................................................... 3
2. Einleitung ....................................................................................................................... 3
3. Tokenization .................................................................................................................. 4
4. Stemming ...................................................................................................................... 4-5
5. Lemmatization .............................................................................................................. 5-6
6. Parts of Speech Tagging ................................................................................................ 6-7
7. Stop Words .................................................................................................................... 7
8. Named Entity Recognition ............................................................................................ 7-8
9. Chunking ....................................................................................................................... 8
10. Dependency Parsing ................................................................................................... 9
11. Coreference Resolution .............................................................................................. 10-11
12. Anwendungsgebiete und Einfluss auf Gesellschaft ................................................... 12
13. Natural Language Processing in der Medizin ............................................................. 12
13.1. Beispiele für NLP in der Medizin ................................................................. 12-13
13.2. Einfluss auf die Gesellschaft ........................................................................ 13
14. NLP für die Generierung von Sprache und Texten ..................................................... 13
14.1. Roboterjournalismus ................................................................................... 13-14
14.2. Einfluss auf die Gesellschaft ......................................................................... 14
15. Interaktion mit Künstlichen Intelligenzen ................................................................... 14-15
16. Enterprise Chatbots ..................................................................................................... 16-17
16.1. Was ist ein Chatbot? ..................................................................................... 16
16.2. die Fünf Bereich, wo in den Chatbots Arbeitsleben verändert hat. .............. 16
16.3. Die Vorteile von Chatbots zusammengefasst: ............................................... 16
16.4. Der Einfluss auf die Gesellschaft .................................................................... 17
17. Text Mining .................................................................................................................... 17-18
17.1. Was ist Text Mining? ...................................................................................... 17-18
17.2. Text Mining Einsetzung .................................................................................. 17
17.3. Der Einfluss auf die Gesellschaft .................................................................... 18
18. Maschinelle Übersetzung .............................................................................................. 18-19
18.1. Was ist Maschinelle Übersetzung .................................................................. 18-19
18.2. Maschineller Übersetzungssystem ................................................................ 19
18.3. Maschinelle Übersetzung Vorteile ................................................................ 19
18.4. Der Einfluss auf die Gesellschaft ................................................................... 19-20
19. Schluss............................................................................................................................ 20
20. Abkürzungen ................................................................................................................. 21
21. Quellen ......................................................................................................................... 21-22

2
[Link]
Natural Language Processing hat aufgrund der Fortschritte in künstlicher Intelligenz und
Datenerhebung in den letzten Jahren an extrem an Fahrt aufgenommen.

Um NLP zu verwirklichen bieten sich mehrere Implementierungen an die von verschiedenen


Faktoren wie Anwendungsfall und Infrastruktur abhängen. In diesem Dokument wird “Natural
Language ToolKit” (NLTK), das in Python implementiert ist, verwendet und die meist verwendeten
Techniken beinhaltet.

Im nächsten Kapitel werden einige Anwendungsgebiete von NLP und ihre Auswirkung auf die
Gesellschaft näher betrachtet.
Am Ende werden verschiedene Hypothesen bezüglich der gesellschaftlichen Aspekte von NLP in der
Zukunft aufgestellt.

[Link]
Natural Language Processing ist ein Teilgebiet der Informatik, welches sich mit der Analyse und
Auswertung und ebenso mit der Synthese natürlicher Sprache beschäftigt. Im Vordergrund stehen
unter Anderem eine reibungslose Kommunikation zwischen Mensch und Maschine und auch unter
Maschinen selbst. Um dies zu ermöglichen werden Methoden und Ergebnisse aus den
Sprachwissenschaften mit modernster Informatik verbunden. Natural Language Processing muss es
schaffen sowohl geschriebene, als auch gesprochene Sprache zu erkennen, zu analysieren und zu
generieren. Hierbei reicht es nicht mehr einzelne Wörter und Sätze zu erfassen. Es müssen große
Textzusammenhänge analysiert und ausgewertet werden. Hierbei stellt die Komplexität der
menschlichen Sprache ein großes Hindernis dar. Um zu bewerkstelligen, dass große Texte analysiert
werden können kommen Technologien wie “Machine Learning” und “Deep Learning” zum Einsatz.

Zudem beeinflusst NLP die heutige Gesellschaft bereits maßgeblich. Zum Beispiel durch die
steigende Kommunikation mit Maschinen sowohl im Alltag als auch im Berufsleben, was unter
Anderem das Leben erleichtern soll. Auch in der Zukunft wird diese Technologie ein wichtiger
Meilenstein in der modernen Informatik sein. Ob Siri, Cortana, Chatbot oder die automatische
Anrufverarbeitung bei z.B. Versicherungen. Die Kommunikation zwischen Mensch und Maschine hat
sich in den letzten Jahren enorm erhöht und hat einen festen Platz in der Gesellschaft
eingenommen. Auf den folgenden Seiten werden wir einige Methoden von NLP näher beleuchten
und Beispiele für gesellschaftliche Einflüsse aufzeigen.

3
3. Tokenization
Was tut Tokenization? : Es segmentiert Sätze Wort für Wort in sogenannte Tokens
Wesentliche Frage: „Was wird als ein Wort gesehen?“
In der Phase, Tokenization, wird eine Eingabe, in Form von geschrieben oder gesprochenem
Text, in einzelne Token zerlegt.

Beispiel: Karl trägt ein schönes Hemd. (5 Tokens)


Dieses Beispiel stellt in dieser Phase keine große Herausforderung dar. Mit der einfachsten
Methode der Tokenization, dem erkennen eines Tokens durch Leerzeichen, ist der Satz
korrekt abgearbeitet.

Wie sieht es aber mit „ Karls Reisegeschichten aus New York sind voll crazy!“(7 oder 8
Token?) aus?
In diesem Beispiel treten gleich mehrere Herausforderungen auf. Zum einen muss „Karls“
verarbeitet werden. Wird es als ein zusammenhängendes Wort (Token) erkannt (Karl oder
Karls) oder als 2 Token („Karl“ und „s“)? Gleiches bei „New York“. Am Ende haben wir sogar
eine Form von Anglizismus die auch richtig verarbeitet werden muss. Wortverkettung durch
Bindestriche oder Worte mit Apostroph stellen die Entwickler vor Schwierigkeiten. Oder
auch Sprachfehler, man führe sich nur kurz so manches Interview von Fußballtrainern vor
Augen, wo gefühlt jedes 3. Wort ein „ähh“ ist. Gängige Abkürzungen wie Dr. oder Hr.
müssen ebenfalls gedeutet werden.
Eine weitere Herausforderung sind die vielen verschieden Sprachen dieser Welt. Zum
Beispiel lässt sich die Methode, Wörter durch Leerzeichen zu trennen, die in deutsch
eigentlich gut klappt, in z.B. China und Japan gar nicht anwenden weil es keine Leerzeichen
gibt. Hier macht sich eine Methode gut, die in Deutsch z.B. wenig Sinn machen würde. Die
Rede ist von Maximum Matching oder auch Greedy genannt. Bei dem Algorithmus wird z.B.
eine Eingabe mit einer hinterlegten Wortliste verglichen. Der Algorithmus unterteilt nun die
Eingabe, in die ihm am längsten bekannten Worte ein.

莎拉波娃现在住在美国东南佛罗里达
Sharapova now lives in US southeastern Florida
Am Ende ist die eine große Herausforderung von Tokenization, zu erkennen was als ein
Token ist zu erachten ist.

4
4. Stemming
Stemming ist eine Technik, die aus dem Gebiet von Informationsextraktion stammt und in
NLP zu Vorverarbeitungs- und Effizienszwecken verwendet wird. Bei dieser Technik geht es
darum unter Berücksichtigung einer Liste allgemeiner Präfixe und Suffixe, die Affixe von
einem Wort zu entfernen.

Es werden folgende Beispiele betrachtet:


“I was taking a rest”
“I was resting”
Die zwei Sätze bedeuten das gleiche und verwenden dafür verschiedene Varianten vom
gleichen Wort. Um die zwei Sätze zu verstehen wird es nötig sein, beide Wörter in einem
Datenbank zu speichern. Da es aber unrealistisch ist alle Formen eines Wortes zu lagern,
kommt Stemming im Spiel indem nur der Stamm gespeichert wird. Konkret wird im Beispiel
aus dem zweiten Satz(resting) ‘rest’ extrahiert.
Zahlreiche Algorithmen wurden zur Realisierung von Stemming entwickelt. Einer der meist
verwendeten Stemmers ist “Porter Stemmer” das im NLTK wie folgendes funktioniert :

Abbildung 2 : PorterStemmer in NLTK

Das Suffix “ing” wird hier entfernt und stem wird das String “rest” als wert haben.
Dieses willkürliche Löschen von Affixe kann in einigen Fällen inkorrekt sein. Deswegen
wurde die Schlussfolgerung gezogen, dass dieser Ansatz einige Einschränkungen aufweist.

[Link]
Lemmatization ist eine weitere Textnormalisierungstechnik, die wie Stemming das Text zu
weiteren Verarbeitung vorbereitet. Das Ziel dieses Prozesses ist ein Wort auf seine
Grundform zu reduzieren und somit verschiedene Formen desselben Wortes zu gruppieren.
Die entstandene Grundform heißt Lemma und davon kommt der Name dieser Technik.
Allgemein, werden Verben in der Vergangenheitsform in Gegenwart umwandelt (z. B. "ate"
wird zu "eat" geändert) und verwandte Wörter werden vereinheitlicht (z. B. "best" wird in
"good" geändert), wodurch Wörter mit ähnlicher Bedeutung wie ihre Wurzel standardisiert
werden.
Im Gegensatz zu Stemming werden bei der Lemmatisierung die Wörter ordnungsgemäß
reduziert, um sicherzustellen, dass das Stammwort zur Sprache gehört. Beispielsweise

5
werden die englische Wörter “think”,”thought”,”thinking” durch Lemmatization auf ihr
Lemma “think” reduziert. ” thought” wird aber durch Stemming unverändert bleiben.
Bei der Lemmatisierung wird auch der Kontext des Wortes berücksichtigt, um andere
Probleme wie die Disambiguierung zu lösen. Dies bedeutet, dass identische Wörter mit
unterschiedlichen Bedeutungen je nach Kontext unterschieden werden kö[Link]
wird folgende Beispielsätze :

You were right.


Make a right turn at the light.
Access to clean water is a basic human right.

Das Wort “right” hat in jedem Satz eine andere Bedeutung. Durch die Angabe eines POS-Tag
(Part of Speech) für ein Wort (ob es sich um ein Substantiv, ein Verb … usw handelt) ist es
möglich, eine Rolle für dieses Wort im Satz zu definieren und die Disambiguierung
aufzuheben.
Es können zur Lemmatisierung mehrere Implementierungen verwendet. In diesem
Dokument wird „Wordnet Lemmatizer“ von Python-NLTK betrachtet.

Als erstes muss „Wordnet“ heruntergeladen werden. Es handelt sich um eine umfangreiche,
kostenlos und öffentlich verfügbare lexikalische Datenbank für die englische Sprache mit
dem Ziel, strukturierte semantische Beziehungen zwischen Wörtern herzustellen. Es bietet
auch Lemmatisierungsfunktionen und ist eines der am häufigsten verwendeten
Lemmatisierungsmittel. Danach wird der Lemmatizer wie folgt eingesetzt :

Abbildung 3: Lemmatization mit Wordnet

Stemming führt ein Algorithmus aus, um Wörter zu bearbeiten, wodurch die Technik schnell
ist. Im Gegensatz dazu verwendet die Lemmatisierung lexikalische Datenbanken wie
Wordnet1 und ist deswegen aufwändiger und langsamer.

6. Parts of Speech Tagging:


Part-of-Speech-Tagging (POS-Tagging) ist die Aufgabe, ein Wort in einem Text mit seiner
Wortart zu kennzeichnen. Die Rolle eines Wortes(Verb, Adjektiv, Nomen…) zu ermitteln ist
einen sehr wichtigen Schritt um die Bedeutung, die sich hinter einfache “Strings”

6
verstecken, zu verstehen und einen ersten Überblick über die Beziehungen zwischen die
Wörter in einem Satz festzustellen.
Das Kennzeichnen von Wörtern erfolgt über einen durch maschinelles Lernen trainierte POS
Modell. Daraus folgt, dass das Modell die Sätze nicht wirklich versteht, sondern sich auf
reine Statistiken basiert. Dies erfolgt durch das Ermitteln von der Wortart des aktuellen
Wort in den vergangenen Trainingsdaten: Kommt beispielsweise das Wort “Student” in 60 %
der Fälle als Subjekt in einem Satz vor dann wird sie auch im aktuellen Kontext
höchstwahrscheinlich als Subjekt identifiziert.

Diese Technik wird in zahlreiche andere NLP Techniken als Grundlage verwendet und wird
im späteren Teile dieses Dokument konkret vorgeführt.

7. Stop Words:
Bei der Verarbeitung natürlicher Sprachen ist es hilfreich, in einem Text die Wichtigkeit
jedes Worts zu ermitteln, da dies in dem Prozess berücksichtigt wird. Im allgemeinen haben
Sprachen mehrere Füllwörter die häufig vorkommen, aber die Bedeutung des Texts nicht
deutlich beeinflussen. Solche Wörter wie “the”,”a”,”and” im Englischen kommen häufiger
als die anderen Wörter vor und stören bei der Durchführung von Text-Statistiken. Da die
Stop-Words häufig zu falschen Statistik Ergebnissen führen, werden sie in mehrere NLP
Implementierungen herausgefiltert.
Stop-Words werden in einen Datensatz hardcodiert und sind vom Programmierer
anpassbar, denn sie unterscheiden sich von einem Anwendungskontext zu einem anderen:

Sollte eine Anwendung im Kontext von Filmen operieren, dann wäre es keine gute Idee
“the” als Stop Word zu betrachten da mehrere Filmtitel dieses Wort enthalten.

8. Named Entity Recognition


Named Entity Recognition (NER) ist eine Informationsextraktionstechnik und hat zum Ziel,
Elemente (Named Entities) wie Namen von Personen, Organisationen, Standorte und
Währungen in einem Text zu finden und die in vordefinierte Kategorien einzuteilen. Konkret
in NLTK wird NER wie folgt implementiert :

Abbildung 4 Named Entity Recognition

7
Hier wurde “Maximilian” als Personenname, “Google”
als Organisationsname und ‘$’ als Währung erkannt.

9. Chunking
In dem obigen Beispiel wurde auch eine Technik namen Chunking verwendet
die dafür sorgt
einzelne Teilinformationen zusammenzufassen um ein größeres
Informationsstück zu
erhalten. Klarer ausgedrückt, besteht diese Technik darin die gruppierbare
Elemente eines
Textes zusammenzufassen (z.B : Determinanten2:, Adjektiven und Nomen).

Um das Konzept zu verdeutlichen wird hier ein konkretes Beispiel gezeigt :

Abbildung 3: Chunking Implementierung und Ausgabe

Hier wurden jeweils “The” “big” “cat”, “the” “little mouse” und “fresh” “cheese” gruppiert
weil sie zusammen die im Text enthaltenen Daten besser darstellen.

8
10. Dependency Parsing

Dependency parsing beschreibt eine Methode von NLP, welche versucht, Beziehungen
zwischen den einzelnen Worten herzustellen, um so den Sinn der Eingabe besser erfassen zu
können.

Zu Anfang ermittelt die Methode die Wurzel (Root) des Satzes welche meist das Verb ist, da
sich häufig fast alle anderen Wörter in irgendeiner Weise darauf beziehen (wie oben gut zu
sehen ist). Ein anderes Beispiel wäre:
Maria is a good friend of mine and very popular in my class.
Mit Part of Speech tagging werden die verschieden Rollen der Wörter ermittelt und mit
Lemmatization nochmal in ihre Grundform gebracht(is🡪be). „is“ ist hier unser Rootword,
weil es in beiden Teilen des Satzes eine zentrale Rolle spielt. Letztlich besteht der Satz aus
zwei Sätzen die und-Verknüpft sind.
Maria is a good friend of mine.
Maria is very popular in my class.
Mit chunking werden die Determinanten, Adjektive und Nomen usw. zusammengefasst. Am
Ende haben wir eine be-Beziehung zwischen „Maria“(wird durch NER als Personenname
erkannt) und „good friend“ aber auch zwischen „Maria“ und „very popular“.

9
11. Coreference Resolution

Unsere täglichen Unterhaltungen sind gespickt mit Pronomen. Es sind letztlich kleine
Abkürzungen, die sich auf jemanden oder etwas beziehen, um nicht jedes Mal den vollen
Name sagen oder schreiben zu müssen. Für uns Menschen ist es nicht schwer zu verstehen
wer oder was gemeint ist wenn wir sie benutzen, denn wir machen es ganz einfach am
Kontext fest und wissen sofort auf was sich das eben gesagte bezieht. Auch ist es für uns
kein Problem Pronomen, über mehrere Sätze hinweg, noch richtig zuzuordnen. Aber genau
hier wird es für NLP schwierig, da es ja nur Satz für Satz verarbeitet.
Coreference Resolution schlägt hier die Brücke und fungiert wie ein Cache.
C. R. ist damit eine der wichtigsten aber auch zugleich eine der am schwersten zu
implementierende Methoden von NLP.

C.R. greift unter Anderem, um richtig arbeiten zu können, auf die verarbeiteten Datensätze
von Named Entity und Dependency Parsing zurück.
C.R. ist aber bei weitem keine „Neue“ Methode. Sie erfuhr in den letzten Jahren aber eine
regelrechte Neugeburt da durch z.B. deep learning, Wort-Vektoren und neuronale
Vernetzung nicht mehr alles manuell eingegeben werden muss. Sie bringt es sich quasi
selbst bei und merkt sich anhand von Datenbanken, die jeweiligen Beziehung
untereinander.

10
Wie in der obigen Grafik zu sehen ist, besteht ein großer Unterschied zwischen den
Datensätzen vor und nach der Methode. Die Methode hat, auf Grundlage der ihr zur
Verfügung gestellten Datensätze, richtig erkannt zwischen welchen Worten eine Beziehung
besteht und sie getrennt. Die Qualität des Ergebnisses hängt hier sehr stark von den
zugrunde liegenden Datensätzen ab, welche sich meist aus Nachrichten- und Webartikeln
speisen. Diese sind natürlich nicht zu 100% Fehlerlos, also wird es unser Ergebnis auch nicht
sein. Die enorme Schwierigkeit der Implementierung macht sich auch bei der Winograd
Schema Challenge bemerkbar, wo das beste Team im letzten Wettbewerb eine Genauigkeit
von 58% erzielte.

11
12. Natural Language Processing Anwendungsgebiete und Einfluss auf die
Gesellschaft

Natural Language Processing (NLP) findet in der heutigen Zeit viele verschiedene
Möglichkeiten der Anwendung. In diesem Kapitel werden wir auf die verschiedenen Gebiete
eingehen und zudem behandeln wie sich NLP dadurch auf unsere heutige Gesellschaft
auswirkt. Wir haben uns entschieden, auf die folgenden Anwendungsgebiete einzugehen.

13. Natural Language Processing in der Medizin

Durch NLP wird es ermöglicht große Mengen an unstrukturierten Daten effizient zu


interpretieren und in eine Strukturierte Form zu bringen. Dies geschieht alles automatisch.
Beispiele für diese Daten in der Medizin sind radiologische Befunde, Arztbriefe oder OP-
Berichte. Hierbei handelt es sich um Freitext in natürlicher Sprache.

In der Medizin gibt es verschiedene Möglichkeiten NLP anzuwenden. Dies ist davon
abhängig um welchen Anwendungsfall es sich handelt. Zum einen mit oder ohne
medizinischer Expertise, mit speziellem IT-Werkzeugen und auch durch Anwender mit oder
ohne tieferem technischem Verständnis.

13.1 Beispiele für NLP in der Medizin

Unter anderem ermöglicht NLP eine Unterstützung bei der Kohortenanalyse. Dies ist eine
Untersuchung von Teilen der Bevölkerung und der Entwicklung und Veränderung von
Gruppen mit denselben zeitlichen Merkmalen wie Geburtsdatum und ähnlichem. NLP ist
hier in der Lage die Kosten bei einer Kohortenidentifikation erheblich zu senken und eine
Reihe von Einschluss- / Ausschlusskriterien zu definieren. Forschern wird es dadurch
ermöglicht strukturierte und unstrukturierte klinische Daten gleichzeitig, und somit
schneller abfragen zu können. Ergebnisse hieraus können sowohl für die Rekrutierung
potenzieller Studienteilnehmer, als auch für Machbarkeitsstudien genutzt werden.
Auch bei der medizinischen Behandlung und Weiterbehandlung von Patienten hilft NLP
weiter. Um die Qualität klinischer Berichte zu verbessern unterstützt NLP hier die Extraktion
wichtiger Daten aus Arztbriefen und anderen Unterlagen. Somit können Patientenprofile
schneller, genauer und vollständiger erstellt werden. Resultierend daraus ist eine bessere
Überwachung und Versorgung des Patienten gewährleistet.

12
Bei der Medikamentösen Behandlung von Patienten spielt die Vermeidung von
Nebenwirkungen eine große Rolle, um die Sicherheit und das Wohlbefinden des Patienten
zu garantieren. Wichtige Informationen zu Nebenwirkungen verschiedener Medikamente
liegen bereits in großen Mengen unstrukturierter klinischer Daten vor. NLP hilft hierbei
diese Informationen schnell und effizient zu gewinnen und zu analysieren und somit im
positiven für den Patienten einzusetzen.
Zudem hilft die Zusammenführung und Auswertung der Informationen über Medikamente
und Behandlungsmethoden bei der Forschung und Entwicklung
Nach Einführung des Medikaments wird dieses durch NLP weiter gezielt überwacht wodurch
eventuelle Nebenwirkungen schnell aufgedeckt werden.

13.2 Einfluss auf die Gesellschaft

Für den Anwendungsbereich der Medizin also ist der Einfluss auf die Gesellschaft der, dass
die Gesundheit und die Behandlung von Patienten stetig verbessert werden kann.
Krankheiten können schneller diagnostiziert, und die richtigen Medikamente schneller
gefunden werden was eine bessere Genesung sicherzustellen.

14. NLP für die Generierung von Sprache und Texten (Natural Language
Generation (NLG)

Die Generierung von natürlicher Sprache durch Algorithmen befindet sich noch in einem
frühen Stadium. Dennoch gibt es bereits Anwendungsbeispiele.

Ein Bereich in dem Natural Language Generation bereits zum Einsatz kommt sind die
Nachrichten. Hier werden Beiträge automatisch generiert wenn es eine hohe Dichte an
standardisierten Formulierungen gibt. Zum Beispiel gehören Berichterstattungen zu
Sportarten, Börsennachrichten oder Wetterberichten dazu. Roboterjournalismus ist hier das
Stichwort.

14.1 Roboterjournalismus

Roboterjournalismus bezeichnet die Verwendung von Daten und Programmen zur


Produktion von Nachrichtenbeiträgen. Weit verbreitet ist diese art des Journalismus in
bestimmten Genres, für die eine große Mengen an Daten verfügbar ist. Wie gerade erwähnt
sind es Bereiche wie zum Beispiel Sportberichte, Finanzen, Wetterberichte und auch
Verkehrsmeldungen.
Im Roboterjournalismus übernimmt ein Programm die Analyse und Interpretation der
Daten. In kurzer Zeit verarbeitet ein Algorithmus bereitgestellte Informationen wie Namen,

13
Orte, Beiträge, Rankings, Statistiken und andere Informationen in einen sogenannten
“Storyplot”.

Der Storyplot bildet einfach die Erzählstruktur eines Textes. Für ein Fußballspiel beschreibt
es die Begegnung zweier Mannschaften. In welchem Stadion das Spiel stattfand, wie viele
Zuschauer es gab, wie viele Tore es gab und wer die Torschützen waren, ob es
Verwarnungen und Verletzte gab und welche Spieler ausgewechselt wurden. Mit den
Antworten auf diese Fragen wird ein für Menschen Lesbarer und verständlicher Text
generiert.
Bei großen Datenmengen werden mehr Informationen untergebracht, was dem Text mehr
Komplexität verleiht. Zum Beispiel die Anzahl der Siege, Niederlagen oder Remis, das
Torverhältnis etc.

Die Storyplots stammen aber nicht von einer Maschine. Die Formulierungen, die
Dramaturgie etc. werden von einem menschlichen Redakteur definiert. Dadurch, und auch
nur so lernt die Maschine spezifisches Vokabular wie “lupenreiner Hattrick”,
“Aluminiumtreffer” und weitere Begriffe. Zudem werden verschiedene Varianten eines
bestimmten Ereignis hinterlegt. Ein höheres Maß an Varianz und Komplexität ist somit
gegeben und jeder Bericht ist einzigartig.

Der Roboterjournalismus, und im allgemeinen Natural Language Generation, bietet somit in


der heutigen Zeit eine Möglichkeit Kosten und Zeit einzusparen. Im Sportbereich sind,
beispielsweise Partien aus unteren Ligen unterschiedlicher Sportarten, nicht relevant genug
um von menschlichen Journalisten verfasst zu werden. Dem Programm hinter dem
Roboterjournalismus ist dies jedoch egal und kann mit wenig vorarbeit interessante Berichte
verfassen. Und sogar im Profibereich wird dies aus den oben genannten Gründen immer
häufiger angewendet.

14.2 Einfluss auf die Gesellschaft

Da in der Arbeitswelt immer darauf geachtet wird die Kosten möglichst niedrig zu halten
und möglichst Zeiteffizient zu arbeiten, werden automatisierte Systeme wie NLG und
speziell Roboterjournalismus immer häufiger genutzt. Somit können Profite gesteigert, und
eventuelle Arbeitsplätze eingespart werden. Im Bezug auf die heutige Gesellschaft bedeutet
dies, dass durch die ganze Automatisierung viele Menschen eventuell ihre Jobs verlieren nur
um möglichst günstig Ergebnisse zu erzielen.

15. Interaktion mit Künstlichen Intelligenzen

14
In der heutigen Zeit sind Sprachassistenten wie Siri, Cortana oder Alexa für viele Menschen
nicht mehr wegzudenken. Sie erleichtern das alltägliche Leben und tragen dazu bei, z.B. das
Eigenheim “smarter” zu machen.
Auch als alltäglicher Gesprächspartner könnte eine künstliche Intelligenz wie ein
Sprachassistent oder ein Chatbot einen echten Menschen zum Teil ersetzen. So haben
Psychologen an der Stanford University einen Chatbot namens “Woebot” entwickelt. Dieser
Bot soll sich um das Wohlbefinden der Nutzer und um deren Psychisches Wohlbefinden, in
Fachkreisen auch Psychohygiene genannt, zu kümmern. Dies könnte auch für die Zukunft
bedeuten, dass viele der heutigen Social Media als soziales Interaktionsmedium abgeschafft
werden.
Studien zeigen, dass die exzessive Nutzung von Social Media unglücklich und sogar depressiv
machen kann. Vor Allem junge Menschen können von dem, was auf Social Media zu sehen
ist, leicht beeinflusst werden. Und obwohl Facebook und Co. eigentlich für eine bessere
Vernetzung dienen sollten ist leider das Gegenteil der Fall, da einige Menschen lieber die
Zeit am Handy verbringen als persönlich mit Freunden und Anderen zu interagieren.
Der Woebot der Stanford University soll hierbei eine alternative zur Social-Media- Nutzung
darstellen. Er fragt täglich nach dem Wohlbefinden der Nutzer und versucht diese über
Wortspiele und Gespräche aufzumuntern. Gleichzeitig versucht der Bot den psychischen
Zustand des Nutzers zu analysieren und eventuelle Anzeichen für psychische Krankheiten zu
erkennen. Bestimmte Wörter, und die Art wie Wörter benutzt werden, können darüber
Auskunft geben in welchem Zustand sich ein Mensch befindet. So könnten rechtzeitig
Schritte eingeleitet werden um einen depressiven, oder sogar suizidgefährdeten Menschen
zu helfen.

Einfluss auf die Gesellschaft

Zwar sind künstliche Intelligenzen heutzutage noch nicht ausgereift genug um als Partner für
komplexe Gespräche zu dienen, jedoch können sie gewisse Sprachmuster analysieren und
deuten. Sie dienen als Alarmmelder um sich professionelle Hilfe zu suchen. Sie ersetzen
jedoch keinesfalls einen geschulten Psychologen oder Arzt. Dennoch bietet der Woebot
einen Einblick zu was künstliche Intelligenzen später fähig sein könnten. Eine lernende KI die
24 Stunden und sieben Tage die Woche zur verfügung steht, könnte somit schnell als
“bester Freund” fungieren, was gerade für einsame Menschen eine Hilfe darstellen könnte.
Jedoch besteht die Gefahr, dass durch den übermäßigen Kontakt mit einer künstlichen
Intelligenz eben dieser Mensch dem geholfen werden sollte noch mehr in eine soziale
Isolation rückt oder aber ein anderer aus seinem normalen sozialen Umfeld gerissen wird.

Zudem könnte eine Maschine einen Menschen wohl nie vollständig ersetzen. Das “Problem”
liegt hierbei bei der Menschlichkeit. Kann eine Maschine wirklich Empathie und andere
Dinge entwickeln? Und wie fühlt es sich an, sich nur einer künstlichen Intelligenz
anzuvertrauen?

15
16. Enterprise Chatbots

16.1 Was ist ein Chatbot

Chatbots bilden eine Schnittstelle zwischen Menschen und bestimmten Informationen oder
Dienstleistungen. Künstliche Intelligenzen und Chatbots, lassen sich in bestehende
Infrastrukturen integrieren. Ob in eine Homepage, einer App, oder in einem Messenger
dienst wie Slack, WhatsApp, Facebook Messenger oder Telegram, für Chatbots gibt es
mehrere Bezeichnungen AI-Assistent, digitale Assistenten oder virtuelle Assistenten,
allgemein lassen sich die Bezeichnungen sagen, dass es sich um intelligente Software wie
Machine Learning, Deep-Learning handelt, die sich natürlicherweise mit Menschen
miteinander kommunizieren kann.

Gestik, Mimik und Sprache sind die angenehmsten, einfachsten und natürlichsten Formen
der zwischenmenschlichen Kommunikation. Natürliche Sprache vereinfacht die
Kommunikation zwischen Menschen und Maschinen. Viele kennen Chatbots bereits aus
dem Kundensupport, wo ein Popup-Fenster unsere ersten Fragen beantwortet.

Durch künstliche Intelligenz und Chatbots sparen die Unternehmen Geld, Zeit und
Mitarbeiterkosten. Chatbots vermitteln den Eindruck von Intelligenz haben jedoch kein
eigenes Bewusstsein und sind noch nicht in der Lage selbstständig zu denken. Aber es
dauert nicht mehr lange, bis Chatbots die menschliche Interaktion und Wechselwirkung
vollständig steuern können.

Der Mensch ist intelligent und weiß seine Intelligenz einzusetzen. Chatbots werden einfach
genutzt, um Menschen Ressourcen zu sparen, und in was sinnvoll nutzen können.

16.2 die Fünf Bereich, wo in den Chatbots Arbeitsleben verändert hat.

● Digitale Assistenten
● Business Intelligence
● Human Resources
● Projektmanagement
● Marketing

16.3 Die Vorteile von Chatbots zusammengefasst:

16
● 24 Stunden verfügbar
● Kurze Antwortzeiten
● Viele Anfragen gleichzeitig bearbeiten.
● Gewinnung von Kundendaten
● Kosteneinsparpotenzial
● Individuelle User Experience.

Abbildung 5: Ablauf einer voll integrierten Chatbot-Plattform

16.4 Der Einfluss auf die Gesellschaft

Der Einfluss des Chatbots auf die Gesellschaft ist der, dass sie die Arbeitswelt wie wir sie
kennen verändert hat. Sie sind nicht nur ein Hilfsmittel für einzelne Aufgaben, sondern Teil
einer weitaus größeren Strategie. Diese ermöglicht es Prozesse zu automatisieren, Kosten
und Zeit einzusparen und sich auf umsatzfördernde Aktivitäten zu konzentrieren. Mit dem
Einsatz von digitalen Assistenten, Business Intelligence, Human Resources,
Projektmanagement Marketing
Chatbots werden für Unternehmen eine Steigerung ihrer Produktivität, Verkäufe und
Mitarbeiterzufriedenheit erzielen.

17. Text Mining

17.1 Was ist Text Mining

Text Mining, auch oft Text Data Mining genannt, ist der Prozess der Untersuchung großer
Sammlungen von unterschiedlichen Ressourcen wie schriftlicher und mündlicher Sprache.
Mithilfe von Algorithmen werden nützliche und wichtige Informationen aus
verschiedenartigen Dokumentenformaten wie Webseiten, E-Mails, Social Media Posts,

17
Zeitschriftenartikeln usw. zu extrahieren, um neue Informationen zu generieren und den
unstrukturierten Text in strukturierte Daten für die weitere Analyse zu transformieren.

Die Textdaten werden nicht nach bestimmten Informationen gesucht, sondern nach
strukturellen Mustern und Kriterien wie z.B. Trends in der Wortverbreitung, syntaktische
Struktur Ton, Thema, Funktion etc.

17.2 Text Mining Einsetzung

Die Text-Mining-Technologie wird heute von einer Vielzahl von Nutzern, von
Regierungsorganisationen, Forschungseinrichtungen und Unternehmen für ihre täglichen
Bedürfnisse eingesetzt. Hier sind einige Beispiele für den Einsatz in verschiedenen
Bereichen:

● Forschung: z. B. Wissensentdeckung, Medizin/Gesundheitswesen.


● Geschäftstätigkeit: z. B. Risikomanagement, Resume-Filterung.
● Sicherheit: z. B. Anti-Terrorismus - Text-Mining-Analyse von Blogs und anderen
online.
● Täglich, z. B. Spam-Filterung, Social Media Datenanalyse.

Abbildung 6 :Text Miming Steps

17.3 Der Einfluss auf die Gesellschaft

Der Einfluss des Text Mining auf die Gesellschaft ist, dass Text Mining helfen kann, neue und
innovative Technologien in bestimmten Bereichen zu finden. Es ist eine sehr effiziente
Methode zur Anfertigung neuer Informationen und Kenntnisse. Die Praxis ermöglicht es
Unternehmen, den Zeitaufwand für das Lesen großer Texte zu reduzieren. Dadurch können
wichtige Ressourcen schneller und effizienter gefunden werden. Außerdem können die
Benutzer neue Informationen erhalten, die sonst nur schwer zu finden wären.

18
18. Maschinelle Übersetzung

18.1 Was ist Maschinelle Übersetzung

Machine Translation (MT) bezieht sich auf eine vollautomatische Software, die Inhalte in
Zielsprachen übersetzen kann. Menschen können MT verwenden, um Texte und Sprachen in
eine andere Sprache zu übersetzen (übertragen). MT-Software können ohne menschliches
Unterstützung funktionieren.

MT-Tools werden oft verwendet, um große Mengen von Informationen mit Millionen von
Wörtern zu übersetzen, die auf herkömmliche Weise nicht übersetzt werden können. Die
Qualität der MT-Ausgabe kann stark variieren. MT-Systeme erfordern eine "Schulung" in der
gewünschten Domäne und dem gewünschten Sprachpaar, um die Qualität zu erhöhen.

Übersetzungsunternehmen nutzen MT, um die Produktivität ihrer Übersetzer zu steigern,


Kosten zu senken und ihren Kunden Post-Editing-Services anzubieten. Die MT-Nutzung
durch Sprachdienstleister wächst in den letzten Jahren rasant.

Im Jahr 2016 hat SDL - eines der größten Übersetzungsunternehmen der Welt -
angekündigt, dass es mit MT 20 Mal mehr Inhalte übersetzt als mit menschlichen Teams.

18.2 Maschinelles Übersetzungssystem

● Regelbasierte Systeme: stützen sich auf eine Kombination aus Sprachalgorithmen


und Grammatik sowie Wörterbüchern für allgemeines Vokabular.
● statistischen Systemen: ist keine Sprachalgorithmen. Diese Systeme „lernen“ das
Übersetzen stattdessen, indem sie zu jedem Sprachpaar große Datenmengen
analysieren.
● Neuronale Systeme: Auch als NMT bezeichnet, stellen einen neuen Ansatz dar. Die
Maschine lernt in diesem Fall über ein großes neuronales Netzwerk zu übersetzen.

18.3 Maschinelle Übersetzung Vorteile.

Spart viel Zeit


Maschinelle Übersetzung ist viel schneller als menschliche Übersetzung.
Geringere Kosten
Obwohl der Kauf einer Sprachübersetzungssoftware zunächst teuer erscheinen mag, ist sie
eine viel billigere Lösung als die Einstellung eines menschlichen Übersetzers, wenn dieser
nicht ganz benötigt wird.
Fähigkeit zur Übersetzung in viele Sprachen
Eine der großen Stärken der maschinellen Übersetzung ist ihre Fähigkeit, in viele Sprachen
zu übersetzen, manchmal sogar in Hunderte von Sprachen.
Webinhalte & Webseitenübersetzung
Durch die maschinelle Übersetzung sind Webinhalte und Webseiteübersetzungen extrem
einfach geworden. Dies ermöglicht es Personen, die im Web suchen, Webinhalte und Seiten

19
einfach in ihre Muttersprache zu übersetzen, wenn sie auf Inhalten oder Seiten navigieren,
die in einer anderen Sprache verfasst sind.
Ein wesentlicher Vorteil der maschinellen Übersetzung ist die Tatsache, dass viele
Übersetzungssoftware die Fähigkeit haben, sich zu merken und so gängige Wörter und
Phrasen, die in einer bestimmten Branche verwendet werden, wiederzuverwenden.

18.4 Der Einfluss auf die Gesellschaft

Die Maschine zu nutzen, statt Menschen die teuer bezahlt werden müssen! Inzwischen ist
manche MT wie „DeepL“oft besser als manche Humane Übersetzer. Aber auch, wenn durch
neue Erkenntnisse in der Computerlinguistik die Übersetzungsqualität von Maschinen
weiter gesteigert werden kann, sei nicht immer die Qualität gegeben, die durch eine
traditionelle Übersetzung durch einen Experten erreicht wird. Der Tag, an dem ein
Computer einen Humanen Übersetzer ersetzen kann, ist noch sehr weit entfernt. Auf know-
how eines menschlichen Übersetzers wird man noch lange angewiesen sein.

19. Schluss

Unter den global Playern in der Wirtschaft herrscht heutzutage ein Wettrüsten im Bereich
NLP und KI im Allgemeinen. Und das aus gutem Grund.
NLP könnte massive Kosteneinsparungen im Personalwesen bedeuten und gleichzeitig die
Effizienz steigern. Des Weiteren spielt z.B. Text Mining eine große Rolle. Die riesigen
Datenströme die hier entstehen bedeuten hohe Gewinne für die, die sie erheben. Es
könnten darüber neue Trends in der Gesellschaft erfasst werden. Dieses Wissen über einen
gerade entstehenden Trend kann natürlich auch monetarisiert werden.
Während Konzerne im digitalen Bereich auf der ganzen Welt um die Führungsrolle auf
diesem Gebiet kämpfen und so diese Technik rasch voran treiben, hat NLP das Potenzial, das
Leben der Menschen erheblich zu erleichtern und so einen riesigen Mehrwert zu erzeugen.
Ob ein guter Gesprächspartner oder als Hilfe zur Verarbeitung von Datensätzen in
Krankenhäusern, wir werden mehr und mehr Kontakt damit haben.
Bevor es aber soweit ist, gilt es die Zuverlässigkeit in einigen Bereichen, wie Coreference
Resolution, zu erhöhen. All die Ungenauigkeiten hindern den endgültigen Durchbruch und
die vollständige Implementierung in der Gesellschaft. Dennoch gibt es heute schon mehrere
Anwendungsgebiete wo NLP sehr gute Performance aufweist. Will ein Unternehmen z.B.
anhand von Eingaben in Suchmaschinen herausfinden wie sein Ruf ist, kann es dies tun und
sehr gutes Ergebnisse erhalten, weil zum großen Teil nur auf NER zurückgegriffen werden
muss.
Bei unserem derzeitigem Forschungsstand und dem großen Eifer finanzstarker Konzerne,
wird es nur eine Frage von wenigen Jahren sein, bis diese Ungenauigkeiten und
Kinderkrankheiten bei Seite gewischt und der Vergangenheiten angehören werden.

20
WordNet1: WordNet ist eine große lexikalische Datenbank für Englisch. Substantive, Verben, Adjektive und Adverbien sind in Gruppen vo n
Synonymen zusammengefasst, die jeweils ein bestimmtes Konzept ausdrücken. Synonyme werden durch begriffliche, semantische un d
lexikalische Beziehungen miteinander verknüpft. WordNet ist kostenlos und öffentlich zum Download verfügbar. Die Struktur von
WordNet macht es zu einem nützlichen Werkzeug für die Computerlinguistik und die Verarbeitung natürlicher Sprachen .

Determinant2:: Auch Artikelwort genannt

Post-Editing-Services3: Nachbearbeitung von maschinell übersetzten Texten

20 Abkürzungen

NLP Natural Language Processing ...................................................................


AI artifizielle Intelligenz .....................................................................................
MT Machine Translation ...................................................................................
NMT Neural Machine Translation ...................................................................
NER Named Entitiy Recogniton

21. Quellen:
Stemming:
[Link]
[Link]
Lemmatization
[Link]
[Link]
[Link]
[Link]
[Link]
Other Techniques
[Link]
Chatbots
Bild [Link]
[Link]
[Link]
[Link]
Texr Mining
Bild [Link]
[Link]
Maschine Translation
[Link]
[Link]
[Link]
[Link]

21
Coreference Resolution
[Link]
[Link]

Depency Parsing

[Link]

Tokenization

[Link]
[Link]
[Link]

Bild: [Link]
Medizin: [Link]
[Link]
NLG:[Link]
NLG:[Link]
Roboterjournalismus[Link]
Textgenerator für Sportberichte: [Link]
[Link]
Zukunftsaussichten für KIs und momentane Anwendungen
[Link]
[Link]

22

Das könnte Ihnen auch gefallen