0% fanden dieses Dokument nützlich (0 Abstimmungen)
11 Ansichten2 Seiten

KI Aufgabe

Hochgeladen von

Raha Azad
Copyright
© All Rights Reserved
Wir nehmen die Rechte an Inhalten ernst. Wenn Sie vermuten, dass dies Ihr Inhalt ist, beanspruchen Sie ihn hier.
Verfügbare Formate
Als PDF, TXT herunterladen oder online auf Scribd lesen
0% fanden dieses Dokument nützlich (0 Abstimmungen)
11 Ansichten2 Seiten

KI Aufgabe

Hochgeladen von

Raha Azad
Copyright
© All Rights Reserved
Wir nehmen die Rechte an Inhalten ernst. Wenn Sie vermuten, dass dies Ihr Inhalt ist, beanspruchen Sie ihn hier.
Verfügbare Formate
Als PDF, TXT herunterladen oder online auf Scribd lesen

Raha Azad

KI-Aufgabe 7210768

1) Was ist das Problem mit der Accuracy als Performance-Maß, wenn die Klassen sehr
unbalanciert sind? (d.h. die Anzahl der Beispiele, die zu Klasse 1, Klasse 2, .. gehören sehr
unterschiedliche häufig vorkommen)
Es führt dazu, dass unsere Training zu der Klasse mit höhere Anzahlen neigen. Dann kann
man nicht gut Klassifiziren und vorhersagen, deshalb bekommen wir weniger Accuracy beim
Test.
2) Würden Sie bei unbalancierten Klassen eher eine Precision-Recall-Kurve oder eine ROC-
Kurve zur Evaluation nutzen? Oder spielt das "unbalanciert" hierbei gar keine Rolle?
Ich benutze beides, denn bei Precision-Recall-Kurve kann ich genau wissen wie viele Daten
haben False-positive and False-negative berechnet und mit ROC-Kurve kann ich
Visualisieren und sehen wieviel kann ich in diesem Raum die Daten verbessern und
optimieren machen.
3) Was sind die Unterschiede zwischen Multiclass-Classification, Multilabel-Classification
und Multioutput-Classification?
Multiclass-Classification können zwischen mehr als zwei Klassen unterscheiden.
Multilabel-Classification ist ein solches Klassifizierungssystem, das mehrere binäre Tags
ausgibt.
Multioutput- Classification ist einfach eine Verallgemeinerung der Multilabel-Klassifizierung,
bei der jedes Label mehrere Klassen sein kann.
4) Welchen Trainingsalgorithmus für lineare Regression können Sie verwenden, wenn Sie
einen Trainingssatz mit Millionen von Merkmalen haben?
Gradient Descent
Batch Gradient Descent
Stochastic Gradient Descent
Mini-batch Gradient Descent
5) Führen alle Gradientenabstiegsalgorithmen zu demselben Modell, wenn man sie lange
genug laufen lässt? Wenn ja: wann? Wenn nicht: warum?
Nach dem Training gibt es fast keinen Unterschied, und alle diese Algorithmen enden mit
sehr ähnlichen Modellen und treffen Vorhersagen auf genau die gleiche Weise. Sie enden
alle nahe dem Minimum.
6) Welcher Gradientenabstiegsalgorithmus (von den im Buch diskutierten) erreicht die Nähe
der optimalen Lösung am schnellsten? Welcher wird tatsächlich konvergieren? Wie können
Sie dafür sorgen, dass auch die anderen konvergieren?
Der Pfad von Batch GD stoppt tatsächlich am Minimum, während sowohl Stochastic GD als
auch Mini-Batch GD weiter herumlaufen.
Dieser Batch GD benötigt jedoch viel Zeit, um jeden Schritt auszuführen, und Stochastic GD
und Mini-Batch GD würden ebenfalls das Minimum erreichen, wenn Sie einen guten
Lernplan verwenden.
7) Angenommen, Sie verwenden die polynomiale Regression. Sie zeichnen die Lernkurven
auf und stellen fest, dass es eine große Lücke zwischen dem Trainingsfehler und dem
Validierungsfehler gibt. Woran liegt das? Welche drei Möglichkeiten gibt es, dieses Problem
zu lösen?
Das bedeutet, dass das Modell bei den Trainingsdaten deutlich besser abschneidet als bei
den Validierungsdaten, was das Kennzeichen eines Overfitting-Modells ist. Eine Möglichkeit,
ein Overfitting-Modell zu verbessern, besteht darin, es mit mehr Trainingsdaten zu füttern,
bis der Validierungsfehler den Trainingsfehler erreicht. Ein anderer Weg sind Regularisierte
Lineare Modelle.
8) Angenommen, Sie verwenden eine Ridge-Regression und stellen fest, dass der
Trainingsfehler und der Validierungsfehler fast gleich groß und ziemlich hoch sind. Würden
Sie sagen, dass das Modell unter einer hohen Verzerrung oder einer hohen Varianz leidet?
Sollten Sie den Hyperparameter α für die Regularisierung erhöhen oder verringern?
Ja und im nächsten Schritt erhöhe ich α. eine Erhöhung von α führt zu flacheren (d. h.
weniger extremen, vernünftigeren) Vorhersagen; dies reduziert die Varianz des Modells,
erhöht aber seine Bias.
9) Warum/wann sollten Sie folgendes benutzen:
- Ridge-Regression anstelle einer einfachen linearen
Regression (d. h. ohne jegliche Regularisierung)?
Wenn wir ein lineares Modell regularisieren wollen
- Lasso anstelle von Ridge-Regression?
Die Lasso-Regression kann für die automatische Merkmalsauswahl verwendet werden
- Elastic Net anstelle von Lasso?
Wenn wir mehrere stark korrelierte Variablen haben

Das könnte Ihnen auch gefallen