Transformer und Large Language Models Klausurvorbereitung

Diese Lernkarteien dienen der Vorbereitung auf Klausuren zu Transformatoren und großen Sprachmodellen in der Informatik. Sie bieten eine umfassende Sammlung von Begriffen und deren Erklärungen, die für das Verständnis dieser Themen erforderlich sind.

LucaNeumann69·44 flashcards·44 questions
Studiumcomputer_scienceai_ml
0
Known
1 / 44
0
Learning
Front

Was ist ein Transformer?

Tap to flip
Back

Eine Architektur für sequenzielle Datenverarbeitung, die auf Selbstaufmerksamkeit basiert.

Tap to flip
Got it
Still learning

Quiz(44 questions)

Question 1 of 44

1. Was beschreibt die Hauptfunktion eines Transformers?

Terms in this Study Set(44)

Grundlagen der Transformer-Architektur(16)

Was ist ein Transformer?

Eine Architektur für sequenzielle Datenverarbeitung, die auf Selbstaufmerksamkeit basiert.

Selbstaufmerksamkeit

Ein Mechanismus, der es dem Modell ermöglicht, relevante Teile der Eingabe zu gewichten und zu betonen.

Die Rolle der Encoder im Transformer

Encoder wandeln Eingabesequenzen in ein latentes Repräsentationsformat um.

Die Rolle der Decoder im Transformer

Decoder generieren aus latenten Repräsentationen Ausgabesequenzen, meist Schritt für Schritt.

True or False: Transformers benötigen RNNs.

False: Transformers benötigen keine rekursiven Netzwerke, da sie auf Selbstaufmerksamkeit basieren.

Was ist die Hauptinnovation von Transformers?

Der Einsatz von Selbstaufmerksamkeit anstelle von rekursiven oder konvolutionalen Strukturen.

Punktuelle Aufmerksamkeit vs. globale Aufmerksamkeit

Punktuelle Aufmerksamkeit fokussiert auf spezifische Eingaben, globale Aufmerksamkeit bezieht sich auf die gesamte Eingabesequenz.

Was sind Positionskodierungen?

Zusätzliche Informationen, die den Positionen von Wörtern in der Sequenz zugeordnet werden, um Reihenfolge zu berücksichtigen.

Wie funktioniert der Multi-Head-Attention-Mechanismus?

Er kombiniert mehrere Aufmerksamkeitsmechanismen, um verschiedene Aspekte der Eingabe zu erfassen.

Die Bedeutung von Normalisierung im Transformer

Normalisierung stabilisiert das Lernen und verbessert die Konvergenzgeschwindigkeit der Modelle.

Wie viele Schichten hat ein typischer Transformer?

Ein typischer Transformer hat mehrere Encoder- und Decoder-Schichten, oft zwischen 6 und 12.

Was ist der Feed-Forward-Netzwerk im Transformer?

Ein neuronales Netzwerk, das die Ausgaben der Aufmerksamkeitsschichten weiterverarbeitet.

Fill in the blank: Der Transformer wurde 2017 in der Arbeit _____ veröffentlicht.

"Attention is All You Need".

Wofür stehen die Abkürzungen Q, K und V?

Q: Query, K: Key, V: Value – zentrale Konzepte in der Selbstaufmerksamkeit.

Die Rolle der Dropout-Technik im Transformer

Dropout verhindert Überanpassung, indem es zufällig Verbindungen während des Trainings deaktiviert.

Was macht die Architektur skalierbar?

Die parallele Verarbeitung von Daten ermöglicht eine schnelle Skalierung auf große Datensätze.

Large Language Models (LLMs)(16)

Was sind große Sprachmodelle (LLMs)?

LLMs sind KI-Modelle, die natürliche Sprache verstehen und generieren können. Sie basieren häufig auf tiefen neuronalen Netzwerken.

Nenne ein Beispiel für ein LLM.

Ein bekanntes Beispiel ist GPT-3, das von OpenAI entwickelt wurde und für verschiedene Anwendungen in der Textgenerierung verwendet wird.

Vervollständige: LLMs verwenden ____ zur Verarbeitung von Sprache.

Transformatoren, die auf Selbstaufmerksamkeit basieren.

True or False: LLMs können keine kontextabhängigen Antworten geben.

False. LLMs nutzen Kontextinformationen, um relevante Antworten zu generieren.

Was ist Transferlernen in LLMs?

Transferlernen ermöglicht es, ein vortrainiertes Modell auf neue Aufgaben anzupassen, indem es mit spezifischen Daten feinabgestimmt wird.

Vergleiche BERT und GPT.

BERT ist ein bidirektionales Modell, das für Textverständnis entwickelt wurde. GPT ist unidirektional und optimiert für Textgenerierung.

Wie beeinflussen LLMs die Textgenerierung?

LLMs erzeugen kohärente und kontextrelevante Texte, indem sie Wahrscheinlichkeiten für die nächsten Wörter basierend auf vorherigen Wörtern berechnen.

Was ist eine Tokenisierung?

Tokenisierung ist der Prozess, bei dem Text in kleinere Einheiten (Tokens) zerlegt wird, die von LLMs verarbeitet werden können.

Nenne eine Anwendung von LLMs.

Chatbots, die in der Kundenbetreuung eingesetzt werden, um automatisierte Antworten zu generieren.

Was sind Eingabesequenzen in LLMs?

Eingabesequenzen sind die Texte, die in das Modell eingegeben werden, um Vorhersagen oder Textgenerierungen zu erhalten.

Was ist die Rolle von Hyperparametern in LLMs?

Hyperparameter sind Parameter, die das Lernverhalten eines Modells steuern, z. B. Lernrate und Batch-Größe.

True or False: LLMs benötigen keine großen Datenmengen zum Training.

False. LLMs erfordern große Mengen an Trainingsdaten, um ein gutes Verständnis der Sprache zu entwickeln.

Was sind die Herausforderungen von LLMs?

Herausforderungen sind Verzerrungen in den Trainingsdaten, hoher Rechenaufwand und Schwierigkeiten bei der Interpretation der Modelle.

Was versteht man unter 'Few-Shot Learning' bei LLMs?

Few-Shot Learning bezeichnet die Fähigkeit eines Modells, mit wenigen Beispielen eine neue Aufgabe zu erlernen oder auszuführen.

Wie erfolgt die Evaluierung von LLMs?

Die Evaluierung erfolgt durch Metriken wie Perplexität, BLEU-Score oder durch menschliche Bewertungen der Textqualität.

Nenne einen Vorteil von LLMs.

LLMs können vielseitige Anwendungen unterstützen, von Textgenerierung bis zur Beantwortung komplexer Fragen.

Training und Feinabstimmung von Modellen(12)

Überwachtes Lernen

Eine Trainingsmethode, bei der das Modell anhand von beschrifteten Daten lernt. - Beispiel: Klassifikation.

Was ist Feinabstimmung?

Der Prozess, ein bereits trainiertes Modell an spezifische Aufgaben anzupassen, um die Leistung zu verbessern.

Epochen

Ein vollständiger Durchlauf durch den gesamten Trainingsdatensatz. Mehr Epochen können zu besserem Lernen führen, aber auch zu Überanpassung.

Stochastischer Gradientabstieg

Ein Optimierungsverfahren, das zur Minimierung der Fehlerfunktion verwendet wird, indem die Gewichte schrittweise angepasst werden.

Was sind Hyperparameter?

Parameter, die vor dem Training festgelegt werden, wie Lernrate oder Anzahl der Schichten. Sie beeinflussen das Lernverhalten.

True or False: Überanpassung ist immer unerwünscht.

True. Sie führt dazu, dass das Modell gut auf Trainingsdaten, aber schlecht auf neuen Daten performt.

Transferlernen

Ein Ansatz, bei dem Wissen aus einem Aufgabenbereich auf einen anderen übertragen wird, um die Lernzeit zu verkürzen.

Was bewirkt eine zu hohe Lernrate?

Das Modell könnte den optimalen Punkt überschreiten und instabil werden. - Risiko: Schlechtes Training.

Batch-Größe

Die Anzahl der Trainingsbeispiele, die in einem Schritt verwendet werden. Kleine Batches können zu besserem Lernen führen.

Kreuzvalidierung

Eine Technik zur Bewertung der Modellleistung, bei der der Datensatz in mehrere Teile aufgeteilt wird, um Überanpassung zu vermeiden.

Was ist die Verlustfunktion?

Eine mathematische Funktion, die den Unterschied zwischen den vorhergesagten und tatsächlichen Werten misst. - Ziel: Minimierung.

Dropout

Eine Regularisierungstechnik, bei der zufällig Neuronen während des Trainings deaktiviert werden, um Überanpassung zu vermeiden.

Questions in this Study Set(44)

1. Was beschreibt die Hauptfunktion eines Transformers?

A.Verarbeitung von sequenziellen Daten durch Selbstaufmerksamkeit
B.Verwendung von rekursiven Netzwerken zur Datenverarbeitung
C.Erstellung von Bildern aus Text
D.Entwicklung von physischen Roboterbewegungen

2. Was versteht man unter überwachten Lernen?

A.Eine Trainingsmethode mit beschrifteten Daten
B.Eine Methode zur Datenvorverarbeitung
C.Ein Verfahren zur Optimierung von Hyperparametern
D.Eine Technik zum Transferlernen

3. Was sind die Hauptmerkmale von großen Sprachmodellen?

A.Sie verstehen und generieren natürliche Sprache.
B.Sie sind auf einfache mathematische Probleme spezialisiert.
C.Sie benötigen keine Daten zum Training.
D.Sie sind immer ungenau.

4. Was ist das Ziel der Selbstaufmerksamkeit?

A.Relevante Teile der Eingabe zu gewichten
B.Die gesamte Eingabe gleichzeitig zu verarbeiten
C.Die Komplexität des Modells zu erhöhen
D.Eingabesequenzen zu reduzieren

5. Was ist Feinabstimmung?

A.Das Training eines Modells ohne Daten
B.Der Prozess, ein Modell an spezifische Aufgaben anzupassen
C.Die Auswahl von Hyperparametern
D.Der erste Schritt im Trainingsprozess

6. Welches dieser Modelle ist ein Beispiel für ein LLM?

A.GPT-3
B.SVM
C.KNN
D.Naive Bayes

7. Welche Aufgabe haben die Encoder in einem Transformer?

A.Eingabesequenzen in latente Repräsentationen umzuwandeln
B.Ausgabesequenzen zu generieren
C.Die Selbstaufmerksamkeit zu steuern
D.Die Architektur zu optimieren

8. Was sind Epochen im Kontext des Modelltrainings?

A.Die Anzahl der Modelle, die trainiert werden
B.Ein vollständiger Durchlauf durch den gesamten Datensatz
C.Die Anzahl der Fehler, die während des Trainings auftreten
D.Die Anzahl der Neuronen in einem Netzwerk

9. Was beschreibt den Prozess der Tokenisierung?

A.Die Zerlegung von Text in kleinere Einheiten.
B.Die Erhöhung der Trainingsdatenmenge.
C.Die Durchführung von mathematischen Berechnungen.
D.Die Speicherung der Modelle auf Servern.

10. Was ist die Hauptfunktion der Decoder im Transformer?

A.Generierung von Ausgabesequenzen aus latenten Repräsentationen
B.Datenvorverarbeitung
C.Erstellung von Trainingsdaten
D.Anpassung der Hyperparameter

11. Was beschreibt der stochastische Gradientabstieg?

A.Ein Verfahren zur Erhöhung der Batch-Größe
B.Ein Optimierungsverfahren zur Minimierung der Fehlerfunktion
C.Eine Technik zur Datenaufteilung
D.Ein Ansatz zur Hyperparameteroptimierung

12. Welches dieser Modelle ist bidirektional?

A.BERT
B.GPT-2
C.LSTM
D.RNN

13. True or False: Transformers sind auf rekursive Netzwerke angewiesen.

A.Wahr
B.Falsch
C.Teilweise wahr
D.Unbekannt

14. Welche der folgenden Optionen sind Hyperparameter?

A.Die Anzahl der Trainingsdaten
B.Die Anzahl der Schichten im Netzwerk
C.Die Vorhersagen des Modells
D.Die Werte der Gewichte

15. Was ist Transferlernen in LLMs?

A.Die Anpassung eines vortrainierten Modells an neue Aufgaben.
B.Die Erhöhung der Komplexität eines Modells.
C.Das Entfernen von überflüssigen Daten.
D.Die Reduzierung der Anzahl von Schichten im Modell.

16. Was ist die zentrale Innovation der Transformer-Architektur?

A.Einsatz von Selbstaufmerksamkeit
B.Verwendung von rekursiven Strukturen
C.Integration von Bildverarbeitung
D.Komplexe Matrizenmanipulationen

17. Was passiert, wenn ein Modell überangepasst ist?

A.Es performt gut auf Trainingsdaten, schlecht auf neuen Daten
B.Es ist robust gegen neue Daten
C.Es hat niedrigere Trainingsgeschwindigkeit
D.Es benötigt weniger Speicher

18. Welches dieser Konzepte beschreibt die Fähigkeit von LLMs, mit wenigen Beispielen zu lernen?

A.Few-Shot Learning
B.Deep Learning
C.Transfer Learning
D.One-Shot Learning

19. Was ist der Unterschied zwischen punktueller und globaler Aufmerksamkeit?

A.Punktuelle Aufmerksamkeit fokussiert auf spezifische Teile, globale umfasst die gesamte Sequenz
B.Punktuelle Aufmerksamkeit ist schneller
C.Globale Aufmerksamkeit ist effizienter
D.Es gibt keinen Unterschied

20. Was ist Transferlernen?

A.Ein Ansatz, um Modelle von Grund auf neu zu trainieren
B.Die Übertragung von Wissen aus einem Aufgabenbereich auf einen anderen
C.Ein Prozess zur Erhöhung der Batch-Größe
D.Eine Methode zur Erhöhung der Epochenanzahl

21. Welche Rolle spielen Hyperparameter in LLMs?

A.Sie steuern das Lernverhalten des Modells.
B.Sie erhöhen die Anzahl der Trainingsdaten.
C.Sie ersetzen das Modell selbst.
D.Sie verbessern die Benutzeroberfläche.

22. Wofür sind Positionskodierungen notwendig?

A.Um die Reihenfolge der Wörter zu berücksichtigen
B.Um die Eingabedaten zu komprimieren
C.Um die Berechnungen zu beschleunigen
D.Um die Ausgabe zu verbessern

23. Welche Auswirkung hat eine zu hohe Lernrate?

A.Das Modell lernt schneller
B.Das Modell wird instabil und übersteigt den optimalen Punkt
C.Es hat keinen Einfluss auf das Training
D.Das Modell wird genauer

24. Was ist eine typische Anwendung von LLMs?

A.Chatbots zur Kundenbetreuung.
B.Einfache Berechnungen.
C.Bildverarbeitung.
D.Hardwaresteuerung.

25. Wie funktioniert der Multi-Head-Attention-Mechanismus?

A.Er kombiniert mehrere Aufmerksamkeitsmechanismen
B.Er nutzt nur eine Quelle für die Aufmerksamkeit
C.Er ist ineffizient und wird selten verwendet
D.Er reduziert die Verarbeitungsgeschwindigkeit

26. Was beschreibt die Batch-Größe?

A.Die Anzahl der Neuronen im Netzwerk
B.Die Anzahl der Trainingsbeispiele pro Schritt
C.Die Gesamtzahl der Epochen
D.Die Anzahl der Hyperparameter

27. Welche dieser Aussagen über LLMs ist falsch?

A.LLMs benötigen große Datenmengen zum Training.
B.LLMs können kontextabhängige Antworten geben.
C.LLMs sind immer fehlerfrei.
D.LLMs verwenden Transformatoren.

28. Warum ist Normalisierung im Transformer wichtig?

A.Sie stabilisiert das Lernen und verbessert die Konvergenzgeschwindigkeit
B.Sie reduziert die Anzahl der Parameter
C.Sie vereinfacht die Architektur
D.Sie fördert Überanpassung

29. Was ist Kreuzvalidierung?

A.Eine Technik zur Erhöhung der Epochen
B.Eine Methode zur Datenaufteilung zur Bewertung der Modellleistung
C.Ein Verfahren zur Anpassung der Lernrate
D.Eine Technik zur Verbesserung der Hyperparameter

30. Wie beeinflussen LLMs die Textgenerierung?

A.Sie berechnen Wahrscheinlichkeiten für nächste Wörter.
B.Sie ignorieren vorherige Kontexte.
C.Sie sind nur für kurze Texte geeignet.
D.Sie benötigen keine Vorverarbeitung.

31. Wie viele Schichten hat ein typischer Transformer?

A.Zwischen 6 und 12
B.Nur eine
C.Bis zu 20
D.Es gibt keine festen Regeln

32. Was ist die Verlustfunktion?

A.Ein Maß für die Modellkomplexität
B.Eine Funktion zur Messung des Unterschieds zwischen Vorhersagen und tatsächlichen Werten
C.Eine Technik zur Hyperparameteroptimierung
D.Ein Verfahren zur Trainingsdatennormalisierung

33. Was ist eine Herausforderung bei LLMs?

A.Verzerrungen in den Trainingsdaten.
B.Geringer Rechenaufwand.
C.Einfachheit in der Datenverarbeitung.
D.Mangelnde Relevanz.

34. Was ist das Feed-Forward-Netzwerk im Transformer?

A.Ein neuronales Netzwerk zur Weiterverarbeitung von Ausgaben
B.Ein Mechanismus zur Eingabeverarbeitung
C.Eine Technik zur Reduzierung von Dimensionen
D.Ein Teil des Encoder-Systems

35. Was ist Dropout?

A.Eine Technik zur Erhöhung der Epochendauer
B.Eine Regularisierungstechnik zur Vermeidung von Überanpassung
C.Ein Verfahren zur Erhöhung der Batch-Größe
D.Eine Methode zur Vorverarbeitung von Daten

36. Welches dieser Merkmale beschreibt ein unidirektionales Modell?

A.GPT
B.BERT
C.XLNet
D.ELECTRA

37. Der Transformer wurde 2017 in der Arbeit _____ veröffentlicht.

A."Attention is All You Need"
B."Deep Learning for NLP"
C."Understanding Transformers"
D."Neural Networks Unleashed"

38. Wie erfolgt die Evaluierung von LLMs?

A.Durch Metriken wie Perplexität und BLEU-Score.
B.Durch einfache Benutzerbewertungen.
C.Durch zufällige Tests.
D.Durch die Anzahl der Wörter.

39. Wofür stehen die Abkürzungen Q, K und V im Kontext von Transformers?

A.Query, Key, Value
B.Question, Knowledge, Vector
C.Quality, Kind, Variation
D.Queue, Kernel, Volume

40. Welche Aussage trifft auf das Training von LLMs zu?

A.Es erfordert große Mengen an Trainingsdaten.
B.Es kann ohne Daten erfolgen.
C.Es benötigt keine Hyperparameter.
D.Es ist immer schnell.

41. Welche Rolle spielt die Dropout-Technik im Transformer?

A.Vorbeugung von Überanpassung durch zufällige Deaktivierung
B.Erhöhung der Genauigkeit
C.Verbesserung der Komplexität
D.Reduzierung der Trainingszeit

42. Welche Aussage beschreibt am besten 'Few-Shot Learning' in großen Sprachmodellen?

A.Es ermöglicht Modellen, mit wenigen Beispielen zu lernen.
B.Es erfordert viele Beispiele zum Lernen.
C.Es bezieht sich auf das Training mit unstrukturierten Daten.
D.Es ist eine Technik zur Verbesserung der Rechenleistung.

43. Was macht die Architektur eines Transformers skalierbar?

A.Parallele Verarbeitung von Daten
B.Einfache Struktur
C.Geringe Anzahl an Parametern
D.Niedrige Lernrate

44. Welche dieser Optionen hat keinen Einfluss auf die Leistung von LLMs?

A.Die Qualität der Trainingsdaten
B.Die Anzahl der verfügbaren Trainingsdaten
C.Die verwendete Programmiersprache
D.Die Hyperparameter des Modells

Related Study Sets

Create Your Own Study Set

Upload a PDF, paste your notes, or describe a topic – AI generates flashcards, quizzes and more in seconds.