Transformer und Large Language Models Klausurvorbereitung
Diese Lernkarteien dienen der Vorbereitung auf Klausuren zu Transformatoren und großen Sprachmodellen in der Informatik. Sie bieten eine umfassende Sammlung von Begriffen und deren Erklärungen, die für das Verständnis dieser Themen erforderlich sind.
Quiz(44 vragen)
1. Was beschreibt die Hauptfunktion eines Transformers?
Termen in deze set(44)
Grundlagen der Transformer-Architektur(16)
Was ist ein Transformer?
Eine Architektur für sequenzielle Datenverarbeitung, die auf Selbstaufmerksamkeit basiert.
Selbstaufmerksamkeit
Ein Mechanismus, der es dem Modell ermöglicht, relevante Teile der Eingabe zu gewichten und zu betonen.
Die Rolle der Encoder im Transformer
Encoder wandeln Eingabesequenzen in ein latentes Repräsentationsformat um.
Die Rolle der Decoder im Transformer
Decoder generieren aus latenten Repräsentationen Ausgabesequenzen, meist Schritt für Schritt.
True or False: Transformers benötigen RNNs.
False: Transformers benötigen keine rekursiven Netzwerke, da sie auf Selbstaufmerksamkeit basieren.
Was ist die Hauptinnovation von Transformers?
Der Einsatz von Selbstaufmerksamkeit anstelle von rekursiven oder konvolutionalen Strukturen.
Punktuelle Aufmerksamkeit vs. globale Aufmerksamkeit
Punktuelle Aufmerksamkeit fokussiert auf spezifische Eingaben, globale Aufmerksamkeit bezieht sich auf die gesamte Eingabesequenz.
Was sind Positionskodierungen?
Zusätzliche Informationen, die den Positionen von Wörtern in der Sequenz zugeordnet werden, um Reihenfolge zu berücksichtigen.
Wie funktioniert der Multi-Head-Attention-Mechanismus?
Er kombiniert mehrere Aufmerksamkeitsmechanismen, um verschiedene Aspekte der Eingabe zu erfassen.
Die Bedeutung von Normalisierung im Transformer
Normalisierung stabilisiert das Lernen und verbessert die Konvergenzgeschwindigkeit der Modelle.
Wie viele Schichten hat ein typischer Transformer?
Ein typischer Transformer hat mehrere Encoder- und Decoder-Schichten, oft zwischen 6 und 12.
Was ist der Feed-Forward-Netzwerk im Transformer?
Ein neuronales Netzwerk, das die Ausgaben der Aufmerksamkeitsschichten weiterverarbeitet.
Fill in the blank: Der Transformer wurde 2017 in der Arbeit _____ veröffentlicht.
"Attention is All You Need".
Wofür stehen die Abkürzungen Q, K und V?
Q: Query, K: Key, V: Value – zentrale Konzepte in der Selbstaufmerksamkeit.
Die Rolle der Dropout-Technik im Transformer
Dropout verhindert Überanpassung, indem es zufällig Verbindungen während des Trainings deaktiviert.
Was macht die Architektur skalierbar?
Die parallele Verarbeitung von Daten ermöglicht eine schnelle Skalierung auf große Datensätze.
Large Language Models (LLMs)(16)
Was sind große Sprachmodelle (LLMs)?
LLMs sind KI-Modelle, die natürliche Sprache verstehen und generieren können. Sie basieren häufig auf tiefen neuronalen Netzwerken.
Nenne ein Beispiel für ein LLM.
Ein bekanntes Beispiel ist GPT-3, das von OpenAI entwickelt wurde und für verschiedene Anwendungen in der Textgenerierung verwendet wird.
Vervollständige: LLMs verwenden ____ zur Verarbeitung von Sprache.
Transformatoren, die auf Selbstaufmerksamkeit basieren.
True or False: LLMs können keine kontextabhängigen Antworten geben.
False. LLMs nutzen Kontextinformationen, um relevante Antworten zu generieren.
Was ist Transferlernen in LLMs?
Transferlernen ermöglicht es, ein vortrainiertes Modell auf neue Aufgaben anzupassen, indem es mit spezifischen Daten feinabgestimmt wird.
Vergleiche BERT und GPT.
BERT ist ein bidirektionales Modell, das für Textverständnis entwickelt wurde. GPT ist unidirektional und optimiert für Textgenerierung.
Wie beeinflussen LLMs die Textgenerierung?
LLMs erzeugen kohärente und kontextrelevante Texte, indem sie Wahrscheinlichkeiten für die nächsten Wörter basierend auf vorherigen Wörtern berechnen.
Was ist eine Tokenisierung?
Tokenisierung ist der Prozess, bei dem Text in kleinere Einheiten (Tokens) zerlegt wird, die von LLMs verarbeitet werden können.
Nenne eine Anwendung von LLMs.
Chatbots, die in der Kundenbetreuung eingesetzt werden, um automatisierte Antworten zu generieren.
Was sind Eingabesequenzen in LLMs?
Eingabesequenzen sind die Texte, die in das Modell eingegeben werden, um Vorhersagen oder Textgenerierungen zu erhalten.
Was ist die Rolle von Hyperparametern in LLMs?
Hyperparameter sind Parameter, die das Lernverhalten eines Modells steuern, z. B. Lernrate und Batch-Größe.
True or False: LLMs benötigen keine großen Datenmengen zum Training.
False. LLMs erfordern große Mengen an Trainingsdaten, um ein gutes Verständnis der Sprache zu entwickeln.
Was sind die Herausforderungen von LLMs?
Herausforderungen sind Verzerrungen in den Trainingsdaten, hoher Rechenaufwand und Schwierigkeiten bei der Interpretation der Modelle.
Was versteht man unter 'Few-Shot Learning' bei LLMs?
Few-Shot Learning bezeichnet die Fähigkeit eines Modells, mit wenigen Beispielen eine neue Aufgabe zu erlernen oder auszuführen.
Wie erfolgt die Evaluierung von LLMs?
Die Evaluierung erfolgt durch Metriken wie Perplexität, BLEU-Score oder durch menschliche Bewertungen der Textqualität.
Nenne einen Vorteil von LLMs.
LLMs können vielseitige Anwendungen unterstützen, von Textgenerierung bis zur Beantwortung komplexer Fragen.
Training und Feinabstimmung von Modellen(12)
Überwachtes Lernen
Eine Trainingsmethode, bei der das Modell anhand von beschrifteten Daten lernt. - Beispiel: Klassifikation.
Was ist Feinabstimmung?
Der Prozess, ein bereits trainiertes Modell an spezifische Aufgaben anzupassen, um die Leistung zu verbessern.
Epochen
Ein vollständiger Durchlauf durch den gesamten Trainingsdatensatz. Mehr Epochen können zu besserem Lernen führen, aber auch zu Überanpassung.
Stochastischer Gradientabstieg
Ein Optimierungsverfahren, das zur Minimierung der Fehlerfunktion verwendet wird, indem die Gewichte schrittweise angepasst werden.
Was sind Hyperparameter?
Parameter, die vor dem Training festgelegt werden, wie Lernrate oder Anzahl der Schichten. Sie beeinflussen das Lernverhalten.
True or False: Überanpassung ist immer unerwünscht.
True. Sie führt dazu, dass das Modell gut auf Trainingsdaten, aber schlecht auf neuen Daten performt.
Transferlernen
Ein Ansatz, bei dem Wissen aus einem Aufgabenbereich auf einen anderen übertragen wird, um die Lernzeit zu verkürzen.
Was bewirkt eine zu hohe Lernrate?
Das Modell könnte den optimalen Punkt überschreiten und instabil werden. - Risiko: Schlechtes Training.
Batch-Größe
Die Anzahl der Trainingsbeispiele, die in einem Schritt verwendet werden. Kleine Batches können zu besserem Lernen führen.
Kreuzvalidierung
Eine Technik zur Bewertung der Modellleistung, bei der der Datensatz in mehrere Teile aufgeteilt wird, um Überanpassung zu vermeiden.
Was ist die Verlustfunktion?
Eine mathematische Funktion, die den Unterschied zwischen den vorhergesagten und tatsächlichen Werten misst. - Ziel: Minimierung.
Dropout
Eine Regularisierungstechnik, bei der zufällig Neuronen während des Trainings deaktiviert werden, um Überanpassung zu vermeiden.
Vragen in deze set(44)
1. Was beschreibt die Hauptfunktion eines Transformers?
2. Was versteht man unter überwachten Lernen?
3. Was sind die Hauptmerkmale von großen Sprachmodellen?
4. Was ist das Ziel der Selbstaufmerksamkeit?
5. Was ist Feinabstimmung?
6. Welches dieser Modelle ist ein Beispiel für ein LLM?
7. Welche Aufgabe haben die Encoder in einem Transformer?
8. Was sind Epochen im Kontext des Modelltrainings?
9. Was beschreibt den Prozess der Tokenisierung?
10. Was ist die Hauptfunktion der Decoder im Transformer?
11. Was beschreibt der stochastische Gradientabstieg?
12. Welches dieser Modelle ist bidirektional?
13. True or False: Transformers sind auf rekursive Netzwerke angewiesen.
14. Welche der folgenden Optionen sind Hyperparameter?
15. Was ist Transferlernen in LLMs?
16. Was ist die zentrale Innovation der Transformer-Architektur?
17. Was passiert, wenn ein Modell überangepasst ist?
18. Welches dieser Konzepte beschreibt die Fähigkeit von LLMs, mit wenigen Beispielen zu lernen?
19. Was ist der Unterschied zwischen punktueller und globaler Aufmerksamkeit?
20. Was ist Transferlernen?
21. Welche Rolle spielen Hyperparameter in LLMs?
22. Wofür sind Positionskodierungen notwendig?
23. Welche Auswirkung hat eine zu hohe Lernrate?
24. Was ist eine typische Anwendung von LLMs?
25. Wie funktioniert der Multi-Head-Attention-Mechanismus?
26. Was beschreibt die Batch-Größe?
27. Welche dieser Aussagen über LLMs ist falsch?
28. Warum ist Normalisierung im Transformer wichtig?
29. Was ist Kreuzvalidierung?
30. Wie beeinflussen LLMs die Textgenerierung?
31. Wie viele Schichten hat ein typischer Transformer?
32. Was ist die Verlustfunktion?
33. Was ist eine Herausforderung bei LLMs?
34. Was ist das Feed-Forward-Netzwerk im Transformer?
35. Was ist Dropout?
36. Welches dieser Merkmale beschreibt ein unidirektionales Modell?
37. Der Transformer wurde 2017 in der Arbeit _____ veröffentlicht.
38. Wie erfolgt die Evaluierung von LLMs?
39. Wofür stehen die Abkürzungen Q, K und V im Kontext von Transformers?
40. Welche Aussage trifft auf das Training von LLMs zu?
41. Welche Rolle spielt die Dropout-Technik im Transformer?
42. Welche Aussage beschreibt am besten 'Few-Shot Learning' in großen Sprachmodellen?
43. Was macht die Architektur eines Transformers skalierbar?
44. Welche dieser Optionen hat keinen Einfluss auf die Leistung von LLMs?
Gerelateerde sets
Test: KI und ein normales Programm
Trainingsdaten und Bias Notizen
Entscheidungsbäume Machine Learning Klausurvorbereitung
Backpropagation neuronale Netze Prüfungsfragen
k-Means Clustering Karteikarten
Abitur neuronales Netz Idee
Überwachtes und unüberwachtes Lernen Prüfungsfragen
Was maschinelles Lernen macht Schritt für Schritt
Maak je eigen studieset
Upload een PDF, plak je notities of beschrijf een onderwerp – AI genereert flashcards, quizzen en meer in seconden.

