naturlig språkbehandling AI begrippen

En samling av viktiga begrepp inom naturlig språkbehandling (NLP) och AI, avsedd för studenter på universitetsnivå. Denna lista hjälper till att förstå de grundläggande termer och koncept som används inom området.

OscarWolf·36 flashcards·36 frågor
universitetcomputer_scienceai_ml
0
Kan
1 / 36
0
Övar
Framsida

Tokenisering →

Tryck för att vända
Baksida

Processen att dela text i mindre enheter, som ord eller fraser, kallade token.

Tryck för att vända
Kan
Övar fortfarande

Quiz(36 frågor)

Fråga 1 av 36

1. Vad beskriver bäst Korpusspråk?

Begrepp i det här studiesetet(36)

Grundläggande begrepp inom NLP(16)

Tokenisering →

Processen att dela text i mindre enheter, som ord eller fraser, kallade token.

Vad är en språkmodell?

En algoritm som förutsäger sannolikheten för nästa ord i en sekvens baserat på föregående ord.

Stoppord →

Ord som ofta utesluts i språkanalys, som "och", "är" och "att".

Syntaktisk analys vs. Semantisk analys:

Syntaktisk analys fokuserar på strukturen av meningar, medan semantisk analys handlar om betydelsen av orden.

Vad mäter BLEU?

En metod för att utvärdera kvaliteten av maskinöversättning genom att jämföra med referensöversättningar.

Lemmatization →

Processen att reducera ett ord till dess grundform, t.ex. "gått" till "gå".

Vad är en korpus?

En stor och strukturerad uppsättning av texter som används för språklig analys och träning av modeller.

Vad är NER?

Named Entity Recognition, en teknik för att identifiera och klassificera entiteter i text, såsom namn, platser och datum.

Kontekstuell inbäddning →

Representation av ord i en vektorform som beaktar kontexten i vilken ordet förekommer.

Saknar ord, fyll i: NLP står för _____

Naturlig språkbehandling.

Vad är sentimentanalys?

En metod för att bedöma känslan eller attityden som uttrycks i en text, ofta som positiv, negativ eller neutral.

Vad innebär ordvektorer?

Matematisk representation av ord i ett fler-dimensionellt rum, vilket gör att liknande ord ligger nära varandra.

True or False: NLP kan inte hantera slang.

False – NLP kan tränas att förstå slang genom att använda relevanta datakällor.

Vad är maskinöversättning?

Automatisk översättning av text från ett språk till ett annat med hjälp av algoritmer och modeller.

Vad är en transformer?

En typ av neural nätverksarkitektur som revolutionerade NLP, särskilt för uppgifter som översättning och textgenerering.

True or False: Tokenisering är en första steg i NLP.

True – Tokenisering är ofta det första steget i att bearbeta text för NLP.

Maskininlärning för NLP(12)

Övervakad inlärning

Maskininlärning där modellen tränas på märkta data. Exempel: klassificering av e-post som skräppost eller inte.

Icke-övervakad inlärning

Träning på omärkta data för att identifiera mönster. Används för klusteranalys.

Transformer-modell

Arkitektur som revolutionerade NLP. Använder självadresserande mekanismer för att hantera sekvenser av data.

Vad är Word Embeddings?

Representation av ord i en kontinuerlig vektorform. Exempel: Word2Vec, GloVe.

Sentimentanalys

Processen att bedöma känslor i text. Används för att förstå åsikter i sociala medier.

True or False: NLP använder alltid övervakad inlärning.

False. NLP kan använda både övervakad och icke-övervakad inlärning.

Vad är en neuronnät?

En modell inspirerad av hjärnans neuroner, används för att lösa komplexa uppgifter inom NLP.

Korsvalidering

Metod för att utvärdera en models prestanda genom att dela data i tränings- och testset.

Fill in the blank: Maskininlärning för NLP inkluderar ____ och ____.

övervakad inlärning, icke-övervakad inlärning

Vad är en RNN?

Recurrent Neural Network, en typ av neuronnät som är speciellt utformad för att bearbeta sekvenser av data.

Transfer learning

Teknik där en modell tränad på en uppgift används för en annan, relaterad uppgift. Vanligt i NLP.

Precision vs. Återkallning

Precision: andel rätt positiva bland alla positiva förutsägelser. Återkallning: andel rätt positiva bland alla verkliga positiva.

Språkliga resurser och verktyg(8)

Korpusspråk

En stor samling av textdata som används för att träna och utvärdera språkmodeller. Exempel: Wikipedia-databasen.

Tokenisering

Processen att dela upp text i mindre delar, kända som tokens. Tokens kan vara ord, fraser eller tecken.

Vad är NLTK?

Natural Language Toolkit, ett Python-bibliotek för att arbeta med naturligt språk och textanalys.

Stopplistor

Listor med vanliga ord som ofta ignoreras i NLP, såsom 'och', 'eller', 'men'.

Verktyg för syntaktisk analys

Verktyg som används för att identifiera grammatisk struktur i en mening. Exempel: Stanford Parser.

True or False: Word2Vec är en typ av maskininlärningsmodell.

True. Word2Vec används för att skapa ordembeddings som fångar semantiska relationer.

Fyll i punkterna: ___ är viktig för maskinöversättning.

Korpusspråk. Det ger exempel och kontext för translation.

Vad är spaCy?

Ett populärt Python-bibliotek för NLP som erbjuder funktioner för tokenisering, namngiven entitetsigenkänning och mer.

Frågor i det här studiesetet(36)

1. Vad beskriver bäst Korpusspråk?

A.En stor samling av textdata för träning av språkmodeller.
B.Ett verktyg för att skapa syntaktiska analyser.
C.En teknik för att dela upp text i tokens.
D.En lista med vanliga ord som ignoreras.

2. Vilken typ av maskininlärning tränas på märkta data?

A.Övervakad inlärning
B.Icke-övervakad inlärning
C.Förstärkningsinlärning
D.Semi-övervakad inlärning

3. Vad är tokenisering inom NLP?

A.Processen att dela text i mindre enheter.
B.En teknik för att klassificera känslor i text.
C.En typ av språklig analys av betydelse.
D.En metod för att översätta text automatiskt.

4. Vilken av följande processer kallas tokenisering?

A.Dela upp text i mindre delar.
B.Skapa en lista med stopplistor.
C.Analys av grammatisk struktur.
D.Spara textdata i en databas.

5. Vad gör en transformer-modell unik i NLP?

A.Den använder självadresserande mekanismer.
B.Den är alltid övervakad.
C.Den fungerar endast med text.
D.Den kräver stora mängder märkta data.

6. Vad innebär ordvektorer i NLP?

A.Matematisk representation av ord i ett fler-dimensionellt rum.
B.En form av textanalys för att förstå meningsstruktur.
C.En teknik för att mäta översättningskvalitet.
D.En process för att identifiera namngivna entiteter.

7. Vad är NLTK?

A.Ett Python-bibliotek för naturlig språkbehandling.
B.En typ av maskininlärningsmodell.
C.En databas med användargenererat innehåll.
D.Ett verktyg för bildanalys.

8. Vilken av följande är en metod för att utvärdera en models prestanda?

A.Korsvalidering
B.Dataaugmentering
C.Neuronal överföring
D.Fuzzy logik

9. Vilken av följande är en funktion av semantisk analys?

A.Att förstå betydelsen av ord i en mening.
B.Att dela text i ord och fraser.
C.Att klassificera text baserat på stil.
D.Att mäta likheten mellan olika texter.

10. Vilken av följande är INTE en typisk funktion av stopplistor?

A.Att filtrera bort vanliga ord från analys.
B.Att skapa ordembeddings.
C.Att förenkla textbearbetning.
D.Att spara minnesresurser.

11. Vad kallas processen att bedöma känslor i text?

A.Sentimentanalys
B.Klastrering
C.Tokenisering
D.NLP-pipeline

12. Vilket av följande är INTE en del av NLP?

A.Automatisk översättning mellan språk.
B.Identifiering av namn i text.
C.Beräkning av statistiska medelvärden.
D.Klassificering av känslor i text.

13. Vilket verktyg används för syntaktisk analys?

A.Stanford Parser.
B.Word2Vec.
C.Korpusspråk.
D.Tokeniserare.

14. Vilken typ av neuronnät är särskilt utformad för att bearbeta sekvenser av data?

A.RNN
B.CNN
C.DNN
D.SNN

15. Vad gör en språkmodell?

A.Förutsäger nästa ord i en sekvens baserat på tidigare ord.
B.Dela text i mindre enheter.
C.Identifiera entiteter som namn och platser.
D.Analysera grammatikalisk struktur av meningar.

16. Sant eller falskt: Word2Vec används för att skapa stopplistor.

A.Sant.
B.Falskt.
C.Båda.
D.Ingen av ovanstående.

17. Vad är en skillnad mellan precision och återkallning?

A.Precision handlar om andelen rätt positiva bland alla positiva förutsägelser.
B.Återkallning handlar om andelen negativa bland alla positiva.
C.Precision är alltid högre än återkallning.
D.Återkallning är irrelevant för NLP.

18. Vad är syftet med sentimentanalys?

A.Att bedöma känslan eller attityden i en text.
B.Att översätta text mellan olika språk.
C.Att dela upp text i ord och fraser.
D.Att mäta textens längd.

19. Fyll i punkterna: ___ är nödvändigt för att förbättra resultaten av maskinöversättning.

A.Korpusspråk.
B.Tokenisering.
C.Syntaktisk analys.
D.Stopplistor.

20. Vilket av följande är INTE en del av maskininlärning för NLP?

A.Klassificering av bilder
B.Sentimentanalys
C.Övervakad inlärning
D.Icke-övervakad inlärning

21. Vad innebär stoppord i NLP?

A.Ord som ofta utesluts i språkanalys.
B.Ord som används för att mäta översättningskvalitet.
C.Ord som representerar känslor.
D.Ord som är svåra att förstå.

22. Vad är spaCy?

A.Ett Python-bibliotek för NLP.
B.En programvara för bildbehandling.
C.En databas för naturligt språk.
D.Ett språk för programmering.

23. Vad innebär transfer learning inom NLP?

A.Att använda en modell tränad på en uppgift för en annan relaterad uppgift.
B.Att alltid träna en modell från grunden.
C.Att använda endast övervakad inlärning.
D.Att sammanställa data från flera källor.

24. Vad är en korpus inom NLP?

A.En stor och strukturerad uppsättning av texter.
B.En algoritm som analyserar textens betydelse.
C.En teknik för att omvandla text till tal.
D.En typ av databas för att lagra ordvektorer.

25. Fyll i tomrummet: Maskininlärning för NLP inkluderar ____ och ____.

A.övervakad inlärning, icke-övervakad inlärning
B.bara övervakad inlärning, ingen annan
C.bara icke-övervakad inlärning, ingen annan
D.endast semi-övervakad inlärning, ingen annan

26. Vad är NER i NLP?

A.Teknik för att identifiera och klassificera entiteter i text.
B.En metod för att mäta översättningskvalitet.
C.En process för att dela text i ord.
D.En algoritm för att förutsäga nästa ord.

27. Vad är en viktig egenskap hos Word Embeddings?

A.De representerar ord i en kontinuerlig vektorform.
B.De används endast i övervakad inlärning.
C.De kan inte hantera synonymer.
D.De är alltid begränsade till ett visst språk.

28. Vad gör lemmatization i NLP?

A.Reducerar ord till deras grundform.
B.Analyserar den syntaktiska strukturen av text.
C.Identifierar entiteter i text.
D.Mäta känslor i text.

29. Vilken av följande tekniker används för att identifiera mönster i omärkta data?

A.Icke-övervakad inlärning
B.Övervakad inlärning
C.Neuronal nätverksinlärning
D.Datainsamling

30. Vad innebär syntaktisk analys?

A.Att analysera meningsstruktur och grammatik.
B.Att klassificera känslor i text.
C.Att översätta text mellan olika språk.
D.Att identifiera namngivna entiteter.

31. Vilken av följande beskriver bäst sentimentanalys?

A.Processen att bedöma känslor i text
B.Metod för att dela data i tränings- och testset
C.En typ av neuronnät för sekvensanalys
D.Representation av ord i vektorform

32. Vad mäter BLEU?

A.Kvaliteten av maskinöversättning.
B.Syntaktisk korrekthet av text.
C.Ordfrekvens i en korpus.
D.Känsla i text.

33. Vad är en transformer inom NLP?

A.En neural nätverksarkitektur för textbehandling.
B.En metod för att klassificera känslor.
C.En teknik för att dela text i token.
D.En typ av språkanalys.

34. Vad är en viktig egenskap hos kontextuell inbäddning?

A.Beaktar kontexten för ordens betydelse.
B.Mäta textens längd.
C.Reducerar ord till grundform.
D.Identifierar namngivna entiteter.

35. Vad är maskinöversättning?

A.Automatisk översättning av text mellan språk.
B.En teknik för att dela text i enheter.
C.En process för att analysera känslor.
D.En typ av dataanalys.

36. Vad innebär att NLP saknar förmåga att hantera slang?

A.Falskt, NLP kan tränas på slangtermer.
B.Sant, slang är alltid oigenkännlig för NLP.
C.Falskt, slang är irrelevant i språkanalys.
D.Sant, NLP kan endast hantera formellt språk.

Relaterade studieset

Skapa ditt eget studieset

Ladda upp en PDF, klistra in dina anteckningar eller beskriv ett ämne – AI genererar flashcards, quiz och mer på några sekunder.