BertTokenizer Klasse

Definition

Tokenizer für Bert-Modell.

public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
    inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
Vererbung

Hinweise

Das BertTokenizer basiert auf dem WordPieceTokenizer und wird verwendet, um Text für Bert-Modelle zu tokenisieren. Die Implementierung des BertTokenizers basiert auf der ursprünglichen Bert-Implementierung in der Hugging Face Transformers Bibliothek. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer

Eigenschaften

Name Beschreibung
ApplyBasicTokenization

Ruft einen Wert ab, der angibt, ob der Tokenizer grundlegende Tokenisierung ausführen soll. Wie sauberer Text, normalisieren Sie ihn, untere Klammern usw.

ClassificationToken

Ruft das Klassifizierertoken ab, das bei der Sequenzklassifizierung verwendet wird (Klassifizierung der gesamten Sequenz anstelle der Klassifizierung pro Token). Es ist das erste Token der Sequenz, wenn sie mit speziellen Token erstellt wird.

ClassificationTokenId

Ruft die Klassifizierungstoken-ID ab.

ContinuingSubwordPrefix

Ruft das Präfix ab, das für Unterwörter verwendet werden soll, die nicht der erste Teil eines Worts sind.

(Geerbt von WordPieceTokenizer)
IndividuallyTokenizeCjk

Ruft einen Wert ab, der angibt, ob der Tokenizer die CJK-Zeichen in Token aufteilen soll.

LowerCaseBeforeTokenization

Ruft einen Wert ab, der angibt, ob der Tokenizer den Eingabetext kleingeschrieben werden soll.

MaskingToken

Ruft das Maskentoken ab, das zum Maskieren von Werten verwendet wird. Dies ist das Token, das beim Trainieren dieses Modells mit maskierten Sprachmodellierung verwendet wird. Dies ist das Token, das vom Modell vorhergesagt werden soll.

MaskingTokenId

Ruft die Maskentoken-ID ab.

MaxInputCharsPerWord

Ruft die maximale Anzahl von Zeichen ab, die in einem einzelnen Wort autorisiert werden sollen.

(Geerbt von WordPieceTokenizer)
Normalizer

Ruft den vom Tokenizer verwendeten Normalizer ab.

(Geerbt von WordPieceTokenizer)
PaddingToken

Ruft das token ab, das für den Abstand verwendet wird, z. B. wenn Batchverarbeitungssequenzen unterschiedlicher Längen

PaddingTokenId

Ruft die Abstandstoken-ID ab.

PreTokenizer

Ruft das vom Tokenizer verwendete PreTokenizer ab.

(Geerbt von WordPieceTokenizer)
RemoveNonSpacingMarks

Ruft einen Wert ab, der angibt, ob nicht abstandsfreie Markierungen entfernt werden sollen.

SeparatorToken

Ruft das Trennzeichen ab, das beim Erstellen einer Sequenz aus mehreren Sequenzen verwendet wird, z. B. zwei Sequenzen für die Sequenzklassifizierung oder für einen Text und eine Frage zur Beantwortung von Fragen. Sie wird auch als letztes Token einer Sequenz verwendet, die mit speziellen Token erstellt wurde.

SeparatorTokenId

Ruft die Trenntoken-ID ab.

SpecialTokens

Ruft die speziellen Token und die entsprechenden IDs ab.

(Geerbt von WordPieceTokenizer)
SplitOnSpecialTokens

Ruft einen Wert ab, der angibt, ob der Tokenizer auf die speziellen Token aufgeteilt oder spezielle Token als normaler Text behandelt.

UnknownToken

Ruft das unbekannte Token ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt.

(Geerbt von WordPieceTokenizer)
UnknownTokenId

Ruft die unbekannte Token-ID ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt.

(Geerbt von WordPieceTokenizer)

Methoden

Name Beschreibung
BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>)

Erstellen Sie Modelleingaben aus einer Sequenz oder einem Sequenzpaar für Sequenzklassifizierungsaufgaben, indem Sie spezielle Token verketten und hinzufügen. Eine BERT-Sequenz weist das folgende Format auf: - einzelne Sequenz: [CLS] tokenIds [SEP] - Sequenzpaar: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Erstellen Sie Modelleingaben aus einer Sequenz oder einem Sequenzpaar für Sequenzklassifizierungsaufgaben, indem Sie spezielle Token verketten und hinzufügen. Eine BERT-Sequenz weist das folgende Format auf: - einzelne Sequenz: [CLS] tokenIds [SEP] - Sequenzpaar: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von WordPieceTokenizer)
Create(Stream, BertOptions)

Erstellen Sie eine neue instance der BertTokenizer -Klasse.

Create(String, BertOptions)

Erstellen Sie eine neue instance der BertTokenizer -Klasse.

CreateAsync(Stream, BertOptions, CancellationToken)

Erstellen Sie asynchron eine neue Instanz der BertTokenizer Klasse.

CreateAsync(String, BertOptions, CancellationToken)

Erstellen Sie asynchron eine neue Instanz der BertTokenizer Klasse.

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>)

Erstellen Sie eine Maske aus den beiden Sequenzen, die in einer Sequenzpaarklassifizierungsaufgabe verwendet werden sollen. Eine BERT-Sequenzpaarmaske hat das folgende Format: 0 0 0 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 | erste Sequenz | zweite Sequenz | Wenn additionalTokenIds null ist, gibt diese Methode nur den ersten Teil der Typ-IDs (0s) zurück.

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Tokenizer für Bert-Modell.

Decode(IEnumerable<Int32>, Boolean)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

(Geerbt von WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

(Geerbt von WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

(Geerbt von WordPieceTokenizer)
Decode(IEnumerable<Int32>)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

(Geerbt von WordPieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, Boolean, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in Token-IDs.

(Geerbt von WordPieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von WordPieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von WordPieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean)

Abrufen der Sequenztokenmaske aus einer IDs-Liste.

GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean)

Abrufen der Sequenztokenmaske aus einer IDs-Liste.

Gilt für: