BertTokenizer Klasse
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Tokenizer für Bert-Modell.
public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
- Vererbung
Hinweise
Das BertTokenizer basiert auf dem WordPieceTokenizer und wird verwendet, um Text für Bert-Modelle zu tokenisieren. Die Implementierung des BertTokenizers basiert auf der ursprünglichen Bert-Implementierung in der Hugging Face Transformers Bibliothek. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer
Eigenschaften
| Name | Beschreibung |
|---|---|
| ApplyBasicTokenization |
Ruft einen Wert ab, der angibt, ob der Tokenizer grundlegende Tokenisierung ausführen soll. Wie sauberer Text, normalisieren Sie ihn, untere Klammern usw. |
| ClassificationToken |
Ruft das Klassifizierertoken ab, das bei der Sequenzklassifizierung verwendet wird (Klassifizierung der gesamten Sequenz anstelle der Klassifizierung pro Token). Es ist das erste Token der Sequenz, wenn sie mit speziellen Token erstellt wird. |
| ClassificationTokenId |
Ruft die Klassifizierungstoken-ID ab. |
| ContinuingSubwordPrefix |
Ruft das Präfix ab, das für Unterwörter verwendet werden soll, die nicht der erste Teil eines Worts sind. (Geerbt von WordPieceTokenizer) |
| IndividuallyTokenizeCjk |
Ruft einen Wert ab, der angibt, ob der Tokenizer die CJK-Zeichen in Token aufteilen soll. |
| LowerCaseBeforeTokenization |
Ruft einen Wert ab, der angibt, ob der Tokenizer den Eingabetext kleingeschrieben werden soll. |
| MaskingToken |
Ruft das Maskentoken ab, das zum Maskieren von Werten verwendet wird. Dies ist das Token, das beim Trainieren dieses Modells mit maskierten Sprachmodellierung verwendet wird. Dies ist das Token, das vom Modell vorhergesagt werden soll. |
| MaskingTokenId |
Ruft die Maskentoken-ID ab. |
| MaxInputCharsPerWord |
Ruft die maximale Anzahl von Zeichen ab, die in einem einzelnen Wort autorisiert werden sollen. (Geerbt von WordPieceTokenizer) |
| Normalizer |
Ruft den vom Tokenizer verwendeten Normalizer ab. (Geerbt von WordPieceTokenizer) |
| PaddingToken |
Ruft das token ab, das für den Abstand verwendet wird, z. B. wenn Batchverarbeitungssequenzen unterschiedlicher Längen |
| PaddingTokenId |
Ruft die Abstandstoken-ID ab. |
| PreTokenizer |
Ruft das vom Tokenizer verwendete PreTokenizer ab. (Geerbt von WordPieceTokenizer) |
| RemoveNonSpacingMarks |
Ruft einen Wert ab, der angibt, ob nicht abstandsfreie Markierungen entfernt werden sollen. |
| SeparatorToken |
Ruft das Trennzeichen ab, das beim Erstellen einer Sequenz aus mehreren Sequenzen verwendet wird, z. B. zwei Sequenzen für die Sequenzklassifizierung oder für einen Text und eine Frage zur Beantwortung von Fragen. Sie wird auch als letztes Token einer Sequenz verwendet, die mit speziellen Token erstellt wurde. |
| SeparatorTokenId |
Ruft die Trenntoken-ID ab. |
| SpecialTokens |
Ruft die speziellen Token und die entsprechenden IDs ab. (Geerbt von WordPieceTokenizer) |
| SplitOnSpecialTokens |
Ruft einen Wert ab, der angibt, ob der Tokenizer auf die speziellen Token aufgeteilt oder spezielle Token als normaler Text behandelt. |
| UnknownToken |
Ruft das unbekannte Token ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt. (Geerbt von WordPieceTokenizer) |
| UnknownTokenId |
Ruft die unbekannte Token-ID ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt. (Geerbt von WordPieceTokenizer) |
Methoden
| Name | Beschreibung |
|---|---|
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>) |
Erstellen Sie Modelleingaben aus einer Sequenz oder einem Sequenzpaar für Sequenzklassifizierungsaufgaben, indem Sie spezielle Token verketten und hinzufügen. Eine BERT-Sequenz weist das folgende Format auf: - einzelne Sequenz: |
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Erstellen Sie Modelleingaben aus einer Sequenz oder einem Sequenzpaar für Sequenzklassifizierungsaufgaben, indem Sie spezielle Token verketten und hinzufügen. Eine BERT-Sequenz weist das folgende Format auf: - einzelne Sequenz: |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von WordPieceTokenizer) |
| Create(Stream, BertOptions) |
Erstellen Sie eine neue instance der BertTokenizer -Klasse. |
| Create(String, BertOptions) |
Erstellen Sie eine neue instance der BertTokenizer -Klasse. |
| CreateAsync(Stream, BertOptions, CancellationToken) |
Erstellen Sie asynchron eine neue Instanz der BertTokenizer Klasse. |
| CreateAsync(String, BertOptions, CancellationToken) |
Erstellen Sie asynchron eine neue Instanz der BertTokenizer Klasse. |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>) |
Erstellen Sie eine Maske aus den beiden Sequenzen, die in einer Sequenzpaarklassifizierungsaufgabe verwendet werden sollen. Eine BERT-Sequenzpaarmaske hat das folgende Format: 0 0 0 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 | erste Sequenz | zweite Sequenz | Wenn |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Tokenizer für Bert-Modell. |
| Decode(IEnumerable<Int32>, Boolean) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. (Geerbt von WordPieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. (Geerbt von WordPieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(String, Boolean, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(String, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in Token-IDs. (Geerbt von WordPieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von WordPieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von WordPieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean) |
Abrufen der Sequenztokenmaske aus einer IDs-Liste. |
| GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean) |
Abrufen der Sequenztokenmaske aus einer IDs-Liste. |