BpeTokenizer Klasse
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Represent the Byte Pair Encoding model.
public sealed class BpeTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type BpeTokenizer = class
inherit Tokenizer
Public NotInheritable Class BpeTokenizer
Inherits Tokenizer
- Vererbung
Eigenschaften
| Name | Beschreibung |
|---|---|
| ContinuingSubwordPrefix |
Ein Präfix, das für jedes Unterwort verwendet werden soll, das kein Anfang des Worts ist |
| EndOfWordSuffix |
Ein optionales Suffix zum Charakterisieren und End-of-Word-Unterwort |
| FuseUnknownTokens |
Ruft ab oder legt fest, ob mehrere unbekannte Token fused werden |
| Normalizer |
Ruft den vom Tokenizer verwendeten Normalizer ab. |
| PreTokenizer |
Ruft das vom Tokenizer verwendete PreTokenizer ab. |
| SpecialTokens |
Ruft die speziellen Token ab. |
| UnknownToken |
Ruft ein unbekanntes Token ab oder legt es fest. Das unbekannte Token, das verwendet werden soll, wenn ein unbekanntes Zeichen auftritt |
| Vocabulary |
Ruft die Wörterbuchzuordnungstoken zu IDs ab. |
Methoden
| Name | Beschreibung |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| Create(Stream, Stream) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| Create(String, String) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| CreateAsync(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Erstellen Sie asynchron ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| Decode(IEnumerable<Int32>, Boolean) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. (Geerbt von Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. <param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |