BpeTokenizer Klasse

Definition

Represent the Byte Pair Encoding model.

public sealed class BpeTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type BpeTokenizer = class
    inherit Tokenizer
Public NotInheritable Class BpeTokenizer
Inherits Tokenizer
Vererbung
BpeTokenizer

Eigenschaften

Name Beschreibung
ContinuingSubwordPrefix

Ein Präfix, das für jedes Unterwort verwendet werden soll, das kein Anfang des Worts ist

EndOfWordSuffix

Ein optionales Suffix zum Charakterisieren und End-of-Word-Unterwort

FuseUnknownTokens

Ruft ab oder legt fest, ob mehrere unbekannte Token fused werden

Normalizer

Ruft den vom Tokenizer verwendeten Normalizer ab.

PreTokenizer

Ruft das vom Tokenizer verwendete PreTokenizer ab.

SpecialTokens

Ruft die speziellen Token ab.

UnknownToken

Ruft ein unbekanntes Token ab oder legt es fest. Das unbekannte Token, das verwendet werden soll, wenn ein unbekanntes Zeichen auftritt

Vocabulary

Ruft die Wörterbuchzuordnungstoken zu IDs ab.

Methoden

Name Beschreibung
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Create(Stream, Stream)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Create(String, String)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

CreateAsync(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Erstellen Sie asynchron ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Decode(IEnumerable<Int32>, Boolean)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

Decode(IEnumerable<Int32>)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

(Geerbt von Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

(Geerbt von Tokenizer)
EncodeToIds(String, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

(Geerbt von Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

<param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in Token-IDs.

(Geerbt von Tokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)

Gilt für: