Tokenizer Klasse

Definition

Stellt eine Abstraktion für Tokenizer bereit, wodurch die Codierung von Text in Token und die Decodierung von Token-IDs wieder in Text ermöglicht wird.

public abstract class Tokenizer
public class Tokenizer
type Tokenizer = class
Public MustInherit Class Tokenizer
Public Class Tokenizer
Vererbung
Tokenizer
Abgeleitet

Konstruktoren

Name Beschreibung
Tokenizer()

Initialisiert eine neue Instanz der Tokenizer-Klasse.

Tokenizer(Model, PreTokenizer, Normalizer)

Erstellen Sie ein neues Tokenizer-Objekt.

Eigenschaften

Name Beschreibung
Decoder

Ruft den Decoder ab, der vom Tokenizer verwendet wird, oder legt diesen fest.

Model

Ruft das Vom Tokenizer verwendete Modell ab.

Normalizer

Ruft den vom Tokenizer verwendeten Normalizer ab.

PreTokenizer

Ruft das vom Tokenizer verwendete PreTokenizer ab.

Methoden

Name Beschreibung
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

CountTokens(String, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

Decode(IEnumerable<Int32>, Boolean)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

Decode(IEnumerable<Int32>)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

Decode(Int32, Boolean)

Decodiert die ID mit dem zugeordneten Token.

Encode(String)

Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

EncodeToIds(String, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

<param name="text">Der zu codierenden Text.</param>
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in Token-IDs.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in eine Liste von EncodedTokens.

EncodeToTokens(String, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

TrainFromFiles(Trainer, ReportProgress, String[])

Trainieren Sie das Tokenizermodell mithilfe von Eingabedateien.

Gilt für: