Tokenizer Klasse
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Stellt eine Abstraktion für Tokenizer bereit, wodurch die Codierung von Text in Token und die Decodierung von Token-IDs wieder in Text ermöglicht wird.
public abstract class Tokenizer
public class Tokenizer
type Tokenizer = class
Public MustInherit Class Tokenizer
Public Class Tokenizer
- Vererbung
-
Tokenizer
- Abgeleitet
Konstruktoren
| Name | Beschreibung |
|---|---|
| Tokenizer() |
Initialisiert eine neue Instanz der Tokenizer-Klasse. |
| Tokenizer(Model, PreTokenizer, Normalizer) |
Erstellen Sie ein neues Tokenizer-Objekt. |
Eigenschaften
| Name | Beschreibung |
|---|---|
| Decoder |
Ruft den Decoder ab, der vom Tokenizer verwendet wird, oder legt diesen fest. |
| Model |
Ruft das Vom Tokenizer verwendete Modell ab. |
| Normalizer |
Ruft den vom Tokenizer verwendeten Normalizer ab. |
| PreTokenizer |
Ruft das vom Tokenizer verwendete PreTokenizer ab. |
Methoden
| Name | Beschreibung |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| CountTokens(String, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| Decode(IEnumerable<Int32>, Boolean) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| Decode(Int32, Boolean) |
Decodiert die ID mit dem zugeordneten Token. |
| Encode(String) |
Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. |
| EncodeToIds(String, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. <param name="text">Der zu codierenden Text.</param> |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in Token-IDs. |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in eine Liste von EncodedTokens. |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| TrainFromFiles(Trainer, ReportProgress, String[]) |
Trainieren Sie das Tokenizermodell mithilfe von Eingabedateien. |