WordPieceTokenizer Klasse

Definition

Stellt den WordPiece-Tokenizer dar.

public class WordPieceTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type WordPieceTokenizer = class
    inherit Tokenizer
Public Class WordPieceTokenizer
Inherits Tokenizer
Vererbung
WordPieceTokenizer
Abgeleitet

Hinweise

Der WordPiece-Tokenizer ist ein Unterworttokenizer, der in BERT und anderen Transformatormodellen verwendet wird. Die Implementierung basiert auf dem Umarmungs-WordPiece-Tokenizer https://huggingface.co/docs/tokenizers/api/models#tokenizers.models.WordPiece.

Eigenschaften

Name Beschreibung
ContinuingSubwordPrefix

Ruft das Präfix ab, das für Unterwörter verwendet werden soll, die nicht der erste Teil eines Worts sind.

MaxInputCharsPerWord

Ruft die maximale Anzahl von Zeichen ab, die in einem einzelnen Wort autorisiert werden sollen.

Normalizer

Ruft den vom Tokenizer verwendeten Normalizer ab.

PreTokenizer

Ruft das vom Tokenizer verwendete PreTokenizer ab.

SpecialTokens

Ruft die speziellen Token und die entsprechenden IDs ab.

UnknownToken

Ruft das unbekannte Token ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt.

UnknownTokenId

Ruft die unbekannte Token-ID ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt.

Methoden

Name Beschreibung
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

Create(Stream, WordPieceOptions)

Erstellen Sie eine neue instance der WordPieceTokenizer -Klasse.

Create(String, WordPieceOptions)

Erstellen Sie eine neue instance der WordPieceTokenizer -Klasse.

CreateAsync(Stream, WordPieceOptions, CancellationToken)

Erstellen Sie asynchron eine neue Instanz der WordPieceTokenizer Klasse.

CreateAsync(String, WordPieceOptions, CancellationToken)

Erstellen Sie asynchron eine neue Instanz der WordPieceTokenizer Klasse.

Decode(IEnumerable<Int32>, Boolean)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

Decode(IEnumerable<Int32>)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

(Geerbt von Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

(Geerbt von Tokenizer)
EncodeToIds(String, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

(Geerbt von Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

<param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in Token-IDs.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in eine Liste von EncodedTokens.

EncodeToTokens(String, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)

Gilt für: