WordPieceTokenizer Klasse
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Stellt den WordPiece-Tokenizer dar.
public class WordPieceTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type WordPieceTokenizer = class
inherit Tokenizer
Public Class WordPieceTokenizer
Inherits Tokenizer
- Vererbung
- Abgeleitet
Hinweise
Der WordPiece-Tokenizer ist ein Unterworttokenizer, der in BERT und anderen Transformatormodellen verwendet wird. Die Implementierung basiert auf dem Umarmungs-WordPiece-Tokenizer https://huggingface.co/docs/tokenizers/api/models#tokenizers.models.WordPiece.
Eigenschaften
| Name | Beschreibung |
|---|---|
| ContinuingSubwordPrefix |
Ruft das Präfix ab, das für Unterwörter verwendet werden soll, die nicht der erste Teil eines Worts sind. |
| MaxInputCharsPerWord |
Ruft die maximale Anzahl von Zeichen ab, die in einem einzelnen Wort autorisiert werden sollen. |
| Normalizer |
Ruft den vom Tokenizer verwendeten Normalizer ab. |
| PreTokenizer |
Ruft das vom Tokenizer verwendete PreTokenizer ab. |
| SpecialTokens |
Ruft die speziellen Token und die entsprechenden IDs ab. |
| UnknownToken |
Ruft das unbekannte Token ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt. |
| UnknownTokenId |
Ruft die unbekannte Token-ID ab. Ein Token, das nicht im Vokabular enthalten ist, kann nicht in eine ID konvertiert werden und ist stattdessen auf dieses Token festgelegt. |
Methoden
| Name | Beschreibung |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| Create(Stream, WordPieceOptions) |
Erstellen Sie eine neue instance der WordPieceTokenizer -Klasse. |
| Create(String, WordPieceOptions) |
Erstellen Sie eine neue instance der WordPieceTokenizer -Klasse. |
| CreateAsync(Stream, WordPieceOptions, CancellationToken) |
Erstellen Sie asynchron eine neue Instanz der WordPieceTokenizer Klasse. |
| CreateAsync(String, WordPieceOptions, CancellationToken) |
Erstellen Sie asynchron eine neue Instanz der WordPieceTokenizer Klasse. |
| Decode(IEnumerable<Int32>, Boolean) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. (Geerbt von Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. <param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in Token-IDs. |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in eine Liste von EncodedTokens. |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |