Microsoft.ML.Tokenizers Namespace

Klassen

Name Beschreibung
BertOptions

Optionen für den Bert-Tokenizer.

BertTokenizer

Tokenizer für Bert-Modell.

BitVector
Bpe

Represent the Byte Pair Encoding model.

BpeDecoder

Ermöglicht das Decodieren von Original BPE durch Verknüpfen aller Token und das anschließende Ersetzen des Suffixes, das verwendet wird, um End-of-Words durch Leerzeichen zu identifizieren.

BpeTokenizer

Represent the Byte Pair Encoding model.

BpeTrainer

Der bpe Trainer, der für die Ausbildung des Bpe-Modells verantwortlich ist.

CodeGenTokenizer

Represent the Byte Pair Encoding model. Implementieren des codeGen-Tokenizers, der in https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

Represent the Byte Pair Encoding model.

EnglishRobertaTokenizer

Represent the Byte Pair Encoding model.

LlamaTokenizer

LlamaTokenizer ist SentencePieceTokenizer, das basierend auf https://github.com/google/sentencepiece.

LowerCaseNormalizer

Normalisieren Sie die Zeichenfolge in Kleinbuchstaben, bevor Sie sie mit dem Tokenizer verarbeiten.

Model

Stellt ein Modell dar, das während der Tokenisierung verwendet wird (z. B. BPE oder Word Stück oder Unigram).

Normalizer

Normalisieren Sie die Zeichenfolge vor der Verarbeitung mit dem Tokenizer.

Phi2Tokenizer

Represent the Byte Pair Encoding model. Implementieren des in 2 beschriebenen Phi2-Tokenizers https://huggingface.co/microsoft/phi-2

PreTokenizer

Basisklasse für alle Vortokenizerklassen. Der PreTokenizer ist für die Vorsegmentierung verantwortlich.

RegexPreTokenizer

Der Pre-Tokenizer für Tiktoken-Tokenizer.

RobertaPreTokenizer

Der Pre-Tokenizer für Roberta English tokenizer.

SentencePieceNormalizer

Normalisieren Sie die Zeichenfolge entsprechend der SentencePiece-Normalisierung.

SentencePieceTokenizer

SentencePieceBpe ist ein Tokenizer, der die Eingabe mithilfe des SentencePiece Bpe-Modells in Token aufteilt.

Split

Dieser Split enthält das zugrunde liegende Geteilte Token sowie seine Offsets in der ursprünglichen Zeichenfolge. Diese Offsets befinden sich im original referenziellen Bereich. Sie enthält auch alle Token mit der aktuellen Unterbrechung verknüpften.

TiktokenTokenizer

Stellt den schnellen Byte-Codierungstokenizer dar.

Token

Stellen Sie das token dar, das aus dem Tokenisierungsprozess mit der Tokenunterzeichenfolge, der id, die der Tokenunterzeichenfolge zugeordnet ist, und die Offsetzuordnung zur ursprünglichen Zeichenfolge.

Tokenizer

Stellt eine Abstraktion für Tokenizer bereit, wodurch die Codierung von Text in Token und die Decodierung von Token-IDs wieder in Text ermöglicht wird.

TokenizerDecoder

Ein Decoder hat die Verantwortung, die angegebene Liste von Token in einer Zeichenfolge zusammenzuführen.

TokenizerResult

Die Codierung stellt die Ausgabe eines Tokenizers dar.

Trainer

A Trainer hat die Verantwortung, ein Modell zu trainieren. Wir füttern es mit Linien/Sätzen und dann kann es die gegebene Modeltrainieren.

UpperCaseNormalizer

Normalisieren Sie die Zeichenfolge in Großbuchstaben, bevor Sie sie mit dem Tokenizer verarbeiten.

WhiteSpace

Der Vortokenizer, der den Text an der Wortgrenze aufteilt. Das Wort ist eine Reihe von Alphabet-, Numerischen und Unterstrichzeichen.

WordPieceOptions

Optionen für den WordPiece-Tokenizer.

WordPieceTokenizer

Stellt den WordPiece-Tokenizer dar.

Strukturen

Name Beschreibung
AddedToken

Stellen Sie ein Token dar, das der Benutzer über dem vorhandenen Modellvokabular hinzugefügt hat. AddedToken kann so konfiguriert werden, dass das Verhalten angegeben wird, das sie in verschiedenen Situationen haben sollten:

  • Gibt an, ob sie nur mit einzelnen Wörtern übereinstimmen sollen
  • Gibt an, ob Leerzeichen auf der linken oder rechten Seite enthalten sein sollen.
EncodedToken

Stellen Sie das token dar, das aus dem Tokenisierungsprozess mit der Tokenunterzeichenfolge, der id, die der Tokenunterzeichenfolge zugeordnet ist, und die Offsetzuordnung zur ursprünglichen Zeichenfolge.

EncodeResults<T>

Das Ergebnis der Codierung eines Texts.

EncodeSettings

Die Einstellungen, die zum Codieren eines Texts verwendet werden.

NormalizedString

Enthält die normalisierte Zeichenfolge und die Zuordnung zur ursprünglichen Zeichenfolge.

Progress

Enumerationen

Name Beschreibung
ProgressState

Stellt den Status des gemeldeten Fortschritts dar.

Delegaten

Name Beschreibung
ReportProgress