Microsoft.ML.Tokenizers Namespace
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Klassen
| Name | Beschreibung |
|---|---|
| BertOptions |
Optionen für den Bert-Tokenizer. |
| BertTokenizer |
Tokenizer für Bert-Modell. |
| BitVector | |
| Bpe |
Represent the Byte Pair Encoding model. |
| BpeDecoder |
Ermöglicht das Decodieren von Original BPE durch Verknüpfen aller Token und das anschließende Ersetzen des Suffixes, das verwendet wird, um End-of-Words durch Leerzeichen zu identifizieren. |
| BpeTokenizer |
Represent the Byte Pair Encoding model. |
| BpeTrainer |
Der bpe Trainer, der für die Ausbildung des Bpe-Modells verantwortlich ist. |
| CodeGenTokenizer |
Represent the Byte Pair Encoding model. Implementieren des codeGen-Tokenizers, der in https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview |
| DawgBuilder | |
| EnglishRoberta |
Represent the Byte Pair Encoding model. |
| EnglishRobertaTokenizer |
Represent the Byte Pair Encoding model. |
| LlamaTokenizer |
LlamaTokenizer ist SentencePieceTokenizer, das basierend auf https://github.com/google/sentencepiece. |
| LowerCaseNormalizer |
Normalisieren Sie die Zeichenfolge in Kleinbuchstaben, bevor Sie sie mit dem Tokenizer verarbeiten. |
| Model |
Stellt ein Modell dar, das während der Tokenisierung verwendet wird (z. B. BPE oder Word Stück oder Unigram). |
| Normalizer |
Normalisieren Sie die Zeichenfolge vor der Verarbeitung mit dem Tokenizer. |
| Phi2Tokenizer |
Represent the Byte Pair Encoding model. Implementieren des in 2 beschriebenen Phi2-Tokenizers https://huggingface.co/microsoft/phi-2 |
| PreTokenizer |
Basisklasse für alle Vortokenizerklassen. Der PreTokenizer ist für die Vorsegmentierung verantwortlich. |
| RegexPreTokenizer |
Der Pre-Tokenizer für Tiktoken-Tokenizer. |
| RobertaPreTokenizer |
Der Pre-Tokenizer für Roberta English tokenizer. |
| SentencePieceNormalizer |
Normalisieren Sie die Zeichenfolge entsprechend der SentencePiece-Normalisierung. |
| SentencePieceTokenizer |
SentencePieceBpe ist ein Tokenizer, der die Eingabe mithilfe des SentencePiece Bpe-Modells in Token aufteilt. |
| Split |
Dieser Split enthält das zugrunde liegende Geteilte Token sowie seine Offsets in der ursprünglichen Zeichenfolge. Diese Offsets befinden sich im |
| TiktokenTokenizer |
Stellt den schnellen Byte-Codierungstokenizer dar. |
| Token |
Stellen Sie das token dar, das aus dem Tokenisierungsprozess mit der Tokenunterzeichenfolge, der id, die der Tokenunterzeichenfolge zugeordnet ist, und die Offsetzuordnung zur ursprünglichen Zeichenfolge. |
| Tokenizer |
Stellt eine Abstraktion für Tokenizer bereit, wodurch die Codierung von Text in Token und die Decodierung von Token-IDs wieder in Text ermöglicht wird. |
| TokenizerDecoder |
Ein Decoder hat die Verantwortung, die angegebene Liste von Token in einer Zeichenfolge zusammenzuführen. |
| TokenizerResult |
Die Codierung stellt die Ausgabe eines Tokenizers dar. |
| Trainer |
A |
| UpperCaseNormalizer |
Normalisieren Sie die Zeichenfolge in Großbuchstaben, bevor Sie sie mit dem Tokenizer verarbeiten. |
| WhiteSpace |
Der Vortokenizer, der den Text an der Wortgrenze aufteilt. Das Wort ist eine Reihe von Alphabet-, Numerischen und Unterstrichzeichen. |
| WordPieceOptions |
Optionen für den WordPiece-Tokenizer. |
| WordPieceTokenizer |
Stellt den WordPiece-Tokenizer dar. |
Strukturen
| Name | Beschreibung |
|---|---|
| AddedToken |
Stellen Sie ein Token dar, das der Benutzer über dem vorhandenen Modellvokabular hinzugefügt hat. AddedToken kann so konfiguriert werden, dass das Verhalten angegeben wird, das sie in verschiedenen Situationen haben sollten:
|
| EncodedToken |
Stellen Sie das token dar, das aus dem Tokenisierungsprozess mit der Tokenunterzeichenfolge, der id, die der Tokenunterzeichenfolge zugeordnet ist, und die Offsetzuordnung zur ursprünglichen Zeichenfolge. |
| EncodeResults<T> |
Das Ergebnis der Codierung eines Texts. |
| EncodeSettings |
Die Einstellungen, die zum Codieren eines Texts verwendet werden. |
| NormalizedString |
Enthält die normalisierte Zeichenfolge und die Zuordnung zur ursprünglichen Zeichenfolge. |
| Progress | |
Enumerationen
| Name | Beschreibung |
|---|---|
| ProgressState |
Stellt den Status des gemeldeten Fortschritts dar. |
Delegaten
| Name | Beschreibung |
|---|---|
| ReportProgress | |