Microsoft.ML.Tokenizers Spazio dei nomi
Importante
Alcune informazioni sono relative alla release non definitiva del prodotto, che potrebbe subire modifiche significative prima della release definitiva. Microsoft non riconosce alcuna garanzia, espressa o implicita, in merito alle informazioni qui fornite.
Classi
| Nome | Descrizione |
|---|---|
| BertOptions |
Opzioni per il tokenizer Bert. |
| BertTokenizer |
Tokenizer per il modello Bert. |
| BitVector | |
| Bpe |
Rappresentare il modello di codifica della coppia di byte. |
| BpeDecoder |
Consente di decodificare il BPE originale unendo tutti i token e quindi sostituendo il suffisso usato per identificare la fine delle parole da spazi vuoti |
| BpeTokenizer |
Rappresentare il modello di codifica della coppia di byte. |
| BpeTrainer |
Il trainer Bpe responsabile del training del modello Bpe. |
| CodeGenTokenizer |
Rappresentare il modello di codifica della coppia di byte. Implementare il tokenizer CodeGen descritto in https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview |
| DawgBuilder | |
| EnglishRoberta |
Rappresentare il modello di codifica della coppia di byte. |
| EnglishRobertaTokenizer |
Rappresentare il modello di codifica della coppia di byte. |
| LlamaTokenizer |
LlamaTokenizer è SentencePieceTokenizer implementato in base a https://github.com/google/sentencepiece. |
| LowerCaseNormalizer |
Normalizzare la stringa in formato minuscolo prima di elaborarla con il tokenizer. |
| Model |
Rappresenta un modello usato durante la tokenizzazione, ad esempio BPE o Word Piece o Unigram. |
| Normalizer |
Normalizzare la stringa prima di elaborarla con il tokenizer. |
| Phi2Tokenizer |
Rappresentare il modello di codifica della coppia di byte. Implementare il tokenizer Phi2 descritto in https://huggingface.co/microsoft/phi-2 |
| PreTokenizer |
Classe di base per tutte le classi di pre-tokenizer. Il preTokenizer è responsabile dell'esecuzione del passaggio di pre-segmentazione. |
| RegexPreTokenizer |
Pre-tokenizer per il tokenizer Tiktoken. |
| RobertaPreTokenizer |
Tokenizer di pre-tokenizzatore per Roberta English tokenizer. |
| SentencePieceNormalizer |
Normalizzare la stringa in base alla normalizzazione SentencePiece. |
| SentencePieceTokenizer |
SentencePieceBpe è un tokenizer che suddivide l'input in token usando il modello SentencePiece Bpe. |
| Split |
Questa divisione contiene il token di divisione sottostante e i relativi offset nella stringa originale. Questi offset si trovano nell'oggetto |
| TiktokenTokenizer |
Rappresenta il tokenizer di codifica rapida della coppia di byte. |
| Token |
Rappresenta il token generato dal processo di tokenizzazione contenente la sottostringa del token, l'ID associato alla sottostringa del token e il mapping dell'offset alla stringa originale. |
| Tokenizer |
Fornisce un'astrazione per i tokenizer, abilitando la codifica del testo in token e la decodifica degli ID token nel testo. |
| TokenizerDecoder |
Un decodificatore ha la responsabilità di unire l'elenco specificato di token in una stringa. |
| TokenizerResult |
La codifica rappresenta l'output di un tokenizer. |
| Trainer |
Un |
| UpperCaseNormalizer |
Normalizzare la stringa in formato maiuscolo prima di elaborarla con il tokenizer. |
| WhiteSpace |
Pre-tokenizzatore che divide il testo in corrispondenza del limite della parola. La parola è un set di caratteri alfabetici, numerici e di sottolineatura. |
| WordPieceOptions |
Opzioni per il tokenizer WordPiece. |
| WordPieceTokenizer |
Rappresenta il tokenizer WordPiece. |
Struct
| Nome | Descrizione |
|---|---|
| AddedToken |
Rappresentare un token aggiunto dall'utente sopra il vocabolario del modello esistente. AddedToken può essere configurato per specificare il comportamento che deve avere in diverse situazioni, ad esempio:
|
| EncodedToken |
Rappresenta il token generato dal processo di tokenizzazione contenente la sottostringa del token, l'ID associato alla sottostringa del token e il mapping dell'offset alla stringa originale. |
| EncodeResults<T> |
Risultato della codifica di un testo. |
| EncodeSettings |
Impostazioni utilizzate per codificare un testo. |
| NormalizedString |
Contiene la stringa normalizzata e il mapping alla stringa originale. |
| Progress | |
Enumerazioni
| Nome | Descrizione |
|---|---|
| ProgressState |
Rappresenta lo stato dell'avanzamento segnalato. |
Delegati
| Nome | Descrizione |
|---|---|
| ReportProgress | |