Phi2Tokenizer Classe
Definizione
Importante
Alcune informazioni sono relative alla release non definitiva del prodotto, che potrebbe subire modifiche significative prima della release definitiva. Microsoft non riconosce alcuna garanzia, espressa o implicita, in merito alle informazioni qui fornite.
Rappresentare il modello di codifica della coppia di byte. Implementare il tokenizer Phi2 descritto in https://huggingface.co/microsoft/phi-2
public sealed class Phi2Tokenizer : Microsoft.ML.Tokenizers.CodeGenTokenizer
type Phi2Tokenizer = class
inherit CodeGenTokenizer
Public NotInheritable Class Phi2Tokenizer
Inherits CodeGenTokenizer
- Ereditarietà
Proprietà
| Nome | Descrizione |
|---|---|
| AddBeginningOfSentence |
Ottiene il flag che indica se includere l'inizio del token di frase nella codifica. (Ereditato da CodeGenTokenizer) |
| AddEndOfSentence |
Ottiene il flag che indica se includere la fine del token di frase nella codifica. (Ereditato da CodeGenTokenizer) |
| AddPrefixSpace |
Ottiene il flag che indica se includere uno spazio iniziale prima di codificare il testo. (Ereditato da CodeGenTokenizer) |
| BeginningOfSentenceId |
Ottiene la fine dell'ID del token di frase. (Ereditato da CodeGenTokenizer) |
| BeginningOfSentenceToken |
Ottiene l'inizio del token di frase. (Ereditato da CodeGenTokenizer) |
| EndOfSentenceId |
Ottiene la fine dell'ID del token di frase. (Ereditato da CodeGenTokenizer) |
| EndOfSentenceToken |
Ottiene la fine del token di frase. (Ereditato da CodeGenTokenizer) |
| Normalizer |
Ottiene il normalizer in uso dal tokenizer. (Ereditato da CodeGenTokenizer) |
| PreTokenizer |
Ottiene il preTokenizer utilizzato dal tokenizer. (Ereditato da CodeGenTokenizer) |
| SpecialTokens |
Ottiene i token aggiunti. (Ereditato da CodeGenTokenizer) |
| UnknownToken |
Token Sconosciuto. (Ereditato da CodeGenTokenizer) |
| UnknownTokenId |
Ottiene l'ID del token sconosciuto. (Ereditato da CodeGenTokenizer) |
| Vocabulary |
Ottiene i token di mapping del dizionario agli ID. (Ereditato da CodeGenTokenizer) |
Metodi
| Nome | Descrizione |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da CodeGenTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da CodeGenTokenizer) |
| CountTokens(String, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da CodeGenTokenizer) |
| Create(Stream, Stream, Boolean, Boolean, Boolean) |
Creare un tokenizer CodeGen Phi2 dal vocab specificato e unisce i flussi. |
| Decode(IEnumerable<Int32>, Boolean, Boolean) |
Decodificare gli ID specificati, tornare a un valore String. (Ereditato da CodeGenTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32) |
Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo |
| Decode(IEnumerable<Int32>) |
Decodificare gli ID specificati, tornare a un valore String. (Ereditato da CodeGenTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codifica il testo di input in ID token. (Ereditato da CodeGenTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica il testo di input in ID token. (Ereditato da Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token fino al numero massimo di token. (Ereditato da CodeGenTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token fino al numero massimo di token. (Ereditato da Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codifica il testo di input in ID token. (Ereditato da CodeGenTokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codifica il testo di input in ID token. (Ereditato da Tokenizer) |
| EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token fino al numero massimo di token. (Ereditato da CodeGenTokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token fino al numero massimo di token. <param name="text">Testo da codificare.</param> (Ereditato da Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica il testo di input in ID token. (Ereditato da CodeGenTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codifica il testo di input nell'oggetto con l'elenco dei token, gli ID dei token, il mapping degli offset dei token. (Ereditato da CodeGenTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da Tokenizer) |
| EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codifica il testo di input nell'oggetto con l'elenco dei token, gli ID dei token, il mapping degli offset dei token. (Ereditato da CodeGenTokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da CodeGenTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token. (Ereditato da CodeGenTokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token. (Ereditato da CodeGenTokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da CodeGenTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima dalla fine all'interno del testo senza superare il limite di token. (Ereditato da CodeGenTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima dalla fine all'interno del testo senza superare il limite di token. (Ereditato da CodeGenTokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |