BpeTokenizer Classe

Definizione

Rappresentare il modello di codifica della coppia di byte.

public sealed class BpeTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type BpeTokenizer = class
    inherit Tokenizer
Public NotInheritable Class BpeTokenizer
Inherits Tokenizer
Ereditarietà
BpeTokenizer

Proprietà

Nome Descrizione
ContinuingSubwordPrefix

Prefisso da utilizzare per ogni sottomaschera che non è un inizio di parola

EndOfWordSuffix

Suffisso facoltativo per caratterizzare e terminare la parola secondaria

FuseUnknownTokens

Ottiene o imposta un valore che indica se consentire la fusione di più token sconosciuti

Normalizer

Ottiene il normalizer in uso dal tokenizer.

PreTokenizer

Ottiene il preTokenizer utilizzato dal tokenizer.

SpecialTokens

Ottiene i token speciali.

UnknownToken

Ottiene o imposta un token sconosciuto. Token sconosciuto da usare quando viene rilevato un carattere sconosciuto

Vocabulary

Ottiene i token di mapping del dizionario agli ID.

Metodi

Nome Descrizione
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da Tokenizer)
CountTokens(String, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da Tokenizer)
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

Create(Stream, Stream)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

Create(String, String)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

CreateAsync(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Creare un nuovo oggetto tokenizer Bpe in modo asincrono da usare per la codifica del testo.

Decode(IEnumerable<Int32>, Boolean)

Decodificare gli ID specificati, tornare a un valore String.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo destination .

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo destination .

Decode(IEnumerable<Int32>)

Decodificare gli ID specificati, tornare a un valore String.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codifica il testo di input in ID token.

(Ereditato da Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

(Ereditato da Tokenizer)
EncodeToIds(String, Boolean, Boolean)

Codifica il testo di input in ID token.

(Ereditato da Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

<param name="text">Testo da codificare.</param> (Ereditato da Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica il testo di input in ID token.

(Ereditato da Tokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da Tokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)

Si applica a