CodeGenTokenizer Classe

Definizione

Rappresentare il modello di codifica della coppia di byte. Implementare il tokenizer CodeGen descritto in https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
    inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
Ereditarietà
CodeGenTokenizer
Derivato

Proprietà

Nome Descrizione
AddBeginningOfSentence

Ottiene il flag che indica se includere l'inizio del token di frase nella codifica.

AddEndOfSentence

Ottiene il flag che indica se includere la fine del token di frase nella codifica.

AddPrefixSpace

Ottiene il flag che indica se includere uno spazio iniziale prima di codificare il testo.

BeginningOfSentenceId

Ottiene la fine dell'ID del token di frase.

BeginningOfSentenceToken

Ottiene l'inizio del token di frase.

EndOfSentenceId

Ottiene la fine dell'ID del token di frase.

EndOfSentenceToken

Ottiene la fine del token di frase.

Normalizer

Ottiene il normalizer in uso dal tokenizer.

PreTokenizer

Ottiene il preTokenizer utilizzato dal tokenizer.

SpecialTokens

Ottiene i token aggiunti.

UnknownToken

Token Sconosciuto.

UnknownTokenId

Ottiene l'ID del token sconosciuto.

Vocabulary

Ottiene i token di mapping del dizionario agli ID.

Metodi

Nome Descrizione
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

CountTokens(String, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Ottenere il numero di token a cui verrà codificato il testo di input.

Create(Stream, Stream, Boolean, Boolean, Boolean)

Creare un tokenizer CodeGen dal vocab specificato e unisce i flussi.

Decode(IEnumerable<Int32>, Boolean, Boolean)

Decodificare gli ID specificati, tornare a un valore String.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo destination .

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo destination .

Decode(IEnumerable<Int32>)

Decodificare gli ID specificati, tornare a un valore String.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codifica il testo di input in ID token.

(Ereditato da Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

(Ereditato da Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(String, Boolean, Boolean)

Codifica il testo di input in ID token.

(Ereditato da Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

<param name="text">Testo da codificare.</Param> (Ereditato da Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica il testo di input in ID token.

EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Codifica il testo di input nell'oggetto con l'elenco dei token, gli ID dei token, il mapping degli offset dei token.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Codifica il testo di input nell'oggetto con l'elenco dei token, gli ID dei token, il mapping degli offset dei token.

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica il testo di input in un elenco di EncodedToken.

EncodeToTokens(String, String, Boolean, Boolean)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima dalla fine all'interno del testo senza superare il limite di token.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima dalla fine all'interno del testo senza superare il limite di token.

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)

Si applica a