CodeGenTokenizer.CountTokens Metodo

Definizione

Overload

Nome Descrizione
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Ottenere il numero di token a cui verrà codificato il testo di input.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Ottenere il numero di token a cui verrà codificato il testo di input.

protected override int CountTokens(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.CountTokens : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> int
Protected Overrides Function CountTokens (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As Integer

Parametri

text
String

Testo da codificare.

textSpan
ReadOnlySpan<Char>

Intervallo del testo da codificare che verrà utilizzato se text è null.

settings
EncodeSettings

Impostazioni utilizzate per codificare il testo.

Valori restituiti

Numero di ID token a cui verrà codificato il testo di input.

Si applica a

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Ottenere il numero di token a cui verrà codificato il testo di input.

public int CountTokens(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parametri

text
ReadOnlySpan<Char>

Testo da codificare.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Numero di ID token a cui verrà codificato il testo di input.

Si applica a

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Ottenere il numero di token a cui verrà codificato il testo di input.

public int CountTokens(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : string * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parametri

text
String

Testo da codificare.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Numero di ID token a cui verrà codificato il testo di input.

Si applica a