CodeGenTokenizer.GetIndexByTokenCount Metodo

Definizione

Overload

Nome Descrizione
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token.

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parametri

text
ReadOnlySpan<Char>

Testo da codificare.

maxTokenCount
Int32

Numero massimo di token per limitare la capacità di codifica.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

normalizedText
String

Se la normalizzazione del tokenizer è abilitata, il testo di input verrà rappresentato nel formato di normalizzazione; in caso contrario, sarà null.

tokenCount
Int32

Il numero di token può essere generato che deve essere inferiore al numero massimo di token.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Indice della capacità di codifica massima all'interno del testo elaborato senza superare il limite di token. Rappresenta l'indice immediatamente successivo all'ultimo carattere da includere. Nei casi in cui non si adatti alcun token, il risultato sarà 0; viceversa, se tutti i token rientrano, il risultato sarà la lunghezza del testo o se normalizedText la normalizzazione è abilitata.

Si applica a

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

protected override int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overrides Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

Parametri

text
String

Testo da codificare.

textSpan
ReadOnlySpan<Char>

Intervallo del testo da codificare che verrà utilizzato se text è null.

settings
EncodeSettings

Impostazioni utilizzate per codificare il testo.

fromEnd
Boolean

Indica se trovare l'indice dalla fine del testo.

normalizedText
String

Se la normalizzazione del tokenizer è abilitata o <paramRef name="settings"></paramRef> has ConsiderNormalization è false, verrà impostata su <paramRef name="text"></paramRef> nel formato normalizzato; in caso contrario, questo valore verrà impostato su null.

tokenCount
Int32

Il numero di token può essere generato che deve essere inferiore al numero massimo di token.

Valori restituiti

Indice della capacità di codifica massima all'interno del testo elaborato senza superare il limite di token. Se <paramRef name="fromEnd"></paramRef> è false, rappresenta l'indice immediatamente successivo all'ultimo carattere da includere. Nei casi in cui non si adatti alcun token, il risultato sarà 0; viceversa, se tutti i token rientrano, il risultato sarà la lunghezza del testo di input o se normalizedText la normalizzazione è abilitata. Se <paramRef name="fromEnd"></paramRef> è true, rappresenta l'indice del primo carattere da includere. Nei casi in cui non si adattano token, il risultato sarà la lunghezza del testo; viceversa, se tutti i token rientrano, il risultato sarà zero.

Si applica a

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Trovare l'indice della capacità di codifica massima dall'inizio all'interno del testo senza superare il limite di token.

public int GetIndexByTokenCount(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : string * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parametri

text
String

Testo da codificare.

maxTokenCount
Int32

Numero massimo di token per limitare la capacità di codifica.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

normalizedText
String

Se la normalizzazione del tokenizer è abilitata, il testo di input verrà rappresentato nel formato di normalizzazione; in caso contrario, sarà null.

tokenCount
Int32

Il numero di token può essere generato che deve essere inferiore al numero massimo di token.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Indice della capacità di codifica massima all'interno del testo elaborato senza superare il limite di token. Rappresenta l'indice immediatamente successivo all'ultimo carattere da includere. Nei casi in cui non si adatti alcun token, il risultato sarà 0; viceversa, se tutti i token rientrano, il risultato sarà la lunghezza del testo o se normalizedText la normalizzazione è abilitata.

Si applica a