CodeGenTokenizer.EncodeToIds Metodo

Definizione

Overload

Nome Descrizione
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token fino al numero massimo di token.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica il testo di input in ID token.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Codifica il testo di input in ID token fino al numero massimo di token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametri

text
String

Testo da codificare.

maxTokenCount
Int32

Numero massimo di token da codificare.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

normalizedText
String

Se la normalizzazione del tokenizer è abilitata, il testo di input verrà rappresentato nel formato di normalizzazione; in caso contrario, sarà null.

charsConsumed
Int32

Lunghezza del testo che include i token con codifica massima.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Elenco di ID codificati.

Si applica a

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Codifica il testo di input in ID token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametri

text
String

Testo da codificare.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Elenco di ID codificati.

Si applica a

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Codifica il testo di input in ID token fino al numero massimo di token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametri

text
ReadOnlySpan<Char>

Testo da codificare.

maxTokenCount
Int32

Numero massimo di token da codificare.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

normalizedText
String

Se la normalizzazione del tokenizer è abilitata, il testo di input verrà rappresentato nel formato di normalizzazione; in caso contrario, sarà null.

charsConsumed
Int32

Lunghezza del testo che include i token con codifica massima.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Elenco di ID codificati.

Si applica a

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Codifica il testo di input in ID token.

protected override Microsoft.ML.Tokenizers.EncodeResults<int> EncodeToIds(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
Protected Overrides Function EncodeToIds (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As EncodeResults(Of Integer)

Parametri

text
String

Testo da codificare.

textSpan
ReadOnlySpan<Char>

Intervallo del testo da codificare che verrà utilizzato se text è null.

settings
EncodeSettings

Impostazioni utilizzate per codificare il testo.

Valori restituiti

Risultati codificati contenenti l'elenco di ID codificati.

Si applica a

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs
Origine:
CodeGenTokenizer.cs

Codifica il testo di input in ID token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametri

text
ReadOnlySpan<Char>

Testo da codificare.

addPrefixSpace
Boolean

Indicare se includere uno spazio iniziale prima di codificare il testo.

addBeginningOfSentence
Boolean

Indicare se includere l'inizio del token di frase nella codifica.

addEndOfSentence
Boolean

Indicare se includere la fine del token di frase nella codifica.

considerPreTokenization
Boolean

Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.

considerNormalization
Boolean

Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.

Valori restituiti

Elenco di ID codificati.

Si applica a