CodeGenTokenizer.EncodeToIds Methode

Definition

Überlädt

Name Beschreibung
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in Token-IDs.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parameter

text
String

Der zu codierenden Text.

maxTokenCount
Int32

Die maximale Anzahl zu codierenden Token.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

normalizedText
String

Wenn die Normalisierung des Tokenizers aktiviert ist, wird der Eingabetext in seiner Normalisierungsform dargestellt. andernfalls ist er NULL.

charsConsumed
Int32

Die Länge des Texts, der die maximal codierten Token umfasst.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Die Liste der codierten IDs.

Gilt für:

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Codiert Eingabetext in Token-IDs.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parameter

text
String

Der zu codierenden Text.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Die Liste der codierten IDs.

Gilt für:

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parameter

text
ReadOnlySpan<Char>

Der zu codierenden Text.

maxTokenCount
Int32

Die maximale Anzahl zu codierenden Token.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

normalizedText
String

Wenn die Normalisierung des Tokenizers aktiviert ist, wird der Eingabetext in seiner Normalisierungsform dargestellt. andernfalls ist er NULL.

charsConsumed
Int32

Die Länge des Texts, der die maximal codierten Token umfasst.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Die Liste der codierten IDs.

Gilt für:

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Codiert Eingabetext in Token-IDs.

protected override Microsoft.ML.Tokenizers.EncodeResults<int> EncodeToIds(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
Protected Overrides Function EncodeToIds (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As EncodeResults(Of Integer)

Parameter

text
String

Der zu codierenden Text.

textSpan
ReadOnlySpan<Char>

Der Bereich des zu codierenden Texts, der verwendet wird, wenn dies der text Grund ist null.

settings
EncodeSettings

Die Einstellungen, die zum Codieren des Texts verwendet werden.

Gibt zurück

Die codierten Ergebnisse, die die Liste der codierten IDs enthalten.

Gilt für:

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Codiert Eingabetext in Token-IDs.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parameter

text
ReadOnlySpan<Char>

Der zu codierenden Text.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Die Liste der codierten IDs.

Gilt für: