CodeGenTokenizer.CountTokens Methode

Definition

Überlädt

Name Beschreibung
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

protected override int CountTokens(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.CountTokens : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> int
Protected Overrides Function CountTokens (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As Integer

Parameter

text
String

Der zu codierenden Text.

textSpan
ReadOnlySpan<Char>

Der Bereich des zu codierenden Texts, der verwendet wird, wenn dies der text Grund ist null.

settings
EncodeSettings

Die Einstellungen, die zum Codieren des Texts verwendet werden.

Gibt zurück

Die Anzahl der Token-IDs, auf die der Eingabetext codiert wird.

Gilt für:

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

public int CountTokens(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parameter

text
ReadOnlySpan<Char>

Der zu codierenden Text.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Die Anzahl der Token-IDs, auf die der Eingabetext codiert wird.

Gilt für:

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

public int CountTokens(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : string * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parameter

text
String

Der zu codierenden Text.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Die Anzahl der Token-IDs, auf die der Eingabetext codiert wird.

Gilt für: