CodeGenTokenizer.CountTokens Methode
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Überlädt
| Name | Beschreibung |
|---|---|
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)
- Quelle:
- CodeGenTokenizer.cs
- Quelle:
- CodeGenTokenizer.cs
- Quelle:
- CodeGenTokenizer.cs
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.
protected override int CountTokens(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.CountTokens : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> int
Protected Overrides Function CountTokens (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As Integer
Parameter
- text
- String
Der zu codierenden Text.
- textSpan
- ReadOnlySpan<Char>
Der Bereich des zu codierenden Texts, der verwendet wird, wenn dies der text Grund ist null.
- settings
- EncodeSettings
Die Einstellungen, die zum Codieren des Texts verwendet werden.
Gibt zurück
Die Anzahl der Token-IDs, auf die der Eingabetext codiert wird.
Gilt für:
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)
- Quelle:
- CodeGenTokenizer.cs
- Quelle:
- CodeGenTokenizer.cs
- Quelle:
- CodeGenTokenizer.cs
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.
public int CountTokens(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parameter
- text
- ReadOnlySpan<Char>
Der zu codierenden Text.
- addPrefixSpace
- Boolean
Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.
- addBeginningOfSentence
- Boolean
Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.
- addEndOfSentence
- Boolean
Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.
- considerPreTokenization
- Boolean
Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.
- considerNormalization
- Boolean
Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.
Gibt zurück
Die Anzahl der Token-IDs, auf die der Eingabetext codiert wird.
Gilt für:
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)
- Quelle:
- CodeGenTokenizer.cs
- Quelle:
- CodeGenTokenizer.cs
- Quelle:
- CodeGenTokenizer.cs
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.
public int CountTokens(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : string * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parameter
- text
- String
Der zu codierenden Text.
- addPrefixSpace
- Boolean
Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.
- addBeginningOfSentence
- Boolean
Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.
- addEndOfSentence
- Boolean
Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.
- considerPreTokenization
- Boolean
Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.
- considerNormalization
- Boolean
Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.
Gibt zurück
Die Anzahl der Token-IDs, auf die der Eingabetext codiert wird.