Tokenizer.GetIndexByTokenCount Methode
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Überlädt
| Name | Beschreibung |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- Quelle:
- Tokenizer.cs
- Quelle:
- Tokenizer.cs
- Quelle:
- Tokenizer.cs
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parameter
- text
- ReadOnlySpan<Char>
Der zu codierenden Text.
- maxTokenCount
- Int32
Die maximale Anzahl zu codierenden Token.
- normalizedText
- String
Wenn die Normalisierung des Tokenizers aktiviert ist oder <paramRef name="considerPreTokenization"></paramRef> ist false, wird dies auf <paramRef name="text"></paramRef> in normalisierter Form festgelegt. Andernfalls wird dieser Wert auf " null.
- tokenCount
- Int32
Die Tokenanzahl kann generiert werden, die kleiner als die maximale Tokenanzahl sein soll.
- considerPreTokenization
- Boolean
Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.
- considerNormalization
- Boolean
Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.
Gibt zurück
Der Index der maximalen Codierungskapazität innerhalb des verarbeiteten Texts, ohne den Tokengrenzwert zu überschreiten.
Er stellt den Index unmittelbar nach dem letzten zeichen dar, das eingeschlossen werden soll. In Fällen, in denen keine Token passen, lautet das Ergebnis 0; Wenn alle Token passen, entspricht das Ergebnis der Länge des Eingabetexts oder der normalizedText Aktivierung der Normalisierung.
Gilt für:
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)
- Quelle:
- Tokenizer.cs
- Quelle:
- Tokenizer.cs
- Quelle:
- Tokenizer.cs
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.
public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parameter
- text
- String
Der zu codierenden Text.
- maxTokenCount
- Int32
Die maximale Anzahl zu codierenden Token.
- normalizedText
- String
Wenn die Normalisierung des Tokenizers aktiviert ist oder <paramRef name="considerNormalization"></paramRef> ist false, wird dies auf <paramRef name="text"></paramRef> in normalisierter Form festgelegt. Andernfalls wird dieser Wert auf " null.
- tokenCount
- Int32
Die Tokenanzahl kann generiert werden, die kleiner als die maximale Tokenanzahl sein soll.
- considerPreTokenization
- Boolean
Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.
- considerNormalization
- Boolean
Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.
Gibt zurück
Der Index der maximalen Codierungskapazität innerhalb des verarbeiteten Texts, ohne den Tokengrenzwert zu überschreiten.
Er stellt den Index unmittelbar nach dem letzten zeichen dar, das eingeschlossen werden soll. In Fällen, in denen keine Token passen, lautet das Ergebnis 0; Wenn alle Token passen, entspricht das Ergebnis der Länge des Eingabetexts oder der normalizedText Aktivierung der Normalisierung.
Gilt für:
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- Quelle:
- Tokenizer.cs
- Quelle:
- Tokenizer.cs
- Quelle:
- Tokenizer.cs
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.
protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
Parameter
- text
- String
Der zu codierenden Text.
- textSpan
- ReadOnlySpan<Char>
Der Bereich des zu codierenden Texts, der verwendet wird, wenn dies der text Grund ist null.
- settings
- EncodeSettings
Die Einstellungen, die zum Codieren des Texts verwendet werden.
- fromEnd
- Boolean
Geben Sie an, ob der Index vom Ende des Texts gesucht werden soll.
- normalizedText
- String
Wenn die Normalisierung des Tokenizers aktiviert ist oder <paramRef name="settings"></paramRef> has ConsiderNormalization is, falsethis will be set to <paramRef name="text"></paramRef> in its normalized form; otherwise, this value will be set to null.
- tokenCount
- Int32
Die Tokenanzahl kann generiert werden, die kleiner als die maximale Tokenanzahl sein soll.
Gibt zurück
Der Index der maximalen Codierungskapazität innerhalb des verarbeiteten Texts, ohne den Tokengrenzwert zu überschreiten.
Wenn <paramRef name="fromEnd"></paramRef> is false, it represents the index immediately following the last character to be included. In Fällen, in denen keine Token passen, lautet das Ergebnis 0; Wenn alle Token passen, entspricht das Ergebnis der Länge des Eingabetexts oder der normalizedText Aktivierung der Normalisierung.
Wenn <paramRef name="fromEnd"></paramRef> ist true, stellt sie den Index des ersten zeichens dar, das eingeschlossen werden soll. In Fällen, in denen keine Token passen, ist das Ergebnis die Textlänge; Umgekehrt, wenn alle Token passen, ist das Ergebnis null.
Hinweise
Von dieser Implementierung abgeleitete Tokenizer Typen können außer Kraft setzen, um eine effizientere Implementierung bereitzustellen. Standardmäßig wird verwendet EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).