Tokenizer.GetIndexByTokenCount Metodo
Definizione
Importante
Alcune informazioni sono relative alla release non definitiva del prodotto, che potrebbe subire modifiche significative prima della release definitiva. Microsoft non riconosce alcuna garanzia, espressa o implicita, in merito alle informazioni qui fornite.
Overload
| Nome | Descrizione |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- Origine:
- Tokenizer.cs
- Origine:
- Tokenizer.cs
- Origine:
- Tokenizer.cs
Trovare l'indice della capacità di codifica massima senza superare il limite di token.
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parametri
- text
- ReadOnlySpan<Char>
Testo da codificare.
- maxTokenCount
- Int32
Numero massimo di token da codificare.
- normalizedText
- String
Se la normalizzazione del tokenizer è abilitata o <paramRef name="considerPreTokenization"></paramRef> è false, verrà impostata su <paramRef name="text"></paramRef> nel formato normalizzato; in caso contrario, questo valore verrà impostato su null.
- tokenCount
- Int32
Il numero di token può essere generato che deve essere inferiore al numero massimo di token.
- considerPreTokenization
- Boolean
Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.
- considerNormalization
- Boolean
Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.
Valori restituiti
Indice della capacità di codifica massima all'interno del testo elaborato senza superare il limite di token.
Rappresenta l'indice immediatamente successivo all'ultimo carattere da includere. Nei casi in cui non si adatti alcun token, il risultato sarà 0; viceversa, se tutti i token rientrano, il risultato sarà la lunghezza del testo di input o se normalizedText la normalizzazione è abilitata.
Si applica a
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)
- Origine:
- Tokenizer.cs
- Origine:
- Tokenizer.cs
- Origine:
- Tokenizer.cs
Trovare l'indice della capacità di codifica massima senza superare il limite di token.
public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parametri
- text
- String
Testo da codificare.
- maxTokenCount
- Int32
Numero massimo di token da codificare.
- normalizedText
- String
Se la normalizzazione del tokenizer è abilitata o <paramRef name="considerNormalization"></paramRef> è false, verrà impostata su <paramRef name="text"></paramRef> nel formato normalizzato; in caso contrario, questo valore verrà impostato su null.
- tokenCount
- Int32
Il numero di token può essere generato che deve essere inferiore al numero massimo di token.
- considerPreTokenization
- Boolean
Indicare se prendere in considerazione la pre-tokenizzazione prima della tokenizzazione.
- considerNormalization
- Boolean
Indicare se prendere in considerazione la normalizzazione prima della tokenizzazione.
Valori restituiti
Indice della capacità di codifica massima all'interno del testo elaborato senza superare il limite di token.
Rappresenta l'indice immediatamente successivo all'ultimo carattere da includere. Nei casi in cui non si adatti alcun token, il risultato sarà 0; viceversa, se tutti i token rientrano, il risultato sarà la lunghezza del testo di input o se normalizedText la normalizzazione è abilitata.
Si applica a
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- Origine:
- Tokenizer.cs
- Origine:
- Tokenizer.cs
- Origine:
- Tokenizer.cs
Trovare l'indice della capacità di codifica massima senza superare il limite di token.
protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
Parametri
- text
- String
Testo da codificare.
- textSpan
- ReadOnlySpan<Char>
Intervallo del testo da codificare che verrà utilizzato se text è null.
- settings
- EncodeSettings
Impostazioni utilizzate per codificare il testo.
- fromEnd
- Boolean
Indica se trovare l'indice dalla fine del testo.
- normalizedText
- String
Se la normalizzazione del tokenizer è abilitata o <paramRef name="settings"></paramRef> has ConsiderNormalization è false, verrà impostata su <paramRef name="text"></paramRef> nel formato normalizzato; in caso contrario, questo valore verrà impostato su null.
- tokenCount
- Int32
Il numero di token può essere generato che deve essere inferiore al numero massimo di token.
Valori restituiti
Indice della capacità di codifica massima all'interno del testo elaborato senza superare il limite di token.
Se <paramRef name="fromEnd"></paramRef> è false, rappresenta l'indice immediatamente successivo all'ultimo carattere da includere. Nei casi in cui non si adatti alcun token, il risultato sarà 0; viceversa, se tutti i token rientrano, il risultato sarà la lunghezza del testo di input o se normalizedText la normalizzazione è abilitata.
Se <paramRef name="fromEnd"></paramRef> è true, rappresenta l'indice del primo carattere da includere. Nei casi in cui non si adattano token, il risultato sarà la lunghezza del testo; viceversa, se tutti i token rientrano, il risultato sarà zero.
Commenti
I tipi derivati da Tokenizer possono eseguire l'override di questa implementazione per fornire un'implementazione più efficiente. Per impostazione predefinita, usa EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).