BpeTokenizer.CreateAsync Metodo
Definizione
Importante
Alcune informazioni sono relative alla release non definitiva del prodotto, che potrebbe subire modifiche significative prima della release definitiva. Microsoft non riconosce alcuna garanzia, espressa o implicita, in merito alle informazioni qui fornite.
Creare un nuovo oggetto tokenizer Bpe in modo asincrono da usare per la codifica del testo.
public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)
Parametri
- vocabStream
- Stream
Flusso JSON contenente il dizionario di chiavi stringa e i relativi ID.
- mergesStream
- Stream
Flusso contenente l'elenco di coppie di token.
- preTokenizer
- PreTokenizer
Pre-tokenizer da usare.
- normalizer
- Normalizer
Normalizzatore da usare.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Il dizionario esegue il mapping di token speciali agli ID.
- unknownToken
- String
Token sconosciuto da usare dal modello.
- continuingSubwordPrefix
- String
Prefisso da associare alle unità di sottochiave che non rappresentano un inizio di parola.
- endOfWordSuffix
- String
Suffisso da associare alle unità di sottochiave che rappresentano una fine di parola.
- fuseUnknownTokens
- Boolean
Indicare se consentire la fusione di più token sconosciuti.
Valori restituiti
Commenti
Quando si crea il tokenizer, assicurarsi che il flusso del vocabolario venga originato da un provider attendibile.