BpeTokenizer.CreateAsync Metodo

Definizione

Creare un nuovo oggetto tokenizer Bpe in modo asincrono da usare per la codifica del testo.

public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)

Parametri

vocabStream
Stream

Flusso JSON contenente il dizionario di chiavi stringa e i relativi ID.

mergesStream
Stream

Flusso contenente l'elenco di coppie di token.

preTokenizer
PreTokenizer

Pre-tokenizer da usare.

normalizer
Normalizer

Normalizzatore da usare.

specialTokens
IReadOnlyDictionary<String,Int32>

Il dizionario esegue il mapping di token speciali agli ID.

unknownToken
String

Token sconosciuto da usare dal modello.

continuingSubwordPrefix
String

Prefisso da associare alle unità di sottochiave che non rappresentano un inizio di parola.

endOfWordSuffix
String

Suffisso da associare alle unità di sottochiave che rappresentano una fine di parola.

fuseUnknownTokens
Boolean

Indicare se consentire la fusione di più token sconosciuti.

Valori restituiti

Commenti

Quando si crea il tokenizer, assicurarsi che il flusso del vocabolario venga originato da un provider attendibile.

Si applica a