BpeTokenizer.CreateAsync Methode

Definition

Erstellen Sie asynchron ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)

Parameter

vocabStream
Stream

Der JSON-Stream, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.

mergesStream
Stream

Der Datenstrom, der die Liste der Tokenpaare enthält.

preTokenizer
PreTokenizer

Der zu verwendende Prätokenizer.

normalizer
Normalizer

Der zu verwendende Normalisierer.

specialTokens
IReadOnlyDictionary<String,Int32>

Die Wörterbuchzuordnung spezieller Token zu IDs.

unknownToken
String

Das unbekannte Token, das vom Modell verwendet werden soll.

continuingSubwordPrefix
String

Das Präfix, das an Unterworteinheiten angefügt werden soll, die keinen Anfang des Worts darstellen.

endOfWordSuffix
String

Das Suffix, das an Unterworteinheiten angefügt werden soll, die ein Wortende darstellen.

fuseUnknownTokens
Boolean

Geben Sie an, ob mehrere unbekannte Token verfugen werden.

Gibt zurück

Hinweise

Stellen Sie beim Erstellen des Tokenizers sicher, dass der Vokabulardatenstrom von einem vertrauenswürdigen Anbieter stammt.

Gilt für: