BpeTokenizer.Create Methode
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Überlädt
| Name | Beschreibung |
|---|---|
| Create(Stream, Stream) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| Create(String, String) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll. |
Create(Stream, Stream)
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer
Parameter
- vocabStream
- Stream
Der JSON-Stream, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.
- mergesStream
- Stream
Der Datenstrom, der die Liste der Tokenpaare enthält.
Gibt zurück
Hinweise
Stellen Sie beim Erstellen des Tokenizers sicher, dass der Vokabulardatenstrom von einem vertrauenswürdigen Anbieter stammt.
Gilt für:
Create(String, String)
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer
Parameter
- vocabFile
- String
Der JSON-Dateipfad, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.
- mergesFile
- String
Der Dateipfad, der die Liste der Tokenpaare enthält.
Gibt zurück
Hinweise
Stellen Sie beim Erstellen des Tokenizers sicher, dass die Vokabulardatei von einem vertrauenswürdigen Anbieter stammt.
Gilt für:
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Parameter
- vocabStream
- Stream
Der JSON-Stream, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.
- mergesStream
- Stream
Der Datenstrom, der die Liste der Tokenpaare enthält.
- preTokenizer
- PreTokenizer
Der zu verwendende Prätokenizer.
- normalizer
- Normalizer
Der zu verwendende Normalisierer.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Die Wörterbuchzuordnung spezieller Token zu IDs.
- unknownToken
- String
Das unbekannte Token, das vom Modell verwendet werden soll.
- continuingSubwordPrefix
- String
Das Präfix, das an Unterworteinheiten angefügt werden soll, die keinen Anfang des Worts darstellen.
- endOfWordSuffix
- String
Das Suffix, das an Unterworteinheiten angefügt werden soll, die ein Wortende darstellen.
- fuseUnknownTokens
- Boolean
Geben Sie an, ob mehrere unbekannte Token verfugen werden.
Gibt zurück
Hinweise
Stellen Sie beim Erstellen des Tokenizers sicher, dass der Vokabulardatenstrom von einem vertrauenswürdigen Anbieter stammt.
Gilt für:
Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
- Quelle:
- BPETokenizer.cs
Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Parameter
- vocabFile
- String
Der JSON-Dateipfad, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.
- mergesFile
- String
Der Dateipfad, der die Liste der Tokenpaare enthält.
- preTokenizer
- PreTokenizer
Der zu verwendende Prätokenizer.
- normalizer
- Normalizer
Der zu verwendende Normalisierer.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Die Wörterbuchzuordnung spezieller Token zu IDs.
- unknownToken
- String
Das unbekannte Token, das vom Modell verwendet werden soll.
- continuingSubwordPrefix
- String
Das Präfix, das an Unterworteinheiten angefügt werden soll, die keinen Anfang des Worts darstellen.
- endOfWordSuffix
- String
Das Suffix, das an Unterworteinheiten angefügt werden soll, die ein Wortende darstellen.
- fuseUnknownTokens
- Boolean
Geben Sie an, ob mehrere unbekannte Token verfugen werden.
Gibt zurück
Hinweise
Stellen Sie beim Erstellen des Tokenizers sicher, dass die Vokabulardatei von einem vertrauenswürdigen Anbieter stammt.