BpeTokenizer.Create Methode

Definition

Überlädt

Name Beschreibung
Create(Stream, Stream)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Create(String, String)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

Create(Stream, Stream)

Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer

Parameter

vocabStream
Stream

Der JSON-Stream, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.

mergesStream
Stream

Der Datenstrom, der die Liste der Tokenpaare enthält.

Gibt zurück

Hinweise

Stellen Sie beim Erstellen des Tokenizers sicher, dass der Vokabulardatenstrom von einem vertrauenswürdigen Anbieter stammt.

Gilt für:

Create(String, String)

Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer

Parameter

vocabFile
String

Der JSON-Dateipfad, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.

mergesFile
String

Der Dateipfad, der die Liste der Tokenpaare enthält.

Gibt zurück

Hinweise

Stellen Sie beim Erstellen des Tokenizers sicher, dass die Vokabulardatei von einem vertrauenswürdigen Anbieter stammt.

Gilt für:

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parameter

vocabStream
Stream

Der JSON-Stream, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.

mergesStream
Stream

Der Datenstrom, der die Liste der Tokenpaare enthält.

preTokenizer
PreTokenizer

Der zu verwendende Prätokenizer.

normalizer
Normalizer

Der zu verwendende Normalisierer.

specialTokens
IReadOnlyDictionary<String,Int32>

Die Wörterbuchzuordnung spezieller Token zu IDs.

unknownToken
String

Das unbekannte Token, das vom Modell verwendet werden soll.

continuingSubwordPrefix
String

Das Präfix, das an Unterworteinheiten angefügt werden soll, die keinen Anfang des Worts darstellen.

endOfWordSuffix
String

Das Suffix, das an Unterworteinheiten angefügt werden soll, die ein Wortende darstellen.

fuseUnknownTokens
Boolean

Geben Sie an, ob mehrere unbekannte Token verfugen werden.

Gibt zurück

Hinweise

Stellen Sie beim Erstellen des Tokenizers sicher, dass der Vokabulardatenstrom von einem vertrauenswürdigen Anbieter stammt.

Gilt für:

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs
Quelle:
BPETokenizer.cs

Erstellen Sie ein neues Bpe-Tokenizer-Objekt, das für die Textcodierung verwendet werden soll.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parameter

vocabFile
String

Der JSON-Dateipfad, der das Wörterbuch von Zeichenfolgenschlüsseln und deren IDs enthält.

mergesFile
String

Der Dateipfad, der die Liste der Tokenpaare enthält.

preTokenizer
PreTokenizer

Der zu verwendende Prätokenizer.

normalizer
Normalizer

Der zu verwendende Normalisierer.

specialTokens
IReadOnlyDictionary<String,Int32>

Die Wörterbuchzuordnung spezieller Token zu IDs.

unknownToken
String

Das unbekannte Token, das vom Modell verwendet werden soll.

continuingSubwordPrefix
String

Das Präfix, das an Unterworteinheiten angefügt werden soll, die keinen Anfang des Worts darstellen.

endOfWordSuffix
String

Das Suffix, das an Unterworteinheiten angefügt werden soll, die ein Wortende darstellen.

fuseUnknownTokens
Boolean

Geben Sie an, ob mehrere unbekannte Token verfugen werden.

Gibt zurück

Hinweise

Stellen Sie beim Erstellen des Tokenizers sicher, dass die Vokabulardatei von einem vertrauenswürdigen Anbieter stammt.

Gilt für: