CodeGenTokenizer.Create(Stream, Stream, Boolean, Boolean, Boolean) Methode

Definition

Erstellen Sie einen CodeGen-Tokenizer aus dem angegebenen Aufruf und führt Datenströme zusammen.

public static Microsoft.ML.Tokenizers.CodeGenTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream mergesStream, bool addPrefixSpace = false, bool addBeginOfSentence = false, bool addEndOfSentence = false);
static member Create : System.IO.Stream * System.IO.Stream * bool * bool * bool -> Microsoft.ML.Tokenizers.CodeGenTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional addPrefixSpace As Boolean = false, Optional addBeginOfSentence As Boolean = false, Optional addEndOfSentence As Boolean = false) As CodeGenTokenizer

Parameter

vocabStream
Stream

Der Datenstrom, der die vocab-Datei enthält.

mergesStream
Stream

Der Datenstrom, der die Zusammenführungsdatei enthält.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Token ein Leerzeichen hinzugefügt werden soll.

addBeginOfSentence
Boolean

Geben Sie den Anfang des Satztokens während der Codierung an.

addEndOfSentence
Boolean

Geben Sie während der Codierung das Ende des Satztokens an.

Gibt zurück

Das CodeGen-Tokenizer-Objekt.

Hinweise

Der Tokenizer wird gemäß der in der Angegebenen Konfiguration erstellt. https://huggingface.co/Salesforce/codegen-350M-mono/raw/main/tokenizer.json. Es ist wichtig, die ähnlichenVocab-Dateien bereitzustellen und Dateien zusammenzuführen, die in der Schulung des Modells verwendet werden. Die Dateien "vocab" und "merges" können über die folgenden Links heruntergeladen werden: https://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/vocab.json?download=truehttps://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/merges.txt?download=true Stellen Sie beim Erstellen des Tokenizers sicher, dass der Vokabulardatenstrom von einem vertrauenswürdigen Anbieter stammt.

Gilt für: