CodeGenTokenizer.Create(Stream, Stream, Boolean, Boolean, Boolean) Methode
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Erstellen Sie einen CodeGen-Tokenizer aus dem angegebenen Aufruf und führt Datenströme zusammen.
public static Microsoft.ML.Tokenizers.CodeGenTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream mergesStream, bool addPrefixSpace = false, bool addBeginOfSentence = false, bool addEndOfSentence = false);
static member Create : System.IO.Stream * System.IO.Stream * bool * bool * bool -> Microsoft.ML.Tokenizers.CodeGenTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional addPrefixSpace As Boolean = false, Optional addBeginOfSentence As Boolean = false, Optional addEndOfSentence As Boolean = false) As CodeGenTokenizer
Parameter
- vocabStream
- Stream
Der Datenstrom, der die vocab-Datei enthält.
- mergesStream
- Stream
Der Datenstrom, der die Zusammenführungsdatei enthält.
- addPrefixSpace
- Boolean
Geben Sie an, ob vor dem Token ein Leerzeichen hinzugefügt werden soll.
- addBeginOfSentence
- Boolean
Geben Sie den Anfang des Satztokens während der Codierung an.
- addEndOfSentence
- Boolean
Geben Sie während der Codierung das Ende des Satztokens an.
Gibt zurück
Das CodeGen-Tokenizer-Objekt.
Hinweise
Der Tokenizer wird gemäß der in der Angegebenen Konfiguration erstellt. https://huggingface.co/Salesforce/codegen-350M-mono/raw/main/tokenizer.json. Es ist wichtig, die ähnlichenVocab-Dateien bereitzustellen und Dateien zusammenzuführen, die in der Schulung des Modells verwendet werden. Die Dateien "vocab" und "merges" können über die folgenden Links heruntergeladen werden: https://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/vocab.json?download=truehttps://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/merges.txt?download=true Stellen Sie beim Erstellen des Tokenizers sicher, dass der Vokabulardatenstrom von einem vertrauenswürdigen Anbieter stammt.