BpeTokenizer.Create Metodo
Definizione
Importante
Alcune informazioni sono relative alla release non definitiva del prodotto, che potrebbe subire modifiche significative prima della release definitiva. Microsoft non riconosce alcuna garanzia, espressa o implicita, in merito alle informazioni qui fornite.
Overload
| Nome | Descrizione |
|---|---|
| Create(Stream, Stream) |
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo. |
| Create(String, String) |
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo. |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo. |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo. |
Create(Stream, Stream)
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer
Parametri
- vocabStream
- Stream
Flusso JSON contenente il dizionario di chiavi stringa e i relativi ID.
- mergesStream
- Stream
Flusso contenente l'elenco di coppie di token.
Valori restituiti
Commenti
Quando si crea il tokenizer, assicurarsi che il flusso del vocabolario venga originato da un provider attendibile.
Si applica a
Create(String, String)
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer
Parametri
- vocabFile
- String
Percorso del file JSON contenente il dizionario delle chiavi stringa e i relativi ID.
- mergesFile
- String
Percorso del file contenente l'elenco di coppie di token.
Valori restituiti
Commenti
Quando si crea il tokenizer, assicurarsi che il file del vocabolario venga originato da un provider attendibile.
Si applica a
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Parametri
- vocabStream
- Stream
Flusso JSON contenente il dizionario di chiavi stringa e i relativi ID.
- mergesStream
- Stream
Flusso contenente l'elenco di coppie di token.
- preTokenizer
- PreTokenizer
Pre-tokenizer da usare.
- normalizer
- Normalizer
Normalizzatore da usare.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Il dizionario esegue il mapping di token speciali agli ID.
- unknownToken
- String
Token sconosciuto da usare dal modello.
- continuingSubwordPrefix
- String
Prefisso da associare alle unità di sottochiave che non rappresentano un inizio di parola.
- endOfWordSuffix
- String
Suffisso da associare alle unità di sottochiave che rappresentano una fine di parola.
- fuseUnknownTokens
- Boolean
Indicare se consentire la fusione di più token sconosciuti.
Valori restituiti
Commenti
Quando si crea il tokenizer, assicurarsi che il flusso del vocabolario venga originato da un provider attendibile.
Si applica a
Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
- Origine:
- BPETokenizer.cs
Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Parametri
- vocabFile
- String
Percorso del file JSON contenente il dizionario delle chiavi stringa e i relativi ID.
- mergesFile
- String
Percorso del file contenente l'elenco di coppie di token.
- preTokenizer
- PreTokenizer
Pre-tokenizer da usare.
- normalizer
- Normalizer
Normalizzatore da usare.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Il dizionario esegue il mapping di token speciali agli ID.
- unknownToken
- String
Token sconosciuto da usare dal modello.
- continuingSubwordPrefix
- String
Prefisso da associare alle unità di sottochiave che non rappresentano un inizio di parola.
- endOfWordSuffix
- String
Suffisso da associare alle unità di sottochiave che rappresentano una fine di parola.
- fuseUnknownTokens
- Boolean
Indicare se consentire la fusione di più token sconosciuti.
Valori restituiti
Commenti
Quando si crea il tokenizer, assicurarsi che il file del vocabolario venga originato da un provider attendibile.