BpeTokenizer.Create Metodo

Definizione

Overload

Nome Descrizione
Create(Stream, Stream)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

Create(String, String)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

Create(Stream, Stream)

Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer

Parametri

vocabStream
Stream

Flusso JSON contenente il dizionario di chiavi stringa e i relativi ID.

mergesStream
Stream

Flusso contenente l'elenco di coppie di token.

Valori restituiti

Commenti

Quando si crea il tokenizer, assicurarsi che il flusso del vocabolario venga originato da un provider attendibile.

Si applica a

Create(String, String)

Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer

Parametri

vocabFile
String

Percorso del file JSON contenente il dizionario delle chiavi stringa e i relativi ID.

mergesFile
String

Percorso del file contenente l'elenco di coppie di token.

Valori restituiti

Commenti

Quando si crea il tokenizer, assicurarsi che il file del vocabolario venga originato da un provider attendibile.

Si applica a

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parametri

vocabStream
Stream

Flusso JSON contenente il dizionario di chiavi stringa e i relativi ID.

mergesStream
Stream

Flusso contenente l'elenco di coppie di token.

preTokenizer
PreTokenizer

Pre-tokenizer da usare.

normalizer
Normalizer

Normalizzatore da usare.

specialTokens
IReadOnlyDictionary<String,Int32>

Il dizionario esegue il mapping di token speciali agli ID.

unknownToken
String

Token sconosciuto da usare dal modello.

continuingSubwordPrefix
String

Prefisso da associare alle unità di sottochiave che non rappresentano un inizio di parola.

endOfWordSuffix
String

Suffisso da associare alle unità di sottochiave che rappresentano una fine di parola.

fuseUnknownTokens
Boolean

Indicare se consentire la fusione di più token sconosciuti.

Valori restituiti

Commenti

Quando si crea il tokenizer, assicurarsi che il flusso del vocabolario venga originato da un provider attendibile.

Si applica a

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs
Origine:
BPETokenizer.cs

Creare un nuovo oggetto tokenizer Bpe da usare per la codifica del testo.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parametri

vocabFile
String

Percorso del file JSON contenente il dizionario delle chiavi stringa e i relativi ID.

mergesFile
String

Percorso del file contenente l'elenco di coppie di token.

preTokenizer
PreTokenizer

Pre-tokenizer da usare.

normalizer
Normalizer

Normalizzatore da usare.

specialTokens
IReadOnlyDictionary<String,Int32>

Il dizionario esegue il mapping di token speciali agli ID.

unknownToken
String

Token sconosciuto da usare dal modello.

continuingSubwordPrefix
String

Prefisso da associare alle unità di sottochiave che non rappresentano un inizio di parola.

endOfWordSuffix
String

Suffisso da associare alle unità di sottochiave che rappresentano una fine di parola.

fuseUnknownTokens
Boolean

Indicare se consentire la fusione di più token sconosciuti.

Valori restituiti

Commenti

Quando si crea il tokenizer, assicurarsi che il file del vocabolario venga originato da un provider attendibile.

Si applica a