CodeGenTokenizer Klasse

Definition

Represent the Byte Pair Encoding model. Implementieren des codeGen-Tokenizers, der in https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
    inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
Vererbung
CodeGenTokenizer
Abgeleitet

Eigenschaften

Name Beschreibung
AddBeginningOfSentence

Ruft das Flag ab, das angibt, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

AddEndOfSentence

Ruft das Flag ab, das angibt, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

AddPrefixSpace

Ruft das Flag ab, das angibt, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

BeginningOfSentenceId

Ruft das Ende des Satztokens-ID ab.

BeginningOfSentenceToken

Ruft den Anfang des Satztokens ab.

EndOfSentenceId

Ruft das Ende des Satztokens-ID ab.

EndOfSentenceToken

Ruft das Ende des Satztokens ab.

Normalizer

Ruft den vom Tokenizer verwendeten Normalizer ab.

PreTokenizer

Ruft das vom Tokenizer verwendete PreTokenizer ab.

SpecialTokens

Ruft die hinzugefügten Token ab.

UnknownToken

Das unbekannte Token.

UnknownTokenId

Ruft die unbekannte Token-ID ab.

Vocabulary

Ruft die Wörterbuchzuordnungstoken zu IDs ab.

Methoden

Name Beschreibung
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

CountTokens(String, Boolean, Boolean)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

(Geerbt von Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird.

Create(Stream, Stream, Boolean, Boolean, Boolean)

Erstellen Sie einen CodeGen-Tokenizer aus dem angegebenen Aufruf und führt Datenströme zusammen.

Decode(IEnumerable<Int32>, Boolean, Boolean)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der destination Spanne.

Decode(IEnumerable<Int32>)

Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

(Geerbt von Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

(Geerbt von Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

EncodeToIds(String, Boolean, Boolean)

Codiert Eingabetext in Token-IDs.

(Geerbt von Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token.

<param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in Token-IDs.

EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung.

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codiert Eingabetext in eine Liste von EncodedTokens.

EncodeToTokens(String, String, Boolean, Boolean)

Codiert Eingabetext in eine Liste von EncodedTokens.

(Geerbt von Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität vom Ende des Texts, ohne den Tokengrenzwert zu überschreiten.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität vom Ende des Texts, ohne den Tokengrenzwert zu überschreiten.

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

(Geerbt von Tokenizer)

Gilt für: