TextCatalog Klasse

Definition

Sammlung von Erweiterungsmethoden für die TransformsCatalog.

public static class TextCatalog
type TextCatalog = class
Public Module TextCatalog
Vererbung
TextCatalog

Methoden

Name Beschreibung
ApplyWordEmbedding(TransformsCatalog+TextTransforms, String, String, String)

Erstellen Sie einen WordEmbeddingEstimatorText-Featurizer, der Vektoren von Text in numerische Vektoren mit vortrainierten Einbettungsmodellen konvertiert.

ApplyWordEmbedding(TransformsCatalog+TextTransforms, String, String, WordEmbeddingEstimator+PretrainedModelKind)

Erstellen Sie einen WordEmbeddingEstimatorText-Featurizer, der einen Textvektor in einen numerischen Vektor konvertiert, indem Sie vortrainierte Einbettungsmodelle verwenden.

FeaturizeText(TransformsCatalog+TextTransforms, String, String)

Erstellen Sie eine TextFeaturizingEstimator, die eine Textspalte in einen featurisierten Vektor transformiert, der Single normalisierte Anzahl von n-Gramm und Char-Gramm darstellt.

FeaturizeText(TransformsCatalog+TextTransforms, String, TextFeaturizingEstimator+Options, String[])

Erstellen Sie eine TextFeaturizingEstimator, die eine Textspalte in einen featurisierten Vektor transformiert, der Single normalisierte Anzahl von n-Gramm und Char-Gramm darstellt.

LatentDirichletAllocation(TransformsCatalog+TextTransforms, String, String, Int32, Single, Single, Int32, Int32, Int32, Int32, Int32, Int32, Int32, Boolean)

Erstellen Sie eine LatentDirichletAllocationEstimator, die LightLDA verwendet, um Text (dargestellt als Vektor von Floats) in einen Vektor zu transformieren, der Single die Ähnlichkeit des Texts mit jedem identifizierten Thema angibt.

NormalizeText(TransformsCatalog+TextTransforms, String, String, TextNormalizingEstimator+CaseMode, Boolean, Boolean, Boolean)

Erstellt einen TextNormalizingEstimator, der eingehenden Text normalisiert, indem optional die Groß-/Kleinschreibung inputColumnName geändert wird, wobei diakritische Markierungen, Satzzeichen, Zahlen und ausgabe neuer Text als outputColumnName.

ProduceHashedNgrams(TransformsCatalog+TextTransforms, String, String, Int32, Int32, Int32, Boolean, UInt32, Boolean, Int32, Boolean)

Erstellen Sie einen NgramHashingEstimator, der die Daten aus der spalte kopiert, die in inputColumnName einer neuen Spalte angegeben ist: outputColumnName und erzeugt einen Vektor der Anzahl von Hashwert n-Gramm.

ProduceHashedNgrams(TransformsCatalog+TextTransforms, String, String[], Int32, Int32, Int32, Boolean, UInt32, Boolean, Int32, Boolean)

Erstellen Sie eine NgramHashingEstimator, die die Daten aus den in einer neuen Spalte angegebenen inputColumnNames mehreren Spalten verwendet: outputColumnName und erzeugt einen Vektor der Anzahl von Hash-n-Gramm.

ProduceHashedWordBags(TransformsCatalog+TextTransforms, String, String, Int32, Int32, Int32, Boolean, UInt32, Boolean, Int32)

Erstellen Sie eine WordHashBagEstimator, die die Spalte, die in inputColumnName einem Vektor der Anzahl der Hash-n-Gramm in einer neuen Spalte mit dem Namen angegeben outputColumnNameist.

ProduceHashedWordBags(TransformsCatalog+TextTransforms, String, String[], Int32, Int32, Int32, Boolean, UInt32, Boolean, Int32)

Erstellen Sie einen WordHashBagEstimator, der die mehreren Spalten inputColumnNames zugeordnet, die einem Vektor der Anzahl von hashigen n-Gramm in einer neuen Spalte mit dem Namen zugeordnet outputColumnNamesind.

ProduceNgrams(TransformsCatalog+TextTransforms, String, String, Int32, Int32, Boolean, Int32, NgramExtractingEstimator+WeightingCriteria)

Erstellt einen NgramExtractingEstimator Vektor der Anzahl von n Gramm (Sequenzen von aufeinander folgenden Wörtern), der im Eingabetext gefunden wird.

ProduceWordBags(TransformsCatalog+TextTransforms, String, Char, Char, String, Int32)

Erstellen Sie eine WordBagEstimator, die die Spalte, die in inputColumnName einem Vektor von n-Gramm-Zählungen in einer neuen Spalte mit dem Namen angegeben outputColumnNameist.

ProduceWordBags(TransformsCatalog+TextTransforms, String, String, Int32, Int32, Boolean, Int32, NgramExtractingEstimator+WeightingCriteria)

Erstellen Sie eine WordBagEstimator, die die Spalte, die in inputColumnName einem Vektor von n-Gramm-Zählungen in einer neuen Spalte mit dem Namen angegeben outputColumnNameist.

ProduceWordBags(TransformsCatalog+TextTransforms, String, String[], Int32, Int32, Boolean, Int32, NgramExtractingEstimator+WeightingCriteria)

Erstellen Sie einen WordBagEstimator, der die in einem Vektor mit n-Gramm-Anzahl angegebenen inputColumnNames mehreren Spalten in einer neuen Spalte mit dem Namen outputColumnNameordnet.

RemoveDefaultStopWords(TransformsCatalog+TextTransforms, String, String, StopWordsRemovingEstimator+Language)

Erstellen Sie einen CustomStopWordsRemovingEstimator, der die Daten aus der spalte kopiert, die in inputColumnName einer neuen Spalte angegeben ist: outputColumnName und entfernt vordefinierten Textsatz, der für language sie spezifisch ist.

RemoveStopWords(TransformsCatalog+TextTransforms, String, String, String[])

Erstellen Sie einen CustomStopWordsRemovingEstimator, der die Daten aus der spalte kopiert, die in inputColumnName einer neuen Spalte angegeben ist: outputColumnName und entfernt darin angegebenen stopwords Text.

TokenizeIntoCharactersAsKeys(TransformsCatalog+TextTransforms, String, String, Boolean)

Erstellen Sie einen TokenizingByCharactersEstimator, der tokenisiert wird, indem Sie Text in Zeichenabfolgen unter Verwendung eines Gleitfensters aufteilen.

TokenizeIntoWords(TransformsCatalog+TextTransforms, String, String, Char[])

Erstellen Sie einen WordTokenizingEstimator, der Eingabetext separators mit Trennzeichen tokenisiert.

Gilt für: