nuget server logo nuget api documents
↑

API Docs / Microsoft.VisualBasic.Data.NLP / WordPieceModel

WordPieceModel

Full name Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.WordPieceModel Assembly Microsoft.VisualBasic.Data.NLP Members 5

WordPiece 子词模型(BERT 系列)。

00 Remarks

切分策略为贪心最长匹配:从单词的左端出发,每次在词表中查找尽可能长的 匹配子串;从第二个子词开始,候选子串需要先拼接上续接前缀(默认为 ##) 再去查表。

只要在任意一个位置上找不到匹配,或者单词的长度超过了 max_input_chars_per_word,则整个单词都会被判定为未知词, 这一点与 BPE 的逐符号回退存在本质区别。

01 Syntax

Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.WordPieceModel

02 Methods

NameOverloadsSummary
TokenToId 1
IdToToken 1
Tokenize 1

03 Properties

NameOverloadsSummary
VocabSize 1

04 Fields

NameOverloadsSummary
_maxTokenLength 1 词表中最长 token 的字符数,用于收缩贪心匹配的搜索窗口。

05 Members

field _maxTokenLength #
_maxTokenLength

词表中最长 token 的字符数,用于收缩贪心匹配的搜索窗口。

property VocabSize #
VocabSize
method TokenToId #
TokenToId(String)
method IdToToken #
IdToToken(Int32)
method Tokenize #
Tokenize(String)