WordPiece 子词模型(BERT 系列)。
WordPieceModel
00 Remarks
切分策略为贪心最长匹配:从单词的左端出发,每次在词表中查找尽可能长的 匹配子串;从第二个子词开始,候选子串需要先拼接上续接前缀(默认为 ##) 再去查表。
只要在任意一个位置上找不到匹配,或者单词的长度超过了 max_input_chars_per_word,则整个单词都会被判定为未知词, 这一点与 BPE 的逐符号回退存在本质区别。
01 Syntax
Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.WordPieceModel
02 Methods
03 Properties
| Name | Overloads | Summary |
|---|---|---|
| VocabSize | 1 |
04 Fields
| Name | Overloads | Summary |
|---|---|---|
| _maxTokenLength | 1 | 词表中最长 token 的字符数,用于收缩贪心匹配的搜索窗口。 |
05 Members
_maxTokenLength
词表中最长 token 的字符数,用于收缩贪心匹配的搜索窗口。
VocabSize
TokenToId(
String)IdToToken(
Int32)Tokenize(
String)