tokenizer.json 中 model 段的强类型描述。
ModelSection
01 Syntax
Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.ModelSection
02 Properties
| Name | Overloads | Summary |
|---|---|---|
| Type | 1 | 子词模型类型:BPE / WordPiece / Unigram。 |
| Vocab | 1 | 词表:token 字面值到词表编号的映射。 |
| IdToToken | 1 | 词表编号到 token 字面值的反查表,按最大编号预分配。 |
| Merges | 1 | BPE 的合并规则,元素形如 ("Ġ", "t"),下标即为合并优先级。 |
| UnigramScores | 1 | Unigram 模型的对数概率表,与 ModelSection.Vocab 的编号一一对应。 |
| UnkToken | 1 | 未知词的字面值,未配置时为 Nothing。 |
| UnkId | 1 | Unigram 模型中未知词的编号。 |
| ContinuingSubwordPrefix | 1 | WordPiece / BPE 中续接子词的前缀,WordPiece 默认为 ##。 |
| EndOfWordSuffix | 1 | BPE 中词尾子词的后缀,例如 </w>。 |
| FuseUnk | 1 | 是否将连续的未知词合并为单个未知词。 |
| ByteFallback | 1 | 是否启用字节回退(未登录字符退化为 <0xXX> 形式的 token)。 |
| IgnoreMerges | 1 | 为真时词表中已存在的完整词不再执行 BPE 合并。 |
| MaxInputCharsPerWord | 1 | WordPiece 中单词的最大字符数,超过则整词判定为未知词。 |
03 Members
Type
子词模型类型:BPE / WordPiece / Unigram。
Vocab
词表:token 字面值到词表编号的映射。
IdToToken
词表编号到 token 字面值的反查表,按最大编号预分配。
Merges
BPE 的合并规则,元素形如 ("Ġ", "t"),下标即为合并优先级。
UnigramScores
Unigram 模型的对数概率表,与 ModelSection.Vocab 的编号一一对应。
UnkToken
未知词的字面值,未配置时为 Nothing。
UnkId
Unigram 模型中未知词的编号。
ContinuingSubwordPrefix
WordPiece / BPE 中续接子词的前缀,WordPiece 默认为 ##。
EndOfWordSuffix
BPE 中词尾子词的后缀,例如 </w>。
FuseUnk
是否将连续的未知词合并为单个未知词。
ByteFallback
是否启用字节回退(未登录字符退化为 <0xXX> 形式的 token)。
IgnoreMerges
为真时词表中已存在的完整词不再执行 BPE 合并。
MaxInputCharsPerWord
WordPiece 中单词的最大字符数,超过则整词判定为未知词。