编码结果,等价于 HuggingFace 中的 Encoding 对象。
Encoding
01 Syntax
Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.Encoding
02 Methods
| Name | Overloads | Summary |
|---|---|---|
| ToString | 1 |
03 Properties
04 Members
Ids
token 编号序列,等价于 python 端 tokenizer.encode(text) 的返回值。
Tokens
与 Encoding.Ids 一一对应的 token 字面值序列。
TypeIds
句子编号,单句输入时全部为 0。
AttentionMask
注意力掩码,非 padding 位置为 1。
Offsets
每一个 token 在原始输入文本中的字符偏移量区间。
Count
token 的数量。
ToString()