| AddedTokenInfo |
tokenizer.json 中 added_tokens 数组的元素。 |
8 |
| AddedVocabulary |
追加词表:在归一化与预分词之前优先命中的 token 集合。 |
6 |
| BertNormalizer |
BERT 的归一化器:清理控制字符、可选地在 CJK 字符两侧补空格、去变音符号与小写化。 |
2 |
| BertPostProcessor |
BERT 的后处理器:在序列两端补上 [CLS] 与 [SEP]。 |
1 |
| BpeModel |
字节对编码(Byte Pair Encoding)子词模型。 |
9 |
| ByteFallbackDecoder |
字节回退解码器:把 <0xXX> 形式的 token 还原为原始字节。 |
1 |
| ByteLevelAlphabet |
GPT-2 的 bytes_to_unicode 字节-字符双向映射表。 |
7 |
| ByteLevelDecoder |
ByteLevel 解码器:把映射字符还原为字节序列之后按 UTF-8 解码。 |
1 |
| ByteLevelPostProcessor |
ByteLevel 后处理器。 |
1 |
| ByteLevelPreTokenizer |
ByteLevel 预分词器:把分片按 UTF-8 编码后逐字节映射为可见字符。 |
1 |
| DigitsPreTokenizer |
数字切分预分词器。 |
1 |
| Encoding |
编码结果,等价于 HuggingFace 中的 Encoding 对象。 |
7 |
| FixedLengthPreTokenizer |
定长切分预分词器。 |
0 |
| FuseDecoder |
熔合解码器:直接拼接全部 token。 |
1 |
| HuggingFaceTokenizer |
与 Hugging Face transformers / tokenizers 兼容的子词分词器。 |
17 |
| IDecoder |
解码器契约,对应 tokenizer.json 中的 decoder 段。 |
1 |
| INormalizer |
文本归一化器契约,对应 tokenizer.json 中的 normalizer 段。 |
1 |
| IPostProcessor |
后处理器契约,对应 tokenizer.json 中的 post_processor 段。 |
1 |
| IPreTokenizer |
预分词器契约,对应 tokenizer.json 中的 pre_tokenizer 段。 |
1 |
| ITokenizerModel |
子词模型契约:BPE / WordPiece / Unigram 均实现该接口。 |
4 |
| JsonNode |
一个轻量级的 json 文档对象模型。 |
13 |
| JsonNodeType |
json 节点的数据类型。 |
6 |
| JsonReader |
供 HuggingFace 分词器模型文件使用的轻量级 json 解析器。 |
3 |
| LowercaseNormalizer |
小写化归一化器。 |
1 |
| MetaspaceDecoder |
Metaspace 解码器:把 ▁ 还原为空格。 |
1 |
| MetaspacePreTokenizer |
Metaspace 预分词器:把空格替换为 ▁(U+2581),SentencePiece 系列专用。 |
3 |
| ModelSection |
tokenizer.json 中 model 段的强类型描述。 |
13 |
| NmtNormalizer |
NMT 归一化器:把若干不可见的控制字符剔除,并把各类空白统一为普通空格。 |
1 |
| NullDecoder |
空解码器:直接把 token 首尾相接。 |
2 |
| NullNormalizer |
空归一化器:原样返回输入文本。 |
2 |
| NullPostProcessor |
空后处理器:不对 token 序列做任何改动。 |
2 |
| PrecompiledNormalizer |
SentencePiece 的 Precompiled 归一化器。 |
2 |
| PrependNormalizer |
前缀追加归一化器,常见于 Llama 系列模型(在句首补一个 ▁)。 |
1 |
| PreTokenizerBase |
预分词器的抽象基类,负责处理"逐分片应用 + 跳过特殊分片"这一通用逻辑。 |
2 |
| PunctuationPreTokenizer |
按标点符号切分的预分词器。 |
1 |
| ReplaceDecoder |
替换解码器。 |
1 |
| ReplaceNormalizer |
字符串/正则替换归一化器。 |
2 |
| RobertaPostProcessor |
RoBERTa 的后处理器:在序列两端补上 <s> 与 </s>。 |
1 |
| SequenceDecoder |
组合解码器:按顺序依次应用子解码器。 |
1 |
| SequenceNormalizer |
组合归一化器:按顺序依次应用子归一化器。 |
1 |
| SequencePostProcessor |
组合后处理器:按顺序依次应用子后处理器。 |
1 |
| SequencePreTokenizer |
组合预分词器:把上一级产出的分片依次交给子预分词器继续细分。 |
1 |
| Split |
预分词之后产生的文本分片。 |
6 |
| SplitBehavior |
Split 预分词器对匹配片段的处理方式。 |
10 |
| SplitPreTokenizer |
基于正则表达式的 Split 预分词器。 |
2 |
| StripAccentsNormalizer |
去除变音符号的归一化器。 |
1 |
| StripDecoder |
首尾裁剪解码器。 |
1 |
| StripNormalizer |
去除首尾空白字符的归一化器。 |
1 |
| TemplatePostProcessor |
模板后处理器,对应 TemplateProcessing。 |
1 |
| Token |
单个 token 的切分结果。 |
9 |
| TokenizerConfig |
tokenizer_config.json 的强类型描述。 |
12 |
| TokenizerFactory |
依据 tokenizer.json 中各配置节点的 type 字段构造流水线组件。 |
10 |
| TokenizerJson |
tokenizer.json 的强类型描述。 |
11 |
| UnicodeNormalizer |
Unicode 标准化归一化器:NFC / NFD / NFKC / NFKD。 |
1 |
| UnigramModel |
Unigram 语言模型子词切分(SentencePiece)。 |
6 |
| WhitespacePreTokenizer |
按单词/标点边界切分的预分词器(BERT 的 Whitespace)。 |
0 |
| WhitespaceSplitPreTokenizer |
仅按空白字符切分的预分词器(WhitespaceSplit)。 |
0 |
| WordPieceDecoder |
WordPiece 解码器:去除续接前缀并以空格连接。 |
2 |
| WordPieceModel |
WordPiece 子词模型(BERT 系列)。 |
5 |