基于正则表达式的 Split 预分词器。
SplitPreTokenizer
00 Remarks
正则模式直接取自 tokenizer.json 而不做任何硬编码:DeepSeek 模型所使用的模式串 中含有真实的换行字符与大量转义,硬编码极易出错。
需要注意 huggingface 的 rust 实现使用的是 fancy-regex,其 Unicode 字符 类别(\p{L}、\p{P}、\p{S} 等)的边界定义与 .NET 的实现 存在极少量差异,若出现结果不一致应优先排查此处。
01 Syntax
Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.SplitPreTokenizer
02 Methods
03 Members
Parameters
| Name | Type | Description |
|---|---|---|
pattern | String | 切分所使用的模式。 |
isRegex | Boolean | 为真时 pattern 是正则表达式,否则会被当作字面字符串。 |
behavior | SplitBehavior | 匹配片段的处理方式。 |
invert | Boolean | 为真时把"匹配"与"未匹配"的语义对调。 |
按照 SplitBehavior 的语义把切片输出为分片。