nuget server logo nuget api documents
↑

API Docs / Microsoft.VisualBasic.Data.NLP / SplitPreTokenizer

SplitPreTokenizer

Full name Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.SplitPreTokenizer Assembly Microsoft.VisualBasic.Data.NLP Members 2

基于正则表达式的 Split 预分词器。

00 Remarks

正则模式直接取自 tokenizer.json 而不做任何硬编码:DeepSeek 模型所使用的模式串 中含有真实的换行字符与大量转义,硬编码极易出错。

需要注意 huggingface 的 rust 实现使用的是 fancy-regex,其 Unicode 字符 类别(\p{L}、\p{P}、\p{S} 等)的边界定义与 .NET 的实现 存在极少量差异,若出现结果不一致应优先排查此处。

01 Syntax

Microsoft.VisualBasic.Data.NLP.ChineseTokenizer.HuggingFace.SplitPreTokenizer

02 Methods

NameOverloadsSummary
.ctor 1
Emit 1 按照 SplitBehavior 的语义把切片输出为分片。

03 Members

method .ctor #
#ctor(String, Boolean, SplitBehavior, Boolean)
Parameters
NameTypeDescription
patternString

切分所使用的模式。

isRegexBoolean

为真时 pattern 是正则表达式,否则会被当作字面字符串。

behaviorSplitBehavior

匹配片段的处理方式。

invertBoolean

为真时把"匹配"与"未匹配"的语义对调。

method Emit #
Emit(Split, String, List(Of ValueTuple(Of Int32, Int32, Boolean)), List(Of Split))

按照 SplitBehavior 的语义把切片输出为分片。