nuget server logo nuget api documents
↑

API Docs / Microsoft.VisualBasic.MIME.application.pdf / TextExtractor

TextExtractor

Full name Microsoft.VisualBasic.MIME.application.pdf.TextExtractor Assembly Microsoft.VisualBasic.MIME.application.pdf Members 4

01 Syntax

Microsoft.VisualBasic.MIME.application.pdf.TextExtractor

02 Methods

NameOverloadsSummary
ExtractFromPage 1 提取单页文本。
ExtractAll 1 提取整个文档文本。
TryDecodeStream 1 解码内容流;单个流损坏(滤镜不支持、数据截断等)时返回空,避免一页坏数据中断整篇提取。
ResolveAs 1 取字典值并在必要时解引用:若对象是 PdfReference 则先 Resolve,再按目标类型 TryCast。 页面 /Resources、资源 /Font、字体 /Encoding 都可能是间接引用(N 0 R)。

03 Members

method ExtractFromPage #
ExtractFromPage(PdfDictionary)

提取单页文本。

method ExtractAll #
ExtractAll

提取整个文档文本。

method TryDecodeStream #
TryDecodeStream(PdfStream)

解码内容流;单个流损坏(滤镜不支持、数据截断等)时返回空,避免一页坏数据中断整篇提取。

method ResolveAs #
ResolveAs``1(PdfObject)

取字典值并在必要时解引用:若对象是 PdfReference 则先 Resolve,再按目标类型 TryCast。 页面 /Resources、资源 /Font、字体 /Encoding 都可能是间接引用(N 0 R)。