API Reference

Class

PdfReadDocumentExtensions

Namespace OfficeIMO.Pdf
Assembly OfficeIMO.Pdf
Modifiers static

Convenience APIs for column-aware text extraction at the document level.

Inheritance

  • Object
  • PdfReadDocumentExtensions

Methods

public static IReadOnlyList<StructuredHeadingPage> ExtractHeadingsByPage(PdfReadDocument doc, PdfTextLayoutOptions options = null) #
Returns: IReadOnlyList<StructuredHeadingPage>

Extracts detected headings grouped by page while preserving heading geometry.

Parameters

doc OfficeIMO.Pdf.PdfReadDocument requiredposition: 0
Source document.
options OfficeIMO.Pdf.PdfTextLayoutOptions = null optionalposition: 1
Optional layout options.
public static IReadOnlyList<StructuredListItemPage> ExtractListItemsByPage(PdfReadDocument doc, PdfTextLayoutOptions options = null) #
Returns: IReadOnlyList<StructuredListItemPage>

Extracts detected list items grouped by page while preserving marker and nesting hints.

Parameters

doc OfficeIMO.Pdf.PdfReadDocument requiredposition: 0
Source document.
options OfficeIMO.Pdf.PdfTextLayoutOptions = null optionalposition: 1
Optional layout options.
public static IReadOnlyList<StructuredParagraphPage> ExtractParagraphsByPage(PdfReadDocument doc, PdfTextLayoutOptions options = null) #
Returns: IReadOnlyList<StructuredParagraphPage>

Extracts detected paragraphs grouped by page while preserving paragraph geometry.

Parameters

doc OfficeIMO.Pdf.PdfReadDocument requiredposition: 0
Source document.
options OfficeIMO.Pdf.PdfTextLayoutOptions = null optionalposition: 1
Optional layout options.
public static ValueTuple<List<String>, List<ValueTuple<String, Int32>>, List<String>, List<String[]>> ExtractStructured(PdfReadDocument doc, PdfTextLayoutOptions options = null) #
Returns: ValueTuple<List<String>, List<ValueTuple<String, Int32>>, List<String>, List<String[]>>

Extracts simple structured content (lines, TOC rows, list items, leader rows) for the whole document.

Parameters

doc OfficeIMO.Pdf.PdfReadDocument requiredposition: 0
Source document.
options OfficeIMO.Pdf.PdfTextLayoutOptions = null optionalposition: 1
Optional layout options.
public static IReadOnlyList<StructuredPage> ExtractStructuredPages(PdfReadDocument doc, PdfTextLayoutOptions options = null) #
Returns: IReadOnlyList<StructuredPage>

Extracts structured content for each page while preserving page boundaries and detailed table geometry.

Parameters

doc OfficeIMO.Pdf.PdfReadDocument requiredposition: 0
Source document.
options OfficeIMO.Pdf.PdfTextLayoutOptions = null optionalposition: 1
Optional layout options.
public static IReadOnlyList<StructuredTablePage> ExtractTablesByPage(PdfReadDocument doc, PdfTextLayoutOptions options = null) #
Returns: IReadOnlyList<StructuredTablePage>

Extracts detected tables grouped by page while preserving table geometry.

Parameters

doc OfficeIMO.Pdf.PdfReadDocument requiredposition: 0
Source document.
options OfficeIMO.Pdf.PdfTextLayoutOptions = null optionalposition: 1
Optional layout options.
public static String ExtractTextWithColumns(PdfReadDocument doc, PdfTextLayoutOptions options = null) #
Returns: String

Extracts text for all pages using simple two-column detection per page, separating pages with a blank line.

Parameters

doc OfficeIMO.Pdf.PdfReadDocument requiredposition: 0
Source document.
options OfficeIMO.Pdf.PdfTextLayoutOptions = null optionalposition: 1
Optional layout options controlling column detection, margins and trimming.

Returns

Concatenated plain text for all pages with inferred reading order.