From c95d5c05bac929801fa14a7bbdb9e669e0335769 Mon Sep 17 00:00:00 2001 From: David Frizelle <48738745+dafriz@users.noreply.github.com> Date: Mon, 28 Apr 2025 20:00:29 +1000 Subject: [PATCH] Bump org.apache.tika to 3.1.0 (#2900) Signed-off-by: David Frizelle --- document-readers/tika-reader/pom.xml | 2 +- .../org/springframework/ai/reader/tika/TikaDocumentReader.java | 2 +- .../src/main/antora/modules/ROOT/pages/api/etl-pipeline.adoc | 2 +- 3 files changed, 3 insertions(+), 3 deletions(-) diff --git a/document-readers/tika-reader/pom.xml b/document-readers/tika-reader/pom.xml index a1d069fbf..1f3e2d8cb 100644 --- a/document-readers/tika-reader/pom.xml +++ b/document-readers/tika-reader/pom.xml @@ -37,7 +37,7 @@ - 3.0.0 + 3.1.0 diff --git a/document-readers/tika-reader/src/main/java/org/springframework/ai/reader/tika/TikaDocumentReader.java b/document-readers/tika-reader/src/main/java/org/springframework/ai/reader/tika/TikaDocumentReader.java index 88d63f7d2..0de33b2b3 100644 --- a/document-readers/tika-reader/src/main/java/org/springframework/ai/reader/tika/TikaDocumentReader.java +++ b/document-readers/tika-reader/src/main/java/org/springframework/ai/reader/tika/TikaDocumentReader.java @@ -37,7 +37,7 @@ import org.springframework.util.StringUtils; /** * A document reader that leverages Apache Tika to extract text from a variety of document * formats, such as PDF, DOC/DOCX, PPT/PPTX, and HTML. For a comprehensive list of - * supported formats, refer to: https://tika.apache.org/3.0.0/formats.html. + * supported formats, refer to: https://tika.apache.org/3.1.0/formats.html. * * This reader directly provides the extracted text without any additional formatting. All * extracted texts are encapsulated within a {@link Document} instance. diff --git a/spring-ai-docs/src/main/antora/modules/ROOT/pages/api/etl-pipeline.adoc b/spring-ai-docs/src/main/antora/modules/ROOT/pages/api/etl-pipeline.adoc index 4b2cab493..58f461d45 100644 --- a/spring-ai-docs/src/main/antora/modules/ROOT/pages/api/etl-pipeline.adoc +++ b/spring-ai-docs/src/main/antora/modules/ROOT/pages/api/etl-pipeline.adoc @@ -561,7 +561,7 @@ public class MyPagePdfDocumentReader { === Tika (DOCX, PPTX, HTML...) -The `TikaDocumentReader` uses Apache Tika to extract text from a variety of document formats, such as PDF, DOC/DOCX, PPT/PPTX, and HTML. For a comprehensive list of supported formats, refer to the https://tika.apache.org/2.9.0/formats.html[Tika documentation]. +The `TikaDocumentReader` uses Apache Tika to extract text from a variety of document formats, such as PDF, DOC/DOCX, PPT/PPTX, and HTML. For a comprehensive list of supported formats, refer to the https://tika.apache.org/3.1.0/formats.html[Tika documentation]. ==== Dependencies