Forum Discussion
aby_29
1 year agoNew Member
Import PDF in Fabric Notebook
Hi everyone, I'm looking to extract some data from some PDF files that are stored in a lakehouse. I would ideally like to store the extracted data as tables in the lakehouse. Is there a way to im...
- 1 year ago
did this worked?
nilendraFabric
Super User
1 year agoaby_29
this approach worked for me, Once data is in DF you can do anything with it.
%pip install PyPDF2
from io import BytesIO
import PyPDF2
binary_df = spark.read.format("binaryFile").load("Files/MyFolder/sample.pdf").limit(1)
pdf_bytes = binary_df.collect()[0].content
file_stream = BytesIO(pdf_bytes)
reader = PyPDF2.PdfReader(file_stream)
extracted_text = ""
for page in reader.pages:
extracted_text += page.extract_text()
data_rows = [{"content": extracted_text}]
df = spark.createDataFrame(data_rows)
df.write.mode("overwrite").format("delta").saveAsTable("ExtractedPdfData")