Langchain-Chatchat/document_loaders/mypdfloader.py

from typing import List
from langchain.document_loaders.unstructured import UnstructuredFileLoader
from configs import PDF_OCR_THRESHOLD
from document_loaders.ocr import get_ocr
#PDF_OCR_THRESHOLD= (0.6,0.6)
#from ocr import get_ocr
import tqdm
import re

class RapidOCRPDFLoader(UnstructuredFileLoader):
    def _get_elements(self) -> List:
        def pdf2text(filepath):
            import fitz # pyMuPDF里面的fitz包，不要与pip install fitz混淆
            import numpy as np
            ocr = get_ocr()
            doc = fitz.open(filepath)
            resp = ""

            b_unit = tqdm.tqdm(total=doc.page_count, desc="RapidOCRPDFLoader context page index: 0")
            for i, page in enumerate(doc):
                b_unit.set_description("RapidOCRPDFLoader context page index: {}".format(i))
                b_unit.refresh()
                print(f"****page:{i+1}****")
                text = page.get_text("")
                text_lines = text.strip().split("\n")
                #print(f"文字内容：{text_lines}")

                img_list = page.get_image_info(xrefs=True)
                ocr_result = []
                for img in img_list:
                    if xref := img.get("xref"):
                        bbox = img["bbox"]
                        # 检查图片尺寸是否超过设定的阈值
                        if ((bbox[2] - bbox[0]) / (page.rect.width) < PDF_OCR_THRESHOLD[0]
                            or (bbox[3] - bbox[1]) / (page.rect.height) < PDF_OCR_THRESHOLD[1]):
                            continue
                        pix = fitz.Pixmap(doc, xref)
                        img_array = np.frombuffer(pix.samples, dtype=np.uint8).reshape(pix.height, pix.width, -1)
                        result, _ = ocr(img_array)
                        if result:
                            ocr_result = [line[1] for line in result]
                            #print(f"图片内容：{ocr_result}")
                            #resp += "\n".join(ocr_result)

                if (len(ocr_result)>0):
                    resp += "\n".join(ocr_result)
                else:
                    if text_lines:
                        # 假设页码在最后一行
                        if text_lines[-1].isdigit():
                            text = "\n".join(text_lines[:-1])
                            print(f"******去除了页码")
                    resp += text + "\n"

                # 更新进度
                b_unit.update(1)
            
            resp = re.sub(r'((?<!.)\d+(?!\.|[a-zA-Z0-9]))', r"\1 ", resp) 
            resp = re.sub(r'((?<!.)[a-zA-Z0-9]+\s*\.\s*[a-zA-Z0-9]+(?!\.|[a-zA-Z0-9]))', r"\1 ", resp) 
            resp = re.sub(r'((?<!.)[a-zA-Z0-9]+\s*\.\s*[a-zA-Z0-9]+\s*\.\s*[a-zA-Z0-9]+(?!\.|[a-zA-Z0-9]))', r"\1 ", resp) 
            return resp

        text = pdf2text(self.file_path)
        from unstructured.partition.text import partition_text
        return partition_text(text=text, **self.unstructured_kwargs)


if __name__ == "__main__":
    loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/图片版pdf数据/变电站集中监控验收技术导则.pdf")
    #loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/原PDF文档/设备/AQ80012007.pdf")
    #loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/原PDF文档/设备/DL4081991.pdf")
    #loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/原PDF文档/设备/AQ80032007.pdf")
    docs = loader.load()
    print(docs)
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
+								from typing import List
 								from langchain.document_loaders.unstructured import UnstructuredFileLoader
-												publish 0.2.10 (#2797)

新功能：
- 优化 PDF 文件的 OCR，过滤无意义的小图片 by @liunux4odoo #2525
- 支持 Gemini 在线模型 by @yhfgyyf #2630
- 支持 GLM4 在线模型 by @zRzRzRzRzRzRzR
- elasticsearch更新https连接 by @xldistance #2390
- 增强对PPT、DOC知识库文件的OCR识别 by @596192804 #2013
- 更新 Agent 对话功能 by @zRzRzRzRzRzRzR
- 每次创建对象时从连接池获取连接，避免每次执行方法时都新建连接 by @Lijia0 #2480
- 实现 ChatOpenAI 判断token有没有超过模型的context上下文长度 by @glide-the
- 更新运行数据库报错和项目里程碑 by @zRzRzRzRzRzRzR #2659
- 更新配置文件/文档/依赖 by @imClumsyPanda @zRzRzRzRzRzRzR
- 添加日文版 readme by @eltociear #2787

修复：
- langchain 更新后，PGVector 向量库连接错误 by @HALIndex #2591
- Minimax's model worker 错误 by @xyhshen 
- ES库无法向量检索.添加mappings创建向量索引 by MSZheng20 #2688
											
										
										
											2024-01-26 06:58:49 +08:00
+								from configs import PDF_OCR_THRESHOLD
-												ocr 支持 GPU 加速（需要手动安装 rapidocr_paddle[gpu])；知识库支持 MHTML 和 Evernote 文件。 (#2265)

在 requirements 和 Wiki 中增加对可选文档加载器 SDK 的说明 ( close #2264 )

											
										
										
											2023-12-04 09:39:56 +08:00
+								from document_loaders.ocr import get_ocr
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
+								#PDF_OCR_THRESHOLD= (0.6,0.6)
 								#from ocr import get_ocr
-												增加显示ocr识别进度

											
										
										
											2023-09-08 21:32:41 +08:00
+								import tqdm
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
+								import re
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
 								class RapidOCRPDFLoader(UnstructuredFileLoader):
 								    def _get_elements(self) -> List:
 								        def pdf2text(filepath):
-												提醒fitz包是来自pyMuPDF (#1407)


											
										
										
											2023-09-08 12:20:20 +08:00
+								            import fitz # pyMuPDF里面的fitz包，不要与pip install fitz混淆
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
+								            import numpy as np
-												ocr 支持 GPU 加速（需要手动安装 rapidocr_paddle[gpu])；知识库支持 MHTML 和 Evernote 文件。 (#2265)

在 requirements 和 Wiki 中增加对可选文档加载器 SDK 的说明 ( close #2264 )

											
										
										
											2023-12-04 09:39:56 +08:00
+								            ocr = get_ocr()
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
+								            doc = fitz.open(filepath)
 								            resp = ""
-												增加显示ocr识别进度

											
										
										
											2023-09-08 21:32:41 +08:00
 								            b_unit = tqdm.tqdm(total=doc.page_count, desc="RapidOCRPDFLoader context page index: 0")
 								            for i, page in enumerate(doc):
 								                b_unit.set_description("RapidOCRPDFLoader context page index: {}".format(i))
 								                b_unit.refresh()
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
+								                print(f"****page:{i+1}****")
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
+								                text = page.get_text("")
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
+								                text_lines = text.strip().split("\n")
 								                #print(f"文字内容：{text_lines}")
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
-												publish 0.2.10 (#2797)

新功能：
- 优化 PDF 文件的 OCR，过滤无意义的小图片 by @liunux4odoo #2525
- 支持 Gemini 在线模型 by @yhfgyyf #2630
- 支持 GLM4 在线模型 by @zRzRzRzRzRzRzR
- elasticsearch更新https连接 by @xldistance #2390
- 增强对PPT、DOC知识库文件的OCR识别 by @596192804 #2013
- 更新 Agent 对话功能 by @zRzRzRzRzRzRzR
- 每次创建对象时从连接池获取连接，避免每次执行方法时都新建连接 by @Lijia0 #2480
- 实现 ChatOpenAI 判断token有没有超过模型的context上下文长度 by @glide-the
- 更新运行数据库报错和项目里程碑 by @zRzRzRzRzRzRzR #2659
- 更新配置文件/文档/依赖 by @imClumsyPanda @zRzRzRzRzRzRzR
- 添加日文版 readme by @eltociear #2787

修复：
- langchain 更新后，PGVector 向量库连接错误 by @HALIndex #2591
- Minimax's model worker 错误 by @xyhshen 
- ES库无法向量检索.添加mappings创建向量索引 by MSZheng20 #2688
											
										
										
											2024-01-26 06:58:49 +08:00
+								                img_list = page.get_image_info(xrefs=True)
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
+								                ocr_result = []
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
+								                for img in img_list:
-												publish 0.2.10 (#2797)

新功能：
- 优化 PDF 文件的 OCR，过滤无意义的小图片 by @liunux4odoo #2525
- 支持 Gemini 在线模型 by @yhfgyyf #2630
- 支持 GLM4 在线模型 by @zRzRzRzRzRzRzR
- elasticsearch更新https连接 by @xldistance #2390
- 增强对PPT、DOC知识库文件的OCR识别 by @596192804 #2013
- 更新 Agent 对话功能 by @zRzRzRzRzRzRzR
- 每次创建对象时从连接池获取连接，避免每次执行方法时都新建连接 by @Lijia0 #2480
- 实现 ChatOpenAI 判断token有没有超过模型的context上下文长度 by @glide-the
- 更新运行数据库报错和项目里程碑 by @zRzRzRzRzRzRzR #2659
- 更新配置文件/文档/依赖 by @imClumsyPanda @zRzRzRzRzRzRzR
- 添加日文版 readme by @eltociear #2787

修复：
- langchain 更新后，PGVector 向量库连接错误 by @HALIndex #2591
- Minimax's model worker 错误 by @xyhshen 
- ES库无法向量检索.添加mappings创建向量索引 by MSZheng20 #2688
											
										
										
											2024-01-26 06:58:49 +08:00
+								                    if xref := img.get("xref"):
 								                        bbox = img["bbox"]
 								                        # 检查图片尺寸是否超过设定的阈值
 								                        if ((bbox[2] - bbox[0]) / (page.rect.width) < PDF_OCR_THRESHOLD[0]
 								                            or (bbox[3] - bbox[1]) / (page.rect.height) < PDF_OCR_THRESHOLD[1]):
 								                            continue
 								                        pix = fitz.Pixmap(doc, xref)
 								                        img_array = np.frombuffer(pix.samples, dtype=np.uint8).reshape(pix.height, pix.width, -1)
 								                        result, _ = ocr(img_array)
 								                        if result:
 								                            ocr_result = [line[1] for line in result]
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
+								                            #print(f"图片内容：{ocr_result}")
 								                            #resp += "\n".join(ocr_result)
 								                if (len(ocr_result)>0):
 								                    resp += "\n".join(ocr_result)
 								                else:
 								                    if text_lines:
 								                        # 假设页码在最后一行
 								                        if text_lines[-1].isdigit():
 								                            text = "\n".join(text_lines[:-1])
 								                            print(f"******去除了页码")
 								                    resp += text + "\n"
-												增加显示ocr识别进度

											
										
										
											2023-09-08 21:32:41 +08:00
 								                # 更新进度
 								                b_unit.update(1)
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
 								            resp = re.sub(r'((?<!.)\d+(?!\.|[a-zA-Z0-9]))', r"\1 ", resp)
 								            resp = re.sub(r'((?<!.)[a-zA-Z0-9]+\s*\.\s*[a-zA-Z0-9]+(?!\.|[a-zA-Z0-9]))', r"\1 ", resp)
 								            resp = re.sub(r'((?<!.)[a-zA-Z0-9]+\s*\.\s*[a-zA-Z0-9]+\s*\.\s*[a-zA-Z0-9]+(?!\.|[a-zA-Z0-9]))', r"\1 ", resp)
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
+								            return resp
 								        text = pdf2text(self.file_path)
 								        from unstructured.partition.text import partition_text
 								        return partition_text(text=text, **self.unstructured_kwargs)
 								if __name__ == "__main__":
-												enhance pdf loader

											
										
										
											2024-03-18 09:28:30 +08:00
+								    loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/图片版pdf数据/变电站集中监控验收技术导则.pdf")
 								    #loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/原PDF文档/设备/AQ80012007.pdf")
 								    #loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/原PDF文档/设备/DL4081991.pdf")
 								    #loader = RapidOCRPDFLoader(file_path="/Users/wangvivi/Desktop/Work/思极GPT/数字化部/原PDF文档/设备/AQ80032007.pdf")
-												add RapidOCRPDFLoader and RapidOCRLoader (#1275)

* add RapidOCRPDFLoader

* update mypdfloader.py and requirements.txt

* add myimgloader.py

* add test samples

* add TODO to mypdfloader

* add loaders to KnowledgeFile class

* add loaders to KnowledgeFile class
											
										
										
											2023-09-01 10:23:57 +08:00
+								    docs = loader.load()
 								    print(docs)