add use layout or not option (#145)

* add use layout or not option * trival
2026-01-31 07:36:46 +08:00 · 2024-03-22 19:21:09 +08:00
parent 2f4c71b4b4
commit f6aee7f230
18 changed files with 238 additions and 140 deletions
--- a/rag/app/presentation.py
+++ b/rag/app/presentation.py
@ -18,7 +18,8 @@ from PIL import Image

 from rag.nlp import tokenize, is_english
 from rag.nlp import huqie
-from deepdoc.parser import PdfParser, PptParser
+from deepdoc.parser import PdfParser, PptParser, PlainParser
+from PyPDF2 import PdfReader as pdf2_read


 class Ppt(PptParser):
@ -56,19 +57,6 @@ class Pdf(PdfParser):
        callback(0.8, "Page {}~{}: OCR finished".format(from_page, min(to_page, self.total_page)))
        assert len(self.boxes) == len(self.page_images), "{} vs. {}".format(len(self.boxes), len(self.page_images))
        res = []
-        #################### More precisely ###################
-        # self._layouts_rec(zoomin)
-        # self._text_merge()
-        # pages = {}
-        # for b in self.boxes:
-        #     if self.__garbage(b["text"]):continue
-        #     if b["page_number"] not in pages: pages[b["page_number"]] = []
-        #     pages[b["page_number"]].append(b["text"])
-        # for i, lines in pages.items():
-        #     res.append(("\n".join(lines), self.page_images[i-1]))
-        # return res
-        ########################################
-
        for i in range(len(self.boxes)):
            lines = "\n".join([b["text"] for b in self.boxes[i] if not self.__garbage(b["text"])])
            res.append((lines, self.page_images[i]))
@ -76,6 +64,16 @@ class Pdf(PdfParser):
        return res


+class PlainPdf(PlainParser):
+    def __call__(self, filename, binary=None, callback=None, **kwargs):
+        self.pdf = pdf2_read(filename if not binary else BytesIO(filename))
+        page_txt = []
+        for page in self.pdf.pages:
+            page_txt.append(page.extract_text())
+        callback(0.9, "Parsing finished")
+        return [(txt, None) for txt in page_txt]
+
+
 def chunk(filename, binary=None, from_page=0, to_page=100000, lang="Chinese", callback=None, **kwargs):
    """
    The supported file formats are pdf, pptx.
@ -102,14 +100,14 @@ def chunk(filename, binary=None, from_page=0, to_page=100000, lang="Chinese", ca
            res.append(d)
        return res
    elif re.search(r"\.pdf$", filename, re.IGNORECASE):
-        pdf_parser = Pdf()
-        for pn, (txt,img) in enumerate(pdf_parser(filename if not binary else binary, from_page=from_page, to_page=to_page, callback=callback)):
+        pdf_parser = Pdf() if kwargs.get("parser_config",{}).get("layout_recognize", True) else PlainPdf()
+        for pn, (txt,img) in enumerate(pdf_parser(filename, binary, from_page=from_page, to_page=to_page, callback=callback)):
            d = copy.deepcopy(doc)
            pn += from_page
-            d["image"] = img
+            if img: d["image"] = img
            d["page_num_int"] = [pn+1]
            d["top_int"] = [0]
-            d["position_int"] = [(pn + 1, 0, img.size[0], 0, img.size[1])]
+            d["position_int"] = [(pn + 1, 0, img.size[0] if img else 0, 0, img.size[1] if img else 0)]
            tokenize(d, txt, eng)
            res.append(d)
        return res