Question

如何解析带有表单的Pdf文件以获取我的Web服务器上的字段位置和页面＃？例如，有一些pdf结构如下：

<</AcroForm 23 0 R/Metadata 2 0 R/Outlines 6 0 R/Pages 9 0 R/Type/Catalog>>
endobj
19 0 obj
<</DA(/ZaDb 0 Tf 0 g)/FT/Btn/Ff 49152/Kids[18 0 R 20 0 R]/T(Language)>>
endobj
23 0 obj
<</DA(/Helv 0 Tf 0 g )/DR<</Encoding<</PDFDocEncoding 26 0 R>>/Font<</Helv 22 0 R/ZaDb 35 0 R>>/XObject<</DSz 51 0 R>>>>/Fields[19 0 R 21 0 R 39 0 R 16 0 R 17 0 R 46 0 R 47 0 R 48 0 R]/SigFlags 1>>
endobj
25 0 obj
<</BBox[0.0 0.0 72.0 20.0]/FormType 1/Length 102/Matrix[1.0 0.0 0.0 1.0 0.0 0.0]/Resources<</Font<</Helv 22 0 R>>/ProcSet[/PDF/Text]>>/Subtype/Form/Type/XObject>>stream
1 g
0 0 72 20 re
f
/Tx BMC
q
2 1 68 18 re

如何使用PHP或JavaScript从此代码获取字段位置？或者我可以尝试哪些库/实用程序？ Pdftk无法解决我的问题:( 感谢。

Answer 1

不幸的是，如果尝试将PDF扫描为文本，我们无法获得更多信息，因为它比我们想象的要复杂得多。

我使用Itext PDF库解决了这个问题。见这里：

Itext get field coordinates from existing pdf

使用PHP或JavaScript解析pdf表单以获取字段位置

1 个答案: