下載本文檔
版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡介
第python從PDF中提取數(shù)據(jù)的示例前言
數(shù)據(jù)是數(shù)據(jù)科學(xué)中任何分析的關(guān)鍵,大多數(shù)分析中最常用的數(shù)據(jù)集類型是存儲(chǔ)在逗號(hào)分隔值(csv)表中的干凈數(shù)據(jù)。然而,由于可移植文檔格式(pdf)文件是最常用的文件格式之一,因此每個(gè)數(shù)據(jù)科學(xué)家都應(yīng)該了解如何從pdf文件中提取數(shù)據(jù),并將數(shù)據(jù)轉(zhuǎn)換為諸如csv之類的格式,以便用于分析或構(gòu)建模型。
在本文中,我們將重點(diǎn)討論如何從pdf文件中提取數(shù)據(jù)表。類似的分析可以用于從pdf文件中提取其他類型的數(shù)據(jù),如文本或圖像。我們將說明如何從pdf文件中提取數(shù)據(jù)表,然后將其轉(zhuǎn)換為適合于進(jìn)一步分析和構(gòu)建模型的格式。我們將給出一個(gè)實(shí)例。
02
示例:使用Python從PDF文件中提取一個(gè)表格
a)將表復(fù)制到Excel并保存為table_1_raw.csv
數(shù)據(jù)以一維格式存儲(chǔ),必須進(jìn)行重塑、清理和轉(zhuǎn)換。
b)導(dǎo)入必要的庫
importpandasaspd
importnumpyasnp
c)導(dǎo)入原始數(shù)據(jù),重新定義數(shù)據(jù)
df=pd.read_csv(table_1_raw.csv,header=None)
df.values.shape
df2=pd.DataFrame(df.values.reshape(25,10))
column_names=df2[0:1].values[0]
df3=df2[1:]
df3.columns=df2[0:1].values[0]
df3.head()
d)使用字符串處理工具進(jìn)行數(shù)據(jù)糾纏
我們從上面的表格中注意到,x5、x6和x7列是用百分比表示的,所以我們需要去掉percent(%)符號(hào):
df4[x5]=list(map(lambdax:x[:-1],df4[x5].values))
df4[x6]=list(map(lambdax:x[:-1],df4[x6].values))
df4[x7]=list(map(lambdax:x[:-1],df4[x7].values))
e)將數(shù)據(jù)轉(zhuǎn)換為數(shù)字形式
我們注意到列x5、x6和x7的列值數(shù)據(jù)類型為string,因此我們需要將它們轉(zhuǎn)換為數(shù)值數(shù)據(jù),如下所示:
df4[x5]=[float(x)forxindf4[x5].values]
df4[x6]=[float(x)forxindf4[x6].values]
df4[x7]=[float(x)forxindf4[x7].values]
f)查看轉(zhuǎn)換數(shù)據(jù)的最終形式
df4.head(n=5)
g)導(dǎo)出最終數(shù)據(jù)到一個(gè)csv文件
df4.to_csv(table_1_final.csv,index=Fal
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。
最新文檔
- 2026年獅山鎮(zhèn)小塘第一幼兒園招聘備考題庫及答案詳解一套
- 2026年杭州市文三教育集團(tuán)文宣小學(xué)教師招聘備考題庫(非事業(yè))及參考答案詳解一套
- 2026年黑龍江民族職業(yè)學(xué)院單招職業(yè)技能筆試模擬試題帶答案解析
- 山東省濟(jì)寧市梁山京師華宇高中2026年教師招聘備考題庫及完整答案詳解1套
- 2026河南洛陽日?qǐng)?bào)報(bào)業(yè)集團(tuán)視覺夢(mèng)工坊招聘4人筆試備考題庫及答案解析
- 2026貴州省盤州市第二酒廠招聘4人筆試模擬試題及答案解析
- 2026江西吉安井岡農(nóng)業(yè)生物科技有限公司招聘見習(xí)人員1人筆試參考題庫及答案解析
- 2026年黟縣國有投資集團(tuán)有限公司公開招聘勞務(wù)派遣人員備考題庫完整答案詳解
- 2026年貴陽幼兒師范高等??茖W(xué)校單招職業(yè)技能考試參考題庫帶答案解析
- 2026年永州市零陵區(qū)陽光社會(huì)工作服務(wù)中心招聘人員備考題庫參考答案詳解
- 2026年廣州市民政局直屬事業(yè)單位第一次公開招聘工作人員25人備考題庫及1套參考答案詳解
- 廣西壯族自治區(qū)南寧市2025-2026學(xué)年七年級(jí)上學(xué)期期末語文綜合試題
- 2024VADOD臨床實(shí)踐指南:耳鳴的管理解讀課件
- 22S803 圓形鋼筋混凝土蓄水池
- 考點(diǎn)21 三角恒等變換4種常見考法歸類(解析版)
- 2023年04月青海西寧大通縣生態(tài)環(huán)境綜合行政執(zhí)法大隊(duì)公開招聘編外工作人員2人筆試歷年難易錯(cuò)點(diǎn)考題含答案帶詳細(xì)解析
- 2022年黑龍江省鶴崗市統(tǒng)招專升本生理學(xué)病理解剖學(xué)歷年真題匯總及答案
- 2023年考研考博-考博英語-浙江工業(yè)大學(xué)考試歷年真題摘選含答案解析
- GB/T 42340-2023生態(tài)系統(tǒng)評(píng)估生態(tài)系統(tǒng)格局與質(zhì)量評(píng)價(jià)方法
- GB/T 32682-2016塑料聚乙烯環(huán)境應(yīng)力開裂(ESC)的測(cè)定全缺口蠕變?cè)囼?yàn)(FNCT)
- 民族打擊樂器教學(xué)內(nèi)容課件
評(píng)論
0/150
提交評(píng)論