本文研究的主要问题时Python读取word文本操作,分享了相关概念和实现代码,具体如下。
一,docx模块
Python可以利用python-docx模块处理word文档,处理方式是面向对象的。也就是说python-docx模块会把word文档,文档中的段落、文本、字体等都看做对象,对对象进行处理就是对word文档的内容处理。
二,相关概念
如果需要读取word文档中的文字(一般来说,程序也只需要认识word文档中的文字信息),需要先了解python-docx模块的几个概念。
1,Document对象,表示一个word文档。
2,Paragraph对象,表示word文档中的一个段落
3,Paragraph对象的text属性,表示段落中的文本内容。
三,模块的安装和导入
需要注意,python-docx模块安装需要在cmd命令行中输入pip install python-docx,如下图表示安装成功(最后那句英文Successfully installed,成功地安装完成,十分考验英文水平。)
注意在导入模块时,用的是import docx。
也真是奇了怪了,怎么安装和导入模块时,很多都不用一个名字,看来是很有必要出一个python版本的模块管理程序python-maven了,本段纯属PS。
四,读取word文本
在了解了上面的信息之后,就很简单了,下面先创建一个D:\temp\word.docx文件,并在其中输入如下内容。
然后写一段程序,代码及输出结果如下:
1
2
3
4
5
6
7
8
9
10
11
12
13
|
#读取docx中的文本代码示例 import docx #获取文档对象 file = docx.Document( "D:\\temp\\word.docx" ) print ( "段落数:" + str ( len ( file .paragraphs))) #段落数为13,每个回车隔离一段 #输出每一段的内容 for para in file .paragraphs: print (para.text) #输出段落编号及段落内容 for i in range ( len ( file .paragraphs)): print ( "第" + str (i) + "段的内容是:" + file .paragraphs[i].text) |
运行结果:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
|
= = = = = = = = = = = = = = = = RESTART: F: / 360data / 重要数据 / 桌面 / 学习笔记 / readWord.py = = = = = = = = = = = = = = = = 段落数: 13 啊 我看见一座山 雄伟的大山 真高啊 啊 这座山是! 真的很高! 第 0 段的内容是:啊 第 1 段的内容是: 第 2 段的内容是:我看见一座山 第 3 段的内容是: 第 4 段的内容是:雄伟的大山 第 5 段的内容是: 第 6 段的内容是:真高啊 第 7 段的内容是: 第 8 段的内容是:啊 第 9 段的内容是: 第 10 段的内容是:这座山是! 第 11 段的内容是: 第 12 段的内容是:真的很高! >>> |
总结
以上就是本文关于Python读取word文本操作详解的全部内容,希望对大家有所帮助。感兴趣的朋友可以继续参阅本站其他相关专题,如有不足之处,欢迎留言指出。感谢朋友们对本站的支持!
原文链接:http://blog.csdn.net/woshisangsang/article/details/75221723