文章詳情頁

xpath - python怎么用lxml處理

瀏覽：82日期：2022-09-22 09:54:52

問題描述

例如：

沒aa沒aa沒aa沒

就是在p標簽里可能會出現同樣的em標簽，而且數量不定，那我怎么獲取p的內容，包括em里的內容。例如第二個p獲取輸出是‘沒aa沒aa’

或者獲取到p節點之后，怎么把里面的內容轉換為字符串

問題解答

回答1：

今天偶然學到處理這個問題的方法，特意翻出來這個問題回答。題主你可以看一下xpath的軸，比如你要取得第二個標簽的“沒aa沒aa”，實際是取得它全部后代節點的文本內容，可以使用element_dom.xpath('//p[2]//descendant::text()')來取得，拿到的結果是一個這樣[’沒’, ’aa’, ’沒’, ’aa’]的list,然后自己手動拼接成字符串就可以了，比如''.join(list)。同理，如果你需要進行其他操作，也可以使用類似的方法。

回答2：

換bs4，string和text之間的異同就在這里。

回答3：

lxml.html的.text_content()方法，可以獲取當前節點和所有子節點的文本內容。

Python 編程

上一條：python - 如何爬取豆瓣電影的詳細信息下一條：python - [Errno 2] No such file or directory: ’我為什么是一個文件，為什么返回值是這樣的呢？

相關文章：

1. mysql 查詢身份證號字段值有效的數據2. mysql - 把一個表中的數據count更新到另一個表里?3. 請教使用PDO連接MSSQL數據庫插入是亂碼問題?4. mysql - 分庫分表、分區、讀寫分離這些都是用在什么場景下，會帶來哪些效率或者其他方面的好處5. python - 數據與循環次數對應不上6. python - 爬蟲模擬登錄后，爬取csdn后臺文章列表遇到的問題7. 視頻文件不能播放，怎么辦？8. 黑客 - Python模塊安全權限9. Python爬蟲如何爬取span和span中間的內容并分別存入字典里？10. node.js - nodejs開發中常用的連接mysql的庫

排行榜

					
					node.js - npm init無法一直回車。到version就卡主不動了
解決Android webview設置cookie和cookie丟失的問題
javascript - 關于css絕對定位在ios瀏覽器被橡皮筋遮擋的問題
visual-studio - Python OpenCV: 奇怪的自動補全問題
python bottle跑起來以后,定時執行的任務為什么每次都重復(多)執行一次?
javascript - 移動端自適應
docker內創建jenkins訪問另一個容器下的服務器問題
debian - docker依賴的aufs-tools源碼哪里可以找到??？
python - nginx為什么不能反代圖片?
視頻文件不能播放，怎么辦？
angular.js - Beego 與 AngularJS的模板格式沖突，該怎么解決？
				

熱門標簽

色综合图-色综合图片-色综合图片二区150p-色综合图区-玖玖国产精品视频-玖玖香蕉视频

xpath - python怎么用lxml處理