文章詳情頁

python - 關于NumPy數組操作的問題

瀏覽：140日期：2022-06-26 18:57:18

問題描述

[’000001_2017-03-17.csv’, ’000001_2017-03-20.csv’, ’000002_2017-03-21.csv’, ’000002_2017-03-22.csv’, ’000003_2017-03-23.csv’, ’000004_2017-03-24.csv’]

numpy數組，總共有幾個萬個元素?，F在想保留每個元素前面的編號000001之類的，并且去掉重復，只保留唯一的一個編號。結果應該是[’000001’,’000002’,’000003’,’000004’]除了用for語句實現外，有沒有更高效的辦法？

問題解答

回答1：

寫個NumPy的吧~

python3

>>> import numpy as np>>> a = np.array([’000001_2017-03-17.csv’, ’000001_2017-03-20.csv’, ’000002_2017-03-21.csv’, ’000002_2017-03-22.csv’, ’000003_2017-03-23.csv’, ’000004_2017-03-24.csv’])>>> b = np.unique(np.fromiter(map(lambda x:x.split(’_’)[0],a),’|S6’))>>> barray([b’000001’, b’000002’, b’000003’, b’000004’], dtype=’|S6’)

還可以這樣寫：np.frompyfunc’|S6’是以6個字節存儲字符串

’<U6’是以6個小端序Unicode字符存儲字符串

>>> b = np.array(np.unique(np.frompyfunc(lambda x:x[:6],1,1)(a)),dtype=’<U6’)>>> barray([’000001’, ’000002’, ’000003’, ’000004’], dtype=’<U6’)回答2：

綜合兩位仁兄的寫法@同意并接受 @xiaojieluoff

如果編號長度固定是前六位，最快的寫法下面第一種最快

import timelst = [’000001_2017-03-17.csv’, ’000001_2017-03-20.csv’, ’000002_2017-03-21.csv’, ’000002_2017-03-22.csv’, ’000003_2017-03-23.csv’, ’000004_2017-03-24.csv’] * 1000000start = time.time()data = {_[:6] for _ in lst}print ’dic: {}’.format(time.time() - start)start = time.time()data = set(_[:6] for _ in lst)print ’set: {}’.format(time.time() - start)start = time.time()data = set(map(lambda _: _[:6], lst))print(’map：{}’.format(time.time() - start))start = time.time()data = set()[data.add(_[:6]) for _ in lst]print(’for：{}’.format(time.time() - start))耗時：dic: 0.72798705101set: 0.929664850235map：1.89214396477for：1.76194214821回答3：

使用 map 和匿名函數

lists = [’000001_2017-03-17.csv’, ’000001_2017-03-20.csv’,’000002_2017-03-21.csv’,’000002_2017-03-22.csv’,’000003_2017-03-23.csv’, ’000004_2017-03-24.csv’]data = list(set(map(lambda x:x.split(’_’)[0], lists)))print(data)

輸出：

[’000003’, ’000004’, ’000001’, ’000002’]

運行下面代碼可以看到，在 6百萬條數據下，map 比 for 快了 0.6s 左右

import timelists = [’000001_2017-03-17.csv’, ’000001_2017-03-20.csv’, ’000002_2017-03-21.csv’, ’000002_2017-03-22.csv’, ’000003_2017-03-23.csv’, ’000004_2017-03-24.csv’] * 1000000map_start = time.clock()map_data = list(set(map(lambda x:x.split(’_’)[0], lists)))map_end = (time.clock() - map_start)print(’map 運行時間：{}’.format(map_end))for_start = time.clock()data = set()for k in lists: data.add(k.split(’_’)[0])for_end = (time.clock() - for_start)print(’for 運行時間：{}’.format(for_end))

輸出：

map 運行時間：2.36173for 運行時間：2.9405870000000003

如果把測試數據擴大到 6千萬，差距就更明顯了

map 運行時間：29.620203for 運行時間：33.132621

Python 編程

上一條：python - pandas中mode()怎么使用?下一條：求大神解讀一段神級的Python代碼，謝謝??！

相關文章：

1. javascript - h5 video層級太高導致浮在div上面，如何解決？2. javascript - 如何獲取未來元素的父元素在頁面中所有相同元素中是第幾個?3. angular.js - angular 2 應用如何進行打包？如何使用gulp打包？4. javascript - 圖片無法正常加載5. python中怎么對列表以區間進行統計？6. cordova - myeclipse2014 導入android項目報錯7. javascript - Ajax加載Json時，移動端頁面向左上角縮小一截兒，加載完成后才正常顯示，這該如何解決？8. mysql ER_BAD_DB_ERROR: Unknown database ’test’9. mysql - 記得以前在哪里看過一個估算時間的網站10. html5 - 在微信上掃二維碼看到有趣的h5頁面，怎樣才可以看到它的代碼呢？

排行榜

					
					javascript - 如何獲取未來元素的父元素在頁面中所有相同元素中是第幾個?
mysql - 記得以前在哪里看過一個估算時間的網站
mysql  ER_BAD_DB_ERROR: Unknown database ’test’
javascript - 圖片無法正常加載
angular.js - angular 2 應用如何進行打包？如何使用gulp打包？
javascript - Ajax加載Json時，移動端頁面向左上角縮小一截兒，加載完成后才正常顯示，這該如何解決？
python中怎么對列表以區間進行統計？
javascript - h5 video層級太高導致浮在div上面，如何解決？
cordova - myeclipse2014 導入android項目報錯
node.js - 為什么npm安裝vue-cli會出現下面的錯誤??!!!?
Span標簽
				

熱門標簽

色综合图-色综合图片-色综合图片二区150p-色综合图区-玖玖国产精品视频-玖玖香蕉视频

python - 關于NumPy數組操作的問題