python 高效去重复支持GB级别大文件的示例代码

脚本专栏 2024/10/2 佚名

2 0 1

神剑山庄资源网 Design By www.hcban.com

如下所示：

#coding=utf-8
 
import sys, re, os
 
def getDictList(dict):
  regx = '''[\w\~`\!\@\#\$\%\^\&\*\(\)\_\-\+\=\[\]\{\}\:\;\,\.\/\<\>\?]+'''
  with open(dict) as f:
    data = f.read()
    return re.findall(regx, data)
 
def rmdp(dictList):
  return list(set(dictList))
 
def fileSave(dictRmdp, out):
  with open(out, 'a') as f:
    for line in dictRmdp:
      f.write(line + '\n')
 
def main():
  try:
    dict = sys.argv[1].strip()
    out = sys.argv[2].strip()
  except Exception, e:
    print 'error:', e
    me = os.path.basename(__file__)
    print 'usage: %s <input> <output>' %me
    print 'example: %s dict.txt dict_rmdp.txt' %me
    exit()
 
  dictList = getDictList(dict)
  dictRmdp = rmdp(dictList)
  fileSave(dictRmdp, out)
   
if __name__ == '__main__':
  main()

以上这篇python 高效去重复支持GB级别大文件的示例代码就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持。

python,去重复,大文件

标签：

python,去重复,大文件

神剑山庄资源网 Design By www.hcban.com

神剑山庄资源网 免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

神剑山庄资源网 Design By www.hcban.com

评论“python 高效去重复支持GB级别大文件的示例代码”

暂无python 高效去重复支持GB级别大文件的示例代码的评论...

更新日志

2024年10月02日

python 高效去重复支持GB级别大文件的示例代码

python,去重复,大文件

在Python中实现shuffle给列表洗牌

python实现RabbitMQ的消息队列的示例代码

评论“python 高效去重复支持GB级别大文件的示例代码”

更新日志

友情链接

python 高效去重复 支持GB级别大文件的示例代码

python,去重复,大文件

在Python中实现shuffle给列表洗牌

python实现RabbitMQ的消息队列的示例代码

评论“python 高效去重复 支持GB级别大文件的示例代码”

更新日志

友情链接

python 高效去重复支持GB级别大文件的示例代码

评论“python 高效去重复支持GB级别大文件的示例代码”