Skip to main content

通过抓取 Google、Bing 和百度等搜索引擎为机器学习问题创建图像数据集的工具。

项目描述

数据集刮板

通过抓取 Google、Bing 和百度等搜索引擎为机器学习问题创建图像数据集的工具。

特征:

  • 搜索引擎支持:谷歌、必应、百度。(生产中):雅虎、Yandex、Duckduckgo
  • 图片格式支持:jpg、png、svg、gif、jpeg
  • 支持快速多处理的刮板
  • 非常快速的多线程下载器
  • 图像文件断言下载后数据验证

安装

  • 即将在 pypi 上推出

用法:

  • 进口 from datasetscraper import Scraper

  • 默认值

obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic')
obj.download(urls, directory='kiniro_mosaic/')
  • 指定搜索引擎
obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic', engine=['google'])
obj.download(urls, directory='kiniro_mosaic/')
  • 指定搜索引擎列表
obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic', engine=['google', 'bing'])
obj.download(urls, directory='kiniro_mosaic/')
  • 指定最大图像(默认为 200)
obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic', engine=['google', 'bing'], maxlist=[500, 300])
obj.download(urls, directory='kiniro_mosaic/')

常见问题

  • 为什么不支持yandex、yahoo、duckduckgo等搜索引擎?它们很难刮,我正在研究它们,并会尽快更新。

  • 我设置 maxlist=[500] 为什么只下载 (x<500) 图像?这可能有几个原因:

    • 搜索已用完:这种情况经常发生,google/bing 可能没有足够的图片供您查询
    • 网速慢:增加超时时间(默认为 60 秒),如下所示:obj.download(urls, directory='kiniro_mosaic/', timeout=100)
  • 如何调试?您可以在制作刮板对象时更改日志记录级别:obj = Scraper(logger.INFO)

去做:

  • 更多搜索引擎
  • 更好的调试
  • 编写文档
  • 文本数据?音频数据?

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

datasetscraper-0.0.4.tar.gz (5.8 kB 查看哈希)

已上传 source

内置分布

datasetscraper-0.0.4-py3-none-any.whl (13.9 kB 查看哈希)

已上传 py3