通过抓取 Google、Bing 和百度等搜索引擎为机器学习问题创建图像数据集的工具。
项目描述
数据集刮板
通过抓取 Google、Bing 和百度等搜索引擎为机器学习问题创建图像数据集的工具。
特征:
- 搜索引擎支持:谷歌、必应、百度。(生产中):雅虎、Yandex、Duckduckgo
- 图片格式支持:jpg、png、svg、gif、jpeg
- 支持快速多处理的刮板
- 非常快速的多线程下载器
- 图像文件断言下载后数据验证
安装
- 即将在 pypi 上推出
用法:
-
进口
from datasetscraper import Scraper -
默认值
obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic')
obj.download(urls, directory='kiniro_mosaic/')
- 指定搜索引擎
obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic', engine=['google'])
obj.download(urls, directory='kiniro_mosaic/')
- 指定搜索引擎列表
obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic', engine=['google', 'bing'])
obj.download(urls, directory='kiniro_mosaic/')
- 指定最大图像(默认为 200)
obj = Scraper()
urls = obj.fetch_urls('kiniro mosaic', engine=['google', 'bing'], maxlist=[500, 300])
obj.download(urls, directory='kiniro_mosaic/')
常见问题
-
为什么不支持yandex、yahoo、duckduckgo等搜索引擎?它们很难刮,我正在研究它们,并会尽快更新。
-
我设置 maxlist=[500] 为什么只下载 (x<500) 图像?这可能有几个原因:
- 搜索已用完:这种情况经常发生,google/bing 可能没有足够的图片供您查询
- 网速慢:增加超时时间(默认为 60 秒),如下所示:
obj.download(urls, directory='kiniro_mosaic/', timeout=100)
-
如何调试?您可以在制作刮板对象时更改日志记录级别:
obj = Scraper(logger.INFO)
去做:
- 更多搜索引擎
- 更好的调试
- 编写文档
- 文本数据?音频数据?
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。
源分布
datasetscraper-0.0.4.tar.gz
(5.8 kB
查看哈希)
内置分布
datasetscraper-0.0.4-py3-none-any.whl
(13.9 kB
查看哈希)