Skip to main content

用于处理代码混合文本的库。仍在开发中!

项目描述

forthebadge 用 python 制作


代码风格:黑色兼容性

CMTT 是一个包装库,它使代码混合文本处理比以往任何时候都更加高效。更多文档传入!

安装

pip install code-mixed-text-toolkit

开始使用

如何使用这个库:

import code_mixed_text_toolkit.data as cmtt_data
import code_mixed_text_toolkit.preprocessing as cmtt_pp

# Loading json files
result_json = cmtt_data.load('https://world.openfoodfacts.org/api/v0/product/5060292302201.json')

# Loading csv files
result_csv = cmtt_data.load('https://gist.githubusercontent.com/rnirmal/e01acfdaf54a6f9b24e91ba4cae63518/raw/b589a5c5a851711e20c5eb28f9d54742d1fe2dc/datasets.csv')

# List all datasets available
cmtt_data.list_datasets(show_key="url")

# Download specific datasets
cmtt_data.download("openfoodfacts")
cmtt_data.download("rnirmal")

# Load and preprocess txt dataset
result_txt = cmtt_data.load('https://www.w3.org/TR/PNG/iso_8859-1.txt')
result_txt_tokenized = cmtt_pp.tokenizer.word_tokenize(result_txt)

# Search target word in txt corpus
cmtt_pp.search.search_word(result_txt, 'with', tokenize = True, width = 3)

贡献者

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

code_mixed_text_toolkit-0.3.5.tar.gz (7.0 kB 查看哈希

已上传 source

内置分布

code_mixed_text_toolkit-0.3.5-py3-none-any.whl (9.0 kB 查看哈希

已上传 py3