Long-read RNA-seq 质量控制软件。
项目描述
LQC:长读长 RNA-seq 质量控制
Long-read RNA-seq 质量控制软件。
LQC 用于为长读长 RNA-seq 数据 (PacBio, Oxford Nanopore) 的映射 SAM/BAM 文件生成质量控制总结报告。LQC 提供了 BAM 文件中插入缺失、错配和剪接位点的详细信息,为评估长读长测序数据的测序质量提供了很好的参考。
请引用我们:
依赖项
车链软件是用python3开发的,需要几个python包。
- python3.6+:带有 os、sys、argparse、re、functools、集合、多处理、shutil。
- 麻木:1.10+
- 熊猫:1.0+
- matplotlib:2.0+
- pysam:0.16+
最终的 html 报告使用Bootstrap 5.1.3 。加载 css 文件需要网络访问权限。
安装
建议将软件安装到虚拟环境中。
创建虚拟环境:
conda create -n lqc
conda activate lqc
或者:
virtualenv ~/.env/lqc
source ~/.env/lqc/bin/activate
来自 github
从github下载:
git clone https://github.com/gxiaolab/LQC
cd LQC
安装包:
python setup.py install
从点子
pip install lqc
用法
LQC 接受带有 cs 标签(由 minimap2 使用 --cs 选项生成)或 MD 标签的 SAM 或 BAM 文件。如果 SAM/BAM 文件只有 MD 标签,还需要一个基因组 fasta 参考文件来获取剪接信息。由于 cs 标签包含剪接位点信息,因此带有 cs 标签的 SAM/BAM 不需要基因组 fasta 参考。
usage: lqc [-h] -b BAM_FILE [--genome-fasta GENOME_FASTA] [-o OUTPUT_DIR] [--output-cs]
[--output-pickle] [-c [CONTIG ...]] [-t THREAD] [--log-level LOG_LEVEL] [--version]
The Long-read RNA-seq quality control software.
optional arguments:
-h, --help show this help message and exit
-b BAM_FILE, --bam-file BAM_FILE
input bam file, with cs tags, sorted and indexed
--genome-fasta GENOME_FASTA
path of genome fasta file
-o OUTPUT_DIR, --output_dir OUTPUT_DIR
directory to store output files
--output-cs output processed cs tags
--output-pickle output pickle file of results
-c [CONTIG ...], --contig [CONTIG ...]
contigs to be analyzed
-t THREAD, --thread THREAD
threads to be used in calculation
--log-level LOG_LEVEL
logging level (default INFO): [DEBUG, INFO]
--version show program's version number and exit
输出目录应该是空的以允许存储输出文件。
输出
默认情况下,车链会生成四种输出文件:汇总表、图形、html报告和pickle文件,用于恢复python统计对象。并且使用该--output-cs选项,也会输出处理后的BAM文件的cs标签信息。同样,使用该--output-pickle选项,结果对象将输出到一个 pickle 文件中,可用于进一步分析。
汇总表将存储在输出目录的表子目录中。图形将存储在输出目录的 fig 子目录中。
处理后的cs标签文件有六列:read name、contig、low、high、cs mark、cs value。
LQC 还将生成一个 html 报告,用于检查 BAM 文件的质量。
车链报告截图:
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。