我发现一些对处理 Ig 受体序列有用的工具
项目描述
受体实用程序
我发现一些工具对处理 Ig 受体序列很有用。
安装
pip install receptor-utils
该模块需要Biopython。
概述
请参阅文件本身以获取更详细的文档。
simple_bio_seq
包含一些由 BioPython 支持但针对我的用例进行了简化的便利功能。它使用以下方法来保持简单(以牺牲一些灵活性/可扩展性为代价):
- 将序列存储为字符串,将 dicts 用于集合
- 在输入时将序列转换为大写
- 强制迭代器进入列表以便于调试
from receptor_utils import simple_bio_seq as simple
seqs = simple.read_fasta('seqfile.fasta') # read sequences into a dict with names as keys
seq = simple.read_single_fasta('seqfile.fasta') # reads the first or only sequence into a string
seq = simple.reverse_complement(seq)
其他功能见文件。
小说等位基因名称
包含函数name_novel(),它将根据其序列为“以前未记录的”等位基因生成名称。该名称将由提供给函数的参考集中最近等位基因的名称组成,后缀为区分它的 SNP,例如:
IGHV1-69*01_a29g_c113t
V 序列的编号使用 IMGT 比对。命名约定遵循 Tigger和 VDJbase使用的命名约定。
number_ighv
包含根据 IMGT 编号方案处理 V 序列的各种功能。最有用的是gap_sequence()通过使用参考集中最接近的序列作为模板来间隔提供的 V 序列。
示例脚本
这些可能本身很有用,但也显示了如何使用上面提到的一些功能。安装软件包后,您应该能够在没有 .py 扩展名的命令行中运行它们,例如键入
$ extract_refs --help
求助
rev_comp
返回指定核苷酸序列的反向补码。
name_allele
在给定参考集的情况下,返回等位基因序列的“tigger style”名称(参考等位基因名称以 SNP 为后缀)
extract_refs
用于从IMGT 参考文件simple_bio_seq中提取特定基因座和物种的文件的脚本。
相同序列
simple_bio_seq用于在 fasta 文件中列出相同序列和子序列的脚本。
gap_inferred
一个脚本,它将使用从参考集中发现的最接近的序列来分隔 FASTA 文件中列出的一组序列。该脚本将尽最大努力警告参考序列和它提供的间隔序列的问题:请使用警告来检查一切是否正常。
假设要间隔的序列在 5' 末端是完整的。如有必要,它们应在 5' 末端用点隔开,以便第一个核苷酸位于全长序列中的正确位置(与 IMGT 在不完整参考序列的开头放置点的方式完全相同在 5' 端)
make_igblast_ndm
一个脚本,它使用一组 IMGT 间隔 V 序列来创建 IgBLAST 所需的自定义生物体所需的 ndm 文件
注释_j
给定一组 J 序列,通过搜索 GxG 基序来识别 CDR3 末端的正确框架和位置。
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。
源分布
内置分布
receptor_utils- 0.0.25 -py3-none-any.whl 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | d6df2cd69d794bc434df79963227511181d46963ecb66f599715738b9de0c000 |
|
| MD5 | af741a61da20b4b2c0be9fa614f573d9 |
|
| 布莱克2-256 | 0570d520c702fa24863b3f9e2d758d211a189aa71d8a66371bc99025e483db6c |