Skip to main content

我发现一些对处理 Ig 受体序列有用的工具

项目描述

受体实用程序

我发现一些工具对处理 Ig 受体序列很有用。

安装

pip install receptor-utils

该模块需要Biopython

概述

请参阅文件本身以获取更详细的文档。

simple_bio_seq

包含一些由 BioPython 支持但针对我的用例进行了简化的便利功能。它使用以下方法来保持简单(以牺牲一些灵活性/可扩展性为代价):

  • 将序列存储为字符串,将 dicts 用于集合
  • 在输入时将序列转换为大写
  • 强制迭代器进入列表以便于调试
from receptor_utils import simple_bio_seq as simple
seqs = simple.read_fasta('seqfile.fasta')  # read sequences into a dict with names as keys
seq = simple.read_single_fasta('seqfile.fasta')  # reads the first or only sequence into a string
seq = simple.reverse_complement(seq)

其他功能见文件。

小说等位基因名称

包含函数name_novel(),它将根据其序列为“以前未记录的”等位基因生成名称。该名称将由提供给函数的参考集中最近等位基因的名称组成,后缀为区分它的 SNP,例如:

IGHV1-69*01_a29g_c113t

V 序列的编号使用 IMGT 比对。命名约定遵循 TiggerVDJbase使用的命名约定。

number_ighv

包含根据 IMGT 编号方案处理 V 序列的各种功能。最有用的是gap_sequence()通过使用参考集中最接近的序列作为模板来间隔提供的 V 序列。

示例脚本

这些可能本身很有用,但也显示了如何使用上面提到的一些功能。安装软件包后,您应该能够在没有 .py 扩展名的命令行中运行它们,例如键入

$ extract_refs --help

求助

rev_comp

返回指定核苷酸序列的反向补码。

name_allele

在给定参考集的情况下,返回等位基因序列的“tigger style”名称(参考等位基因名称以 SNP 为后缀)

extract_refs

用于从IMGT 参考文件simple_bio_seq中提取特定基因座和物种的文件的脚本。

相同序列

simple_bio_seq用于在 fasta 文件中列出相同序列和子序列的脚本。

gap_inferred

一个脚本,它将使用从参考集中发现的最接近的序列来分隔 FASTA 文件中列出的一组序列。该脚本将尽最大努力警告参考序列和它提供的间隔序列的问题:请使用警告来检查一切是否正常。

假设要间隔的序列在 5' 末端是完整的。如有必要,它们应在 5' 末端用点隔开,以便第一个核苷酸位于全长序列中的正确位置(与 IMGT 在不完整参考序列的开头放置点的方式完全相同在 5' 端)

make_igblast_ndm

一个脚本,它使用一组 IMGT 间隔 V 序列来创建 IgBLAST 所需的自定义生物体所需的 ndm 文件

注释_j

给定一组 J 序列,通过搜索 GxG 基序来识别 CDR3 末端的正确框架和位置。

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

receptor_utils-0.0.25.tar.gz (17.2 kB 查看哈希)

已上传 source

内置分布

receptor_utils-0.0.25-py3-none-any.whl (21.7 kB 查看哈希)

已上传 py3