本分析使用Sibelia软件(Ilia Minkin et al., 2013)对输入的基因组/宏基因组组装基因组(MAGs)进行共线性分析,识别保守的基因组序列块(Synteny Blocks)。
基因组共线性分析用于识别不同基因组之间保守的序列区块,这些区块在进化过程中保持相对稳定的顺序和方向。Sibelia是一种专门为密切相关的微生物基因组设计的共线性区块生成工具,通过构建de Bruijn图来识别基因组间的保守区域。
技术要点: Sibelia算法分为多个阶段,从较大的k-mer值开始,识别大的保守区块,然后逐渐减小k-mer值,识别更小的保守区域。
分析生成以下结果文件:
| 文件名 | 描述 | 用途 |
|---|---|---|
blocks_coords.txt |
共线性区块坐标文件 | 详细列出所有共线性区块在各基因组中的位置、方向和长度 |
circos.svg |
Circos环形可视化图 | 展示基因组间共线性关系的可视化图,适合用于论文发表 |
coverage_report.txt |
覆盖率报告 | 统计不同Degree(degree)的共线性区块覆盖各基因组的比例 |
d3_blocks_diagram.html |
交互式区块图 | 可交互查看共线性区块关系的网页,支持缩放和平移 |
genomes_permutations.txt |
基因组排列表示 | 将各基因组表示为共线性区块的排列顺序 |
此文件包含两个部分:第一部分列出输入序列的基本信息,第二部分详细描述每个共线性区块。
| 列名 | 描述 |
|---|---|
Seq_id |
结果序列ID(对输入序列进行重新编号,方便展示,数字编号,与输入顺序一致) |
Size |
序列长度(bp) |
Description |
对应的输入序列ID(通常为contig名称) |
| 列名 | 描述 | 注意 |
|---|---|---|
Seq_id |
序列ID,对应第一部分中的序列编号 | 同一区块的多个实例可能出现在不同序列中 |
Strand |
链方向,'+'表示正向,'-'表示反向 | 所有坐标均相对于序列的正向链给出 |
Start |
起始位置(1-based) | 正向链上:Start < End;反向链上:Start > End |
End |
终止位置(1-based) | 区块实例的最后一个碱基位置 |
Length |
区块实例长度(bp) | End - Start + 1 |
生物学解释: 每个"Block #X"部分代表一个保守的基因组序列块。同一区块在不同基因组中出现的多个实例表明这些区域在进化过程中保持保守。区块的排列顺序和方向变化反映了基因组重排事件,如倒位、易位等。
此文件统计了不同Degree(degree)的共线性区块覆盖各基因组的比例。Degree指一个共线性区块在输入基因组集合中出现的次数。
| 列名 | 描述 | 计算方式 |
|---|---|---|
Degree |
区块的实例个数 | 例如,Degree=2表示该区块在所有输入的contig中, 出现两次 |
Count |
具有该Degree的区块数量 | 统计值 |
Total |
所有基因组中被该Degree区块覆盖的总比例 | (该Degree区块覆盖的总碱基数)/(所有基因组总碱基数)×100% |
Seq n |
第n个序列(contig或染色体)被该Degree区块覆盖的比例 | (该Degree区块在第n个序列中覆盖的碱基数)/(第n个序列总碱基数)×100% |
All |
所有区块(所有Degree)的综合覆盖率 | 所有区块覆盖的总碱基数/所有序列总碱基数×100% |
此文件将每个输入序列表示为共线性区块的排列。每个序列占两行:第一行为FASTA头信息,第二行为区块排列。
| 符号 | 描述 | 示例 |
|---|---|---|
+数字 |
正向区块实例 | +96表示区块96的正向实例 |
-数字 |
反向区块实例 | -32表示区块32的反向实例 |
$ |
序列结束标记 | 当序列没有更多区块时使用 |
生物学解释: 这个文件简洁地表示了每个基因组的共线性区块组织结构。通过比较不同基因组的区块排列,可以快速识别基因组重排事件。例如,连续的区块序列在某个基因组中发生倒位,会表现为这些区块的符号全部反转。
注意: 区块太短,内圈和内圈连线颜色可能看不到,显示为灰色。
此HTML文件提供了一个交互式可视化界面,允许用户:
使用建议: 对于论文发表,建议使用Circos图(图1),因为它提供了更清晰、更专业的可视化效果。对于深入分析,可以使用交互式区块图探索具体的共线性关系。
引用注意事项: 在论文中需要引用Sibelia原始文献(Minkin et al., 2013)、Circos可视化工具(Krzywinski et al., 2009)以及微科盟生科云平台(Gao et al., 2024)。
这可能有以下几种原因:
同一共线性区块在不同基因组中长度可能略有差异,这是由于:
通常,同一区块的不同实例长度应该相近。显著的长度差异可能表示该区域不是真正的同源区域,或存在较大的插入/缺失事件。
1. Minkin, I., Patel, A., Kolmogorov, M., Vyahhi, N., & Pham, S. (2013). Sibelia: a scalable and comprehensive synteny block generation tool for closely related microbial genomes. In Algorithms in Bioinformatics (pp. 215-229). Springer Berlin Heidelberg.
2. Gao, Y., Zhang, G., Jiang, S., & Liu, Y. X. (2024). Wekemo Bioincloud: A user-friendly platform for meta-omics data analyses. iMeta, 3, e175. https://doi.org/10.1002/imt2.175
3. Krzywinski, M., Schein, J., Birol, I., Connors, J., Gascoyne, R., Horsman, D., ... & Marra, M. A. (2009). Circos: an information aesthetic for comparative genomics. Genome Research, 19(9), 1639-1645.