不同因素对猪INDEL基因型填充准确性的影响研究
Factors affecting the accuracy of INDEL genotype imputation in pigs
通讯作者:
收稿日期: 2025-11-01
| 基金资助: |
|
Received: 2025-11-01
作者简介 About authors
尹啸啸(2001—),女,山东泰安人,研究方向:动物遗传育种与繁殖,E-mail:
Keywords:
本文引用格式
尹啸啸, 梁捷特, 楚金雨, 李新云, 马云龙.
Yin Xiaoxiao, Liang Jiete, Chu Jinyu, Li Xinyun, Ma Yunlong.
基因型填充(Genotype imputation)是利用参考群的单倍型信息填充验证群缺失位点基因型的重要方法,能够在降低测序成本的同时提升全基因组数据的完整性和利用效率[1,2]。随着分子标记技术的发展,基因型填充技术已经被广泛应用于畜禽遗传育种研究与基因组育种。目前,主流的填充软件包括Beagle[3]、IMPUT-E[4]和Minimac[5]等。针对基因型填充的研究表明:Beagle在处理大规模数据时效率较高,IMPUTE在低频率变异填充中表现更优,而Minimac在小规模参考群中填充效果更佳[6]。与此同时,针对基因型填充的影响因素评估发现:标记密度、最小等位基因频率(Minor allele frequency,MAF)、参考群规模和群体多样性是影响填充准确性的重要因素。Lee等[7]在牛上的研究表明,标记密度由5 K提升至15 K时填充准确性由0.793提升至0.967。Hermisdorff等[8]对牛的研究发现,当参考群由250头扩大至2000头时,填充准确性由0.845提升至0.917。Zhang等[9]对猪的研究进一步证实,尽管大规模参考群有助于提高准确性,但多品种构成的参考群由于遗传差异大,反而可能降低填充效果。INDEL基因型是基因组中长度在1~50 bp的碱基插入或缺失变异,能够引起移码突变并直接破坏蛋白质编码序列,是解析生长、繁殖、抗病等复杂性状因果机制的重要变异类型[10]。Xu等[11]在57个猪品种的469个样本中检测出约180万个INDEL基因型,并发现其与体型、毛色等经济性状相关;Michelle等[12]在Ankamali猪群体中鉴定出500余万个INDEL基因型,揭示其与肉质等生产性状的密切关联。越来越多的研究表明,INDEL基因型在畜禽复杂性状遗传机制解析与分子育种中具有巨大的应用潜力。目前,尽管测序成本在不断下降,然而大规模群体的高深度全基因组测序(Whole genome sequencing,WGS)仍费用高昂,低深度测序数据中INDEL基因型覆盖稀疏[13],难以直接支撑畜禽群体的基因组选择与分子育种研究。因此,如何在控制成本的同时获取准确的高密度INDEL基因型信息,已成为制约其广泛应用的关键技术问题。
然而,当前基因型填充方向的研究多聚焦于单核苷酸多态性(Single nucleotide polymorphism,SNP),针对INDEL(Insertion delet-ion)基因型的填充效果评估研究仍然鲜有报道,特别是在猪这一重要家畜中,尚缺乏系统分析标记密度、MAF、参考群规模、群体多样性等因素对INDEL基因型填充准确性影响的研究。
本研究以猪为对象,系统评估了标记密度、MAF、参考群规模、群体多样性以及不同填充软件对INDEL基因型填充效果的影响,以期为针对猪的INDEL基因型填充策略选择提供参考,也为利用INDEL基因型开展复杂性状遗传解析与育种应用等研究提供了参考依据。
1 材料与方法
1.1 基因型数据的获取及质控
为系统评估不同因素对INDEL基因型填充准确性的影响,本研究基于1119头平均测序深度在16×的猪全基因组测序数据构建了2个包含不同变异类型的参考群,参考群I:仅包含4072935个INDEL基因型;参考群Ⅱ:包含19147753个SNP基因型和4072935个INDEL基因型;所用样本主要包括大白猪、杜洛克猪、中国地方猪和欧洲地方猪等。验证群由200头大白猪组成,平均测序深度为29×,含3362936个INDEL基因型。原始基因型文件中包含的所有变异基因型使用PLINK v1.9[14,15]按照以下指标进行质控:基因型缺失率>5%;MAF<0.01;Hardy-Weinberg平衡检验P<1×10-6;样本的基因型检出率<90%。质控后的数据使用SHAPEIT5[16]进行单倍型定相。
1.2 填充软件及参数设置
1.3 填充效果评估指标
不同填充软件的性能通过填充准确性来量化。本研究采用两种评估填充准确性的方法:①一致率,即填充后基因型(AA、AB和BB分别编码为0、1、2)和真实基因型的一致率;②最小等位基因真实剂量与填充所得期望剂量之间的皮尔逊相关性[19]。CR和PC的计算公式如下:
式(
1.4 不同填充场景设置
1.4.1 模拟不同标记密度
为系统评估标记密度对INDEL基因型填充准确性的影响,本研究在验证群中对1~18号染色体上的INDEL基因型进行了分染色体的完全随机缺失,以模拟不同标记密度。设置的缺失比例包括20%、45%、70%、95%和99%,每种比例重复试验3次。
1.4.2 参考群规模的评估
为了研究参考群规模对INDEL基因型填充准确性的影响,设定5个参考群规模梯度:10、50、100、500和1000头个体,各梯度参考群大白猪的比例固定。验证群固定为200头大白猪,其基因型数据中预先缺失95%的INDEL基因型。采用分层抽样,重复3次试验。通过比较不同规模参考群下的填充准确率,评估其对填充效果的影响。为了解增加参考群规模对填充准确性的贡献,本研究在4个区间(10~50、50~100、100~500、500~1000头)上计算增加单位样本填充准确性增益,即ΔPC/ΔN = [PC(Ni+1) -PC(Ni)] / [Ni+1-Ni],Ni表示第i个参考群规模梯度对应的样本数,ΔN表示相邻两个参考群规模梯度之间的样本数量差值。
1.4.3 MAF区间划分
为评估不同等位基因频率水平下的INDEL基因型填充准确性,本研究使用PLINK v 1.9软件对填充后的验证群的INDEL基因型进行计算,将MAF划分为7个区间:[0.01,0.03)、[0.03,0.05)、[0.05,0.1)、[0.1,0.2)、[0.2,0.3)、[0.3,0.4)、[0.4,0.5]。分别计算每个MAF区间内验证群填充后对应位点的平均填充准确率,以探究变异频率对填充准确性的影响。
1.4.4 参考群多样性的评估
为系统评估参考群遗传多样性对INDEL基因型填充准确性的影响。本研究按照地域划分,将品种数量大于10的23种猪,划分为中国地方猪种(14种)、欧洲商业猪种(2种)、欧洲本土猪种(7种),其中,欧洲商业猪种包括杜洛克和大白猪[18,20,21]。本研究选取缺失95% INDEL基因型的200头大白猪(Large white pig,LW)作为验证群。在将参考群大白猪的样本数量固定为100头的前提下,增加非验证群品种的样本,构建由不同品种组成的参考群。非验证群品种包括杜洛克猪(Duroc pig,DU)、中国地方猪种(Chinese native pig,CNP)及欧洲本土猪种(European native pig,ENP)。
为构建不同品种组成的参考群,本研究设计了由三类非验证群品种(DU、CNP、ENP)构成的组合添加到只有100头大白猪的基础参考群中。设每类群体的样本数依次为i1, i2, i3,满足约束方程i1+i2+i3=3,每单位代表25个样本,从而得到10种非负整数解,因此增加非验证群品种的组合有10种,各组合中的参考群样本量为175头(表1)。例如,组合(2,1,0)表示参考群有50头杜洛克猪和25头中国地方猪以及基础参考群中的100头大白猪。这些参考群在群体多样性上分为4个等级,从0级到3级不等,其中0级在基础参考群100头大白猪的基础上增加75头大白猪以确保与其他组合参考群样本量一致,因此最终有11种群体组成方案。
表1 参考群多样性的评估试验设计
Table 1
| 品种Breed | 多样性等级Diversity level | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| L0 | L1 | L1 | L1 | L2 | L2 | L2 | L2 | L2 | L2 | L3 | |
| 大白猪Large white pig | 175 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 |
| 杜洛克猪Duroc pig | 0 | 75 | 0 | 0 | 50 | 50 | 25 | 0 | 25 | 0 | 25 |
| 中国地方猪种Chinese native pig | 0 | 0 | 75 | 0 | 25 | 0 | 50 | 50 | 0 | 25 | 25 |
| 欧洲地方猪种European native pig | 0 | 0 | 0 | 75 | 0 | 25 | 0 | 25 | 50 | 50 | 25 |
2 结果
2.1 标记密度对填充准确性的影响
图1对比了基于2种不同的参考群类型在不同标记密度下三款填充软件INDEL基因型填充准确性的结果,从图中可以看出3个规律,一是在三款填充软件中,参考群I的填充准确性整体高于参考群Ⅱ。参考群Ⅰ的平均CR和平均PC分别为0.929和0.840,而参考群Ⅱ分别为0.914和0.796。二是随着基因型缺失比例的上升也即标记密度的降低,填充准确性也随之降低。以参考群I为例,当缺失比例从20%提升至95%时,Beagle 5.5的PC由0.898降至0.832,CR由0.967降至0.944;当缺失比例达到99%时,其PC与CR分别骤降至0.641与0.872。IMPUTE 5也呈现相同趋势,当缺失比例由20%提升至95%时,其PC由0.900降至0.834,当缺失比例达99%时降至0.640。三是在低标记密度条件下,Minimac 3表现出更低的填充准确性。在参考群I中,缺失比例为99%时,Beagle 5.5的PC为0.641,略高于IMPUTE 5的0.640,而此时Minimac 3的PC仅为0.481。在参考群Ⅱ中缺失比例为99%时,Beagle 5.5与IMPUTE 5的PC分别为0.628与0.629,而Minimac 3的PC低至0.352,显著低于前两者。
图1
图1
基因型缺失水平对INDEL基因型填充准确性影响
Fig. 1
Effect of genotype missingness level on the accuracy of INDEL genotype imputation
2.2 参考群规模对填充准确性的影响
图2对比了基于2种类型的参考群体在不同参考群规模下不同填充软件填充准确性的表现,从图中可以看出3个规律,一是随着参考群规模的增大,填充准确性随之增加,在参考群规模小于100头时,增加的幅度较大,但大于100头时,增幅较小。以参考群I为例,当规模由10头增至100头时,Beagle 5.5的PC从0.619增至0.794,IMPUTE 5的PC从0.621增至0.793,Minimac 3的PC从0.597增至0.738;当规模由100头继续增至1000头时,三款软件的PC仅分别小幅升至0.832、0.834与0.781;Beagle 5.5、IMPUTE 5与Minimac 3的CR也分别由0.828、0.827与0.752提升至0.944、0.945与0.901。二是不同样本区间,填充准确性增益存在较大差异。以参考群I为例,在10~50头,三款软件的平均ΔPC/ΔN为3.38×10-3;当达至50~100头时,平均ΔPC/ΔN迅速降至5.93×10-4;当增量区间进一步达到100~500头时,平均ΔPC/ΔN降至7.94×10-5,即小于1×10-4,表明规模达到100后新增样本对准确性的贡献降幅趋于平缓(图3)。三是Beagle 5.5与IMPUTE 5的填充准确性相当,但均高于Minimac 3。从图2a和图2c可以看出,Beagle 5.5与IMPUTE 5的CR均在82.7%以上,而Minimac 3的CR处于78.1%以下。从图2b和图2d可以看出不同软件准确性所处区间:在参考群I中,Beagle 5.5的PC区间为0.619至0.832,IMPUTE 5为0.621至0.834,Minimac 3为0.597至0.781;在参考群Ⅱ中,Beagle 5.5的PC区间为0.673至0.828,IMPUTE 5为0.673至0.830,Minimac 3为0.537至0.629。
图2
图2
参考群规模对INDEL基因型填充准确性的影响
Fig. 2
Effect of reference panel size on INDEL genotype imputation accuracy
图3
图3
参考群规模增量区间下的填充准确性增益(ΔPC/ΔN)
Fig.3
The accuracy gain of imputation under incremental reference population size intervals(ΔPC/ΔN)
2.3 最小等位基因频率对填充准确性的影响
图4为基于2种类型的参考群体在不同MAF区间下三款软件的INDEL基因型填充准确性结果对比,从图中可以看出2个规律:一是随着MAF值的上升,PC呈持续升高趋势,而CR则逐渐下降。以Beagle 5.5软件在参考群I中的填充准确性为例,当MAF由0.01~0.03增至0.4~0.5时,其PC值由0.571升至0.837,CR值由93.1%降至92.8%。二是参考群I的填充准确性高于参考群Ⅱ,在MAF由0.01~0.03增至0.4~0.5时,参考群I中3种软件的平均PC值为0.746,平均CR值为91.8%;参考群Ⅱ中3种软件的平均PC值为0.677,平均CR值为87.2%。
图4
图4
不同MAF区间INDEL基因型填充准确性
Fig. 4
Accuracy of INDEL genotype imputation across different MAF intervals
2.4 参考群多样性对填充准确性的影响
图5为在固定参考群规模为175头猪的条件下,探讨增加参考群多样性对INDEL基因型填充准确性的影响,采用填充效果较好的Beagle 5.5进行分析。分析结果呈现3个规律:一是只含有大白猪的L0级的准确性优于其他级,而L1~3级间差异不明显。在参考群I中,L0级的PC值为0.863,显著高于其他等级;而L1、L2均为0.847与L3的PC值0.848之间的数值极其接近,最大极差仅为0.001。在参考群Ⅱ中,L1~L3级的PC值均为0.847。二是参考群I的填充准确性高于参考群Ⅱ。参考群I在L0~L3级中的平均PC值为0.851,略高于参考群Ⅱ的平均值0.850。三是随着参考群多样性水平的提升,填充准确性呈下降趋势。参考群I中,随着群体多样性从L0级提升至L3级,PC值从0.863降至0.848;在参考群Ⅱ中,PC值则从0.859 降至0.847。
图5
图5
不同多样性程度的参考群的填充准确性
Fig. 5
Imputation accuracy of reference panels with different diversity levels
3 讨论
标记密度对填充准确性影响的结果表明,随着验证群标记密度的降低,INDEL基因型填充准确性总体呈下降趋势。当缺失率逐步升高时,PC持续下降;其中,在缺失率达到99% 时,PC下降至0.641以下,说明在极低标记密度条件下,填充准确性明显降低。类似的现象在近年来的研究中也得到验证,Zhang等[9]指出,在填充SNP时,填充准确性随验证群标记密度升高而显著提高,标记密度越高越能得到准确的单倍型信息,从而提升填充准确性。此外,Cai等[22]基于全基因组测序数据开展填充效果评估研究中发现,低频变异在低标记密度条件下的填充准确性明显降低,这与本研究的结果一致。因此,标记密度高低是影响INDEL基因型填充准确性的关键因素,合理选择较高标记密度数据,或结合全基因组测序数据开展填充,是提升INDEL基因型填充准确性的重要策略。
参考群规模对基因型填充准确性影响的结果表明,随着参考群规模由10头逐步增大至1000头,填充准确性显著提升,但在参考群规模达到100头后,填充准确性的增幅明显趋缓;当参考群规模由100头进一步增加至500头时,ΔPC/ΔN迅速下降至1×10-4以下,表明继续增加参考群规模对准确性的提升贡献有限。Chen等[23]研究同样指出,当参考群规模增加到一定阈值后,填充准确性趋势图出现拐点,增长趋势明显减缓,这与本研究结果一致。可见,在猪INDEL基因型填充中,100头左右个体已能达到较高的准确性,继续扩大参考群规模对提升填充准确性的贡献有限,因此,建议选择100头的样本作为参考群。
最小等位基因频率对基因型填充准确性影响的结果表明,随着MAF增加,CR和PC呈现相反的趋势。其原因在于低频位点常因缺失基因型被随机填充为纯合子,导致CR偏高;而PC计算受MAF变化影响大,当低频位点被错误地填充为纯合子时PC降低。因此,在评估低频位点时CR往往会被高估[24,25]。Zhang等[9]指出高MAF变异的填充准确性显著高于低频变异;在人类研究中,Cahoon等[26]亦发现低频位点的填充准确性仅为0.62~0.79,而高频变异可达0.90以上。因此,本研究倾向于推荐使用PC方法来评估不同MAF区间位点的填充准确性。此外,随着MAF的增加,当MAF>0.05时,PC值提升放缓,因此推荐使用MAF>0.05作为INDEL基因型填充后的质控标准。
参考群多样性对基因型填充准确性影响的结果表明,参考群的品种组成与验证群的遗传背景匹配程度会影响INDEL基因型填充准确性。在本研究中,L0级参考群仅包含大白猪,与验证群遗传背景一致,其填充准确性高于其他多样性等级;当参考群中引入其他品种后,PC值略有下降,说明参考群与验证群之间的遗传差异可能对填充准确性产生不利影响。类似的结果已在猪的基因型填充研究中得到验证,Zhang等[9]研究表明,当参考群由多品种混合构成时,填充准确性会出现一定程度的下降,表明异源群体间的单倍型结构差异和等位基因频率偏差会降低填充准确性。此外,Ding等[17]在构建SWIM大规模猪单倍型参考群的研究中也发现,参考群的品种组成会影响填充准确性,遗传背景越接近验证群,填充准确性越高。本研究结果与上述报道基本一致。需要指出的是,尽管L0级的填充准确性高于L1~L3级,但L1~L3各级之间差异较小,说明在本研究设定范围内,参考群多样性增加到一定程度后,其对填充准确性的进一步影响相对有限。因此,在进行INDEL基因型填充时,使用仅包含INDEL的参考群并确保其与目标群体遗传背景的相似性,是提升填充准确性的关键策略。
标记密度、参考群规模、最小等位基因频率及多样性的分析中均发现,参考群I的填充准确性高于参考群Ⅱ,说明SNP的引入并未提升INDEL基因型的填充准确性,这可能是因为不同类型变异在单倍型填充时会相互影响,导致填充准确性降低。Nguyen等[6]在同一研究中直接比较了SNP与INDEL的填充准确性,发现INDEL的填充准确性平均较SNP低约6%。这一结果表明,INDEL本身可能较难被准确填充,因此即使在参考群中引入更多SNP信息,也未必能够明显改善其填充效果。其原因可以从以下几个方面进行解释:首先,SNP和INDEL基因型在基因组中的连锁不平衡(Linkage disequilib-rium, LD)结构存在显著差异。INDEL基因型通常依赖于局部单倍型结构,而SNP的引入破坏了这一结构,增加了单倍型定相的复杂度[27],进而影响INDEL基因型的填充准确性。其次,SNP的引入增加了基因型填充算法的复杂性,特别是在低频变异和复杂区域,SNP的加入可能导致错误匹配,降低填充准确性。
4 结论与展望
本研究围绕影响填充准确性的标记密度水平、参考群规模、MAF、参考群多样性、填充软件等因素,系统分析了它们对猪INDEL基因型填充准确性的影响。研究发现,基因型缺失比例的上升也即标记密度的降低,填充准确性也随之降低。参考群规模小于100头时,增加的幅度较大,但大于100头时,增幅较小。随着MAF值的上升,PC呈持续升高趋势,而CR则逐渐下降,当MAF>0.05时,PC值的提升放缓。仅含有大白猪的L0级的准确性优于其他级。以上4个因素对填充准确性的影响分析,均显示参考群Ⅰ优于参考群Ⅱ,参考群中SNP的引入会降低INDEL填充的准确性;Beagle 5.5与IMPUTE 5的填充准确性相当,但均高于Minimac 3。因此,建议使用较高的标记密度数据,参考群规模建议选择100头左右。推荐使用MAF>0.05作为INDEL基因型填充后的质控标准。当参考群为多品种混合时,尽可能选择与验证群遗传背景相似的群体作为参考群。选择合适的软件并结合其运行效率与填充准确性,仍是确保研究结果可靠性的关键。
参考文献
A new multipoint method for genome-wide association studies by imputation of genotypes
[J].
A flexible and accurate genotype imputation method for the next generation of genome-wide association studies
[J].
A one-penny imputed genome from next-generation reference panels
[J].
Genotype imputation using the positional burrows wheeler transform
[J].
Next-generation genotype imputation service and methods
[J].
Empirical versus estimated accuracy of imputation: optimising filtering thresholds for sequence imputation
[J].
Accuracy of genotype imputation based on reference population size and marker density in Hanwoo cattle
[J].
Investigating the accuracy of imputing autosomal variants in Nellore cattle using the ARS-UCD1.2 assembly of the bovine genome
[J].
A comprehensive evaluation of factors affecting the accuracy of pig genotype imputation using a single or multi-breed reference population
[J].
Small insertions and deletions (INDELs) in human genomes
[J].
Whole genome variants across 57 pig breeds enable comprehensive identification of genetic signatures that underlie breed features
[J].
Identification of genetic variants by whole genome sequencing in Ankamali pigs of Kerala
[J].
Reducing INDEL calling errors in whole genome and exome sequencing data
[J].
PLINK: a tool set for whole-genome association and population-based linkage analyses
[J].
Second-generation PLINK: rising to the challenge of larger and richer datasets
[J].
Accurate rare variant phasing of whole-genome and whole-exome sequencing data in the UK Biobank
[J].
The SWine IMputation (SWIM) haplotype reference panel enables nucleoti-de resolution genetic mapping in pigs
[J].
AGIDB: a versatile database for genotype imputation and variant decoding across species
[J].
Comparison and assessment of family- and population-based genotype imputat-ion methods in large pedigrees
[J].
Accurate haplotype construction and detection of selection signatures enabled by high quality pig genome sequences
[J].
An updated Pig Haplotype Reference Panel (PHARP 4.0) comprising 13, 298 haplotypes
[J].
Genomic diversity revealed by whole-genome sequencing in three Danish commercial pig breeds
[J].
Genotype imputation for soybean nested association mapping population to improve precision of QTL detection
[J].
Factors affecting the accuracy of genotype imputation in populations from several maize breeding programs
[J].
When does choice of accuracy measure alter imputation accuracy assessments
[J].
Imputation accuracy across global human populations
[J].
Characterizing linkage disequilibrium and evaluating the imputation power of human genomic insertion-deletion polymorphisms
[J].
Assessment of imputation quality: comparison of phasing and imputation algorithms in real data
[J].
A comparative analysis of current phasing and imputation software
[J].
Imputation strategies for low-coverage whole-genome sequencing data and their effects on genomic prediction and genome-wide association studies in pigs
[J].
Comparison of genotype imputation for SNP array and low-coverage whole-genome sequencing data
[J].
/
| 〈 |
|
〉 |




