编码区

关注
义项:基因中编码蛋白质的序列

编码区是基因或信使 RNA 中对应蛋白质氨基酸序列的那一段核苷酸序列,通常从 5′ 端的起始密码子开始,到 3′ 端的终止密码子结束,终止密码子本身也包含在范围内[1]。它常被简称为编码序列或 CDS,是被核糖体翻译成多肽的部分[2][3]。真核生物的编码区由若干外显子拼接而成,两侧为非翻译区[4]。人类基因组中蛋白质编码序列所占比例很小,如何把编码区与非编码序列区分开,是基因组研究的基础问题[5]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

编码区指基因或信使RNA上被翻译为蛋白质的那部分序列,其范围自起始密码子起、至终止密码子止,并包含终止密码子本身[1][3]。在核酸序列数据库中,它对应的注释特征是 CDS;两端密码子齐全的为完整 CDS,缺少起始密码子或终止密码子(或两者都缺)的记为部分 CDS[1][6]。

在信使 RNA 上,编码区夹在 5′ 非翻译区与 3′ 非翻译区之间,这两段序列同样来自外显子,却不参与翻译[4]。信使 RNA 的 5′ 端帽子结构和 3′ 端 poly(A) 尾也属于不翻译的成分[4]。

编码区与外显子并不是同一个概念。外显子除编码区外还含有两侧的非翻译区,因此只有一部分由编码区构成;外显子组指一个基因组内全部外显子,而编码区说的是某一段具体编码某种蛋白质的序列[7]。

原理

遗传信息先由 DNA 转录为信使 RNA,核糖体再依照遗传密码把信使 RNA 上的三联体密码子逐个读成氨基酸,连接成多肽链[4]。起始密码子一般是 ATG,在 RNA 层面写作 AUG;终止密码子为 TAA、TAG 或 TGA,对应 RNA 上的 UAA、UAG 与 UGA[4]。

三个碱基为一组的分组方式称为阅读框。起始密码子决定从哪个碱基开始成组读取,起点若移动一个碱基,其后所有密码子的划分都会随之改变[8]。以起始密码子开头、以同一阅读框内的终止密码子收尾的连续序列称为开放阅读框,对它的扫描是预测编码区的常用起点[8]。

开放阅读框与 CDS 需要区分:前者是序列分析给出的候选区域,后者是经实验或数据库注释确认的编码序列;CDS 一定落在开放阅读框之内,开放阅读框却未必是真正的 CDS[9][10]。真核基因的编码区由多个外显子拼合,转录出的前体 RNA 须先切除内含子,才能形成一段连续的阅读序列[11]。

编码区的碱基组成有自身特征,一般认为其 GC 含量高于非编码区,而且编码序列越长,GC 含量往往越高[7]。由于遗传密码具有简并性,多数氨基酸可由多个密码子编码,编码同一种蛋白质的编码区序列可以互不相同[12]。

发展历程

20 世纪 70 年代中期以前,人们通常以为基因内部的编码信息是连续排列的。1970 年前后,研究者在线病毒中发现编码多肽的 DNA 序列并不连续,而是被拆成若干片段;随后在鸡卵清蛋白基因等真核基因里也观察到同类现象,这类基因被称为断裂基因[11]。

1978 年,沃尔特·吉尔伯特在《自然》上撰文,用内含子与外显子两个词描述这种嵌合结构,并判断基因组中真正编码蛋白质的部分只占全部 DNA 的一小部分,编码区与非编码区的区分由此成为明确的问题[13][7]。同年,桑格等人在 φX174 噬菌体中发现基因之间存在重叠现象,说明不同读码框可以共用同一段序列[11]。

人类基因组计划完成后,编码区在整个人类基因组中的比重得到直接估计。人类基因组约有 2 万至 2.5 万个蛋白质编码基因,而能够制造蛋白质的编码序列只占全长的 1.5% 上下[14][5]。这一数值低于早期预期,人类基因数曾被认为在 10 万个以上,随着测序质量与基因识别方法改进而不断下调[14]。

应用

识别编码区是基因组注释的核心内容。转录组组装完成后,常用 TransDecoder 一类工具按最小开放阅读框长度、编码可能性打分等条件挑出候选编码序列,再借助蛋白质结构域或序列相似性信息进行筛选[15][16]。

近年也出现了基于深度学习的基因预测方法。Helixer 用卷积层与循环层对每个碱基打标签,判断编码区、非翻译区以及内含子—外显子边界,再由隐马尔可夫模型整理为完整基因模型,已提供面向真菌、植物、无脊椎动物和脊椎动物的预训练模型[17]。

公共序列数据库用 CDS 特征记录编码区。以 DDBJ 为例,CDS 特征给出从起始密码子到终止密码子的碱基范围,可用 codon_start 指明起始密码子所在的读码框偏移,用翻译表说明所依据的遗传密码,并给出概念翻译得到的氨基酸序列[6]。世界知识产权组织的 ST.26 标准同样把 CDS 定义为与蛋白质氨基酸序列相对应的核苷酸序列,并规定其位置包含终止密码子[3]。

在生物技术与医学中,编码区序列被直接用于操作蛋白质表达。基因治疗的思路之一是把编码功能蛋白的编码区导入细胞,以补偿缺陷或沉默的内源基因,相关研究涉及血友病、囊性纤维化等单基因疾病[4]。又因密码子具有简并性,可按宿主偏好的密码子改写编码区,即密码子优化,以提高表达效率[4][12]。

局限

由序列推断编码区存在不确定性。基因组中随机也能出现符合起止密码子条件的开放阅读框,要把真正的编码序列与这类偶然出现的序列分开,还需结合进化保守性、序列统计特征以及核糖体印迹等实验证据[8]。

真核基因的可变剪接使同一段 DNA 能产生多种信使 RNA,编码区边界随转录本而变,仅凭一条基因组序列难以穷尽全部编码区[18][14]。病毒和部分生物中还存在重叠基因,同一段序列可在不同读码框中分别编码蛋白质,编码区之间可以互相嵌套[11]。

编码区也不承载基因组的全部功能信息。人类基因组中蛋白质编码序列仅约 1.5%,其余包括非编码 RNA、调控序列、内含子与重复序列等[14]。信使 RNA 的 5′、3′ 非翻译区参与 poly(A) 加尾与稳定性调控,编码区内部的部分序列还可能充当外显子剪接增强子或沉默子[4]。

数据库中还存在序列与正常基因相似却不产生功能蛋白的假基因,注释时以 pseudogene 标记并通常不给出翻译产物,说明仅凭序列相似判断编码区并不可靠[6]。同时,TransDecoder 等工具以最小开放阅读框长度作为筛选条件之一,较短的编码序列容易在筛选中被滤掉[15]。

参见

  • 外显子 —— 真核基因中保留在成熟信使 RNA 里的片段,编码区由若干外显子拼合而成。

  • 内含子 —— 转录后被剪接去除的间隔序列,把基因中的外显子彼此隔开。

  • 开放阅读框 —— 自起始密码子到同框终止密码子的连续序列,是预测编码区的依据。

  • 信使RNA —— 编码区转录后的载体,也是核糖体翻译蛋白质的直接模板。

  • 遗传密码 —— 三联体密码子与氨基酸的对应规则,决定编码区序列如何被读成蛋白质。

  • 基因组注释 —— 在基因组序列上标定编码区等特征的过程,是编码区信息的主要产出方式。

参考资料

  1. CDS - The NCBI Handbook . nih.gov [引用日期2026-09-29]
  2. C48691 . cancer.gov [引用日期2026-09-29]
  3. docs-en-tracked-changes-03-26-01_changes(PDF) . wipo.int [引用日期2026-09-29]
  4. US11981910B2 . google.com [引用日期2026-09-29]
  5. Gene . genome.gov [引用日期2026-09-29]
  6. Protein Coding Sequence CDS feature . nig.ac.jp [引用日期2026-09-29]
  7. Coding region - Skip to main content . epfl.ch [引用日期2026-09-29]
  8. 开放阅读框 | Bohrium . bohrium.com [引用日期2026-09-29]
  9. CDS和ORF的区别?别再傻傻分不清啦! . uptbio.com [引用日期2026-09-29]
  10. 区分cds utr.exon . omicsclass.com [引用日期2026-09-29]
  11. 遗传基因 . wikipedia.org [引用日期2026-09-29]
  12. CN1429273A(PDF) . googleapis.com [引用日期2026-09-29]
  13. cshlp.org 上的网页 . cshlp.org [引用日期2026-09-29]
  14. 人類基因組 . wikipedia.org [引用日期2026-09-29]
  15. transdecoder - Skip to main content . purdue.edu [引用日期2026-09-29]
  16. John Anders\* and Peter F . degruyterbrill.com [引用日期2026-09-29]
  17. s41592-025-02939-1(PDF) . nature.com [引用日期2026-09-29]
  18. axu002 . uchicago.edu [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:24:18Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
基因 信使RNA 遗传密码 开放阅读框 沃尔特·吉尔伯特 人类基因组计划 基因组注释 基因治疗 密码子优化 可变剪接 假基因 外显子 内含子 开放阅读框 信使RNA 遗传密码 基因组注释
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。