非编码区

关注
义项:基因组中不编码蛋白质的序列

非编码区是基因组中不编码蛋白质的DNA序列,与编码蛋白质的编码区相对,在人类基因组中编码区仅占1%至2%[1]。人类基因组约有30亿个碱基对,其中不编码蛋白质的绝大部分曾长期被称为垃圾DNA[2]。后续研究发现,非编码区包含大量调控基因表达的元件,并可转录出多种非编码RNA,在个体发育和疾病发生中发挥作用[2][1]。与疾病和数量性状相关的遗传变异也大多位于非编码区,使其成为功能基因组研究的重要对象[3]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

非编码区指基因组中不编码蛋白质的序列。在遗传学上,DNA被分为编码区与非编码区两部分:编码区负责指导蛋白质合成,通常称为基因;非编码区则是编码区之间那些不产生已知蛋白质的DNA片段[4]。就人类而言,编码蛋白质的部分只占基因组的1%至2%,其余98%至99%都属于非编码区[1]。这一比例在不同生物之间差别很大,人的基因数量约2万个,与线虫相差不大,但非编码区的规模远大于线虫[1]。

非编码区并不等于完全不转录。其中许多区域仍会被转录成RNA,只是这些RNA不翻译为蛋白质,而是以非编码RNA的形式参与调控[2][1]。非编码区的组成十分庞杂,包括内含子、基因间序列、转座子和其他重复序列,也包含启动子、增强子一类调控元件[5]。在人类基因组中,占比最大的一类非编码序列是转座子,接近全部DNA的一半[1]。

原理

非编码区中研究最充分的是顺式调控元件,即位于同一条染色体上、控制基因表达的DNA序列,主要包括启动子、增强子、沉默子和绝缘子[6]。启动子位于基因转录起始位点附近,是转录机器组装停靠的位置;增强子被激活后可明显提高靶基因的转录速率;沉默子的作用相反,会抑制转录;绝缘子则充当边界,阻止调控信号在相邻基因之间相互干扰[7]。

增强子的作用与它相对靶基因的位置和方向无关,可以位于基因上游或下游,也可以嵌在另一个基因的内含子中,与靶基因的直线距离可达数千乃至数十万个碱基对[7]。这种远距离调控依靠染色质的空间折叠完成:DNA弯折成环,使结合在增强子上的蛋白质与启动子处组装的转录机器发生直接物理接触,从而启动转录[6]。除调控元件外,非编码区还可通过转录生成微小RNA、与PIWI蛋白相互作用的RNA以及长链非编码RNA等分子,参与转录后的基因表达调控[5]。

发展历程

1972年,遗传学家大野乾提出「垃圾DNA」的说法,用来描述基因组中不编码蛋白质的序列,认为这部分序列是在进化中积累起来、不承担功能的[2][8]。这一表述在随后几十年里被广泛用来指称非编码DNA序列[8]。

人类基因组计划完成全序列测定后,研究者发现只有不到2%的DNA含有制造蛋白质的指令。2003年,美国启动了ENCODE计划,目标是系统鉴定人类基因组中的全部功能元件[9]。2012年9月,该计划集中发表30多篇论文,提出约80%的人类基因组具有生化功能,外界将其解读为对「垃圾DNA」概念的否定[10][2]。

这一结论随即引发争论。有进化生物学家指出,受纯化选择约束的序列不足基因组的10%,把广泛的转录活动直接等同于功能会高估功能序列的比例[11]。2014年ENCODE再次发表一批论文时,没有重申80%这一数字[10]。争议之外,非编码区在基因调控和疾病中的作用不断获得新的证据。

应用

非编码区是复杂疾病遗传学研究的重点区域。全基因组关联研究发现,超过90%与疾病和数量性状相关的变异位于非编码基因组之中[3]。以心血管疾病为例,相关研究识别出的单核苷酸多态性约有90%落在启动子、增强子、内含子、微小RNA和5′及3′非翻译区等功能性非编码区[12]。

在临床医学中,非编码区的缺失或变异可以直接致病。有遗传性贫血患者的血红蛋白相关编码序列完整,但紧邻编码区的非编码片段缺失,导致相应蛋白质无法合成,说明非编码区对基因表达有直接影响。在发育和进化研究中,顺式调控元件的改变被认为是物种间形态差异的重要来源[7]。

在法医学中,非编码区用于个体识别。身份鉴定检测往往针对非编码DNA片段,这一区域带有「垃圾」的旧称并不影响其在鉴定中的可靠性[4]。

局限

非编码区中究竟有多大比例具有功能,至今没有定论。ENCODE提出的「80%具有功能」受到质疑,批评者认为其采用的功能定义过于宽泛,转录活动不等于真实的生物学功能[11][13];ENCODE在2014年发表后续成果时也未再主张这一比例[10]。

大量非编码序列的功能仍然不明,非编码区至今被视为基因组中尚未开发的领域[1]。长链非编码RNA的序列保守性普遍偏低,很难通过跨物种序列比对来推断其功能[5]。

非编码变异与疾病之间的因果关系也不易确认。发现某个变异与性状相关,并不等于证明它就是致病原因[3]。此外,调控元件与其靶基因的对应关系难以确定,两者有时相距数百万个碱基对,需要借助三维基因组信息才能建立联系[14]。

参见

  • 垃圾DNA —— 非编码区长期使用的旧称,现被认为容易引起误解。

  • 基因 —— 编码蛋白质的DNA序列,与非编码区相对。

  • 非编码RNA —— 由非编码区转录、不翻译成蛋白质的RNA分子。

  • 增强子 —— 非编码区中能明显提高靶基因转录速率的调控元件。

  • 启动子 —— 位于基因转录起始位点附近、供转录机器停靠的调控序列。

  • ENCODE —— 系统鉴定人类基因组全部功能元件的国际研究计划。

参考资料

  1. ゲノムの未開拓領域を切り開く! . riken.jp [引用日期2026-09-29]
  2. The dark matter of genome . nature.com [引用日期2026-09-29]
  3. europepmc.org 上的网页 . europepmc.org [引用日期2026-09-29]
  4. coding-versus-noncoding-regions . ojp.gov [引用日期2026-09-29]
  5. scholaris.ca 上的文件 . scholaris.ca [引用日期2026-09-29]
  6. 顺式调控元件 | Bohrium . bohrium.com [引用日期2026-09-29]
  7. 顺式调控逻辑 | Bohrium . bohrium.com [引用日期2026-09-29]
  8. Junk DNA . cshl.edu [引用日期2026-09-29]
  9. cshl.edu 上的网页 . cshl.edu [引用日期2026-09-29]
  10. nih.gov 上的网页 . nih.gov [引用日期2026-09-29]
  11. europepmc.org 上的网页 . europepmc.org [引用日期2026-09-29]
  12. Role of non-coding variants in cardiovascular disease . europepmc.org [引用日期2026-09-29]
  13. nature.com 上的网页 . nature.com [引用日期2026-09-29]
  14. OUCI - 221 publications · Export . gov.ua [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:19:45Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
基因 非编码RNA 启动子 增强子 人类基因组计划 ENCODE 全基因组关联研究 垃圾DNA 基因 非编码RNA 增强子 启动子 ENCODE
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。