起始密码子(initiation codon)是信使RNA上被翻译系统识别为蛋白质合成起点的三联体核苷酸序列,它既标示多肽链从哪里开始合成,也确定了后续密码子的阅读框[1]。绝大多数基因以 AUG 作为起始密码子,该密码子在起始位置同时编码甲硫氨酸[2]。原核生物的 GUG、UUG 等少数密码子也能起同样的作用[3]。起始密码子的选择直接决定蛋白质的氮端序列,是基因表达调控与表达载体设计中的关键元件[4]。
定义
起始密码子指信使RNA分子上充当多肽链合成起点的密码子,凡是承担这一信号的密码子都被统称为起始密码子[5]。在遗传密码体系中,AUG 具有双重身份:它既编码甲硫氨酸,又在起始位置充当翻译的启动信号[5]。翻译从起始密码子开始,按三联体为单位连续读下去,直到遇上终止密码子才结束[1]。
原核生物可用的起始密码子不限于 AUG,还包括 GUG、UUG,个别基因使用 AUU[5]。真核生物则只以 AUG 作为起始密码子[3]。在细菌中,起始密码子所对应的第一个氨基酸是甲酰甲硫氨酸(fMet);真核生物与古细菌则由未经修饰的甲硫氨酸开头[6]。
原理
翻译起始时,核糖体小亚基先与信使RNA结合,携带起始氨基酸的起始转运RNA进入复合物,其反密码子与起始密码子发生碱基配对,随后大亚基加入,形成完整的起始复合物。细菌起始转运RNA的反密码子为 5′-CAU-3′,可以借摆动配对识别 AUG、GUG、UUG 三种起始密码子[7]。
原核生物依靠核糖体结合位点把起始密码子摆到正确位置。30S 亚基与起始密码子上游一段富含嘌呤的序列结合,这段序列称为SD序列,它与 16S 核糖体RNA 的 3′端互补配对,从而把起始密码子定位于核糖体的 P 位[8]。该序列通常位于起始密码子之前约 6 至 7 个核苷酸处,间距增减会不同程度地降低翻译起始效率[9]。
真核生物采用扫描模型:40S 亚基先结合信使RNA 5′端的帽子结构,再沿 5′到 3′方向移动,遇到处于合适序列环境中的 AUG 便停下,开始翻译[4]。AUG 两侧的碱基并不随机,其中 -3 位为嘌呤、+4 位为 G 时起始效率较高,这一共有序列被称为Kozak序列,常见的写法包括 GCCACCAUGG[4]。
发展历程
1961 年,尼伦伯格(Marshall Nirenberg)与马太(Heinrich Matthaei)在大肠杆菌无细胞体系中加入人工合成的多聚尿嘧啶核苷酸,发现产物由苯丙氨酸组成,由此确定 UUU 编码苯丙氨酸,这是第一个被破译的密码子[10]。到 1966 年,全部密码子得到阐明,其中就包括既编码甲硫氨酸、又承担翻译起始任务的 AUG[10]。
1968 年,尼伦伯格、科拉纳(Har Khorana)与霍利(Robert Holley)因解析遗传密码及其在蛋白质合成中的功能,共同获得诺贝尔生理学或医学奖[10]。1974 年,Shine 与 Dalgarno 在研究 RNA 病毒基因的翻译起点时发现这些位点与 16S 核糖体RNA 的 3′端互补,据此提出细菌核糖体借SD序列选择起始密码子的设想[8]。
20 世纪 80 年代,Kozak 通过比较脊椎动物信使RNA 序列并开展定点突变实验,提出翻译起始的扫描模型,总结出 AUG 侧翼的共有序列,并指出最靠近 5′端且序列环境合适的 AUG 通常被优先使用[4]。2022 年,中国科学院遗传与发育生物学研究所的研究团队报告,核糖体小亚基在寻找起始密码子时存在小幅度的双向摆动,对严格单向扫描的模型提出了修正[11]。
应用
构建真核表达载体时,常在目的基因起始密码子上游加入 GCCACC 一类的 Kozak 序列,以优化 AUG 所在的序列环境,减少核糖体漏扫描,提高翻译效率[4]。对起始密码子及其侧翼共有序列的了解,也为高效表达克隆化互补DNA 的载体设计和新生信使RNA 序列的翻译起始位点预测提供了依据[12]。
在基因组注释中,判断蛋白编码基因从何处开始翻译需要先确定起始密码子,而识别起始密码子受上下文序列、结构等多种因素影响,使这类预测仍存在难度[12]。
在原核表达系统中,可以通过调整 SD 序列与起始密码子之间的碱基组成和间隔长度来调节翻译起始水平,这是合成生物学中调控外源基因表达的常用手段[8]。
局限
起始密码子并不能唯一地确定翻译起点。除 AUG 之外,部分基因和病毒信使RNA 会使用非 AUG 密码子起始翻译。当真核信使RNA 中第一个 AUG 的序列环境较弱时,核糖体可能越过它,从下游的 AUG 开始翻译,产生不同的蛋白质产物[4]。
非 AUG 起始密码子的效率一般低于 AUG。细菌中 GUG、UUG 与起始转运RNA 的配对能力弱于 AUG,翻译效率随之降低;大肠杆菌中约 14% 的基因以 GUG 起始,约 3% 以 UUG 起始[5]。有实验显示,把 AUG 替换成 GUG 或 UUG 之后,信使RNA 的翻译效率明显下降[5]。
翻译起始效率还取决于 SD 序列的间距、起始密码子的侧翼碱基以及信使RNA 自身的二级结构,因此仅凭序列中是否存在 AUG 难以准确判定真实的翻译起点[8]。也正因为非 AUG 起始信号本身较弱,它反而可以被较弱的二级结构所屏蔽,成为细菌在翻译水平上调控基因表达的一种方式。
参见
参考资料
- Genetic Code . sciencedirect.com [引用日期2026-09-29]
- translation / RNA translation . nature.com [引用日期2026-09-29]
- Codon, Initiator MeSH Descriptor Data 2025 . nih.gov [引用日期2026-09-29]
- [科普中国]-kozak序列 . kepuchina.cn [引用日期2026-09-29]
- 图文详情——科普中国资源服务 . kepuchina.cn [引用日期2026-09-29]
- 用于密码子扩展的突变tRNA - “信使RNA(mRNA)”是指携带可翻译成蛋白质的遗传信息的RNA . google.com [引用日期2026-09-29]
- nih.gov 上的网页 . nih.gov [引用日期2026-09-29]
- 图文详情——科普中国资源服务 . kepuchina.cn [引用日期2026-09-29]
- Help:Ribosome Binding Sites/Shine-Dalgarno sequence . igem.org [引用日期2026-09-29]
- 1966: Genetic Code Cracked . genome.gov [引用日期2026-09-29]
- t20221220_325699 . genetics.ac.cn [引用日期2026-09-29]
- This Week's Citation Classic . upenn.edu [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:21:52Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。