课程笔记-基因组学-杨金水
《基因组学》 杨金水 复旦大学
课程笔记
具体课程和课程在: 这里
背景
- 为何 提出 人类基因组计划?
1984年12月,在美国犹他州盐湖城滑雪胜地阿尔他,由美国能源部资助的一次环境诱变和致癌物防护国际会议上, 到会代表在讨论中提出了一个问题:在受原子弹爆炸辐射伤害的人群中,能检测到突变的比率比预期低三分之二。 有什么新办法可以非常有效地,直接地检测出人类基因的突变? 或者说,有没有新方法可在日本广岛,长崎原子弹爆炸后的幸存者及其子女中直接检测体内突变的基因?这是科学家首次讨论人类基因组计划。
- 杜贝克宣言: 人类 基因组 测序宣言
1986年, 1975年医学和生理学诺贝尔奖得主, 美国Salk Institute研究所癌症研究员杜贝可(RenatoDulbecco)
“Science”上发表题为“癌症研究的转折点:定出人类基因组序列”一文, 引起了美国社会大众的广泛关注,并使基因
测序计划的支持者和反对者进行了一场为时数年的争论.杜贝可提出了两条基因搜寻路线:1) DNA测序;2) 基因组
图.
- 人 类 基 因 组 测 序 计 划 进展
Human Chr.20, completed, February, 2002 Human Chr.14, completed, January, 2003
Human Chr.Y, completed, October, 2003 Human Chr.7, completed, October, 2003
Human Chr.6, completed, October, 2003 Human Chr.13, completed, March, 2004
Human Chr.19, completed, March, 2004 Human Chr.9, completed, May, 2004
Human Chr.10, completed, May, 2004 Human Chr.X, completed, March, 2005
Human Chr.2-4, completed, April, 2005 Human Chr.1, completed, May, 2006
截止2006年5月, 人类基因组计划已完成22条常染色体和X,Y性染色体的精确测序与初步解读.
国际上现有基因组计划状况 见: http://www.genomesonline.org/cgi-bin/GOLD/
数据查询网址http://www.ncbi.nlm.nih.gov/sites/entrez?db=genomeprj
- 基因组计划进 展 概 况
人类基因组研究到目前可分为两个主要阶段:
1) 基因组测序与注释: 1989-2000年,完成草图和初步注释;
2) 人类基因组DNA成分百科全书计划, 2002-2012年,完成基因组结构与调控元素的注释。
- ENCODE
“DNA成分百科全书” 数据库计划(Encyclopedia of DNA Elements ,ENCODE)第1期目标2012年9月5日以30篇论文形式宣布完成,这也许是本世纪迄今为止最重大的生物学和医学研究成果。
?人类基因组百科全书有哪些主要内容?


ENCODE(Stanford University)网站:https://www.encodeproject.org/
- 基因组学重 大 进 展
1) 基因组测序技术 2) 共栖基因组 3) 基因组表观遗传(CHIP) 4) 基因组数据软件开发(GO, lncrna db等)
5) 基因组合成(合成生物学) 6) 小RNA极其调控 7) 非编码RNA极其功能 8) 基因编辑(gene editing)
9) 单细胞测序 10) 全基因组关联分析(GWAS) 11)千人基因组测序计划
- 基因组学研究的新 进 展
全基因组关联研究(Genome-Wide Association Studies,GWAS)
是指将健康人的基因组与患病者的基因组进行全面对比,试图找出疾病的基因病理学基础。
精准医学(Precision Medicine)
美国总统奥巴马于2015年1月30日宣布一项名为“精准医学”的计划,打算通过分析100多万名美国志愿者的基因信息,更好地了解疾病形成机理,进而为开发相应药物、实现“精准施药”奠定基础。
2015年1月20日,美国总统Barack Obama在国情咨文中正式宣布了一个名为精准医学计划(Precision Medicine Initiative)的项目。他表示,希望这项计划——在合适的时间给予患者合适的治疗——能继续引领医学进入全新的时代。
精准医学是以个性化医疗为目的,结合生物信息学和大数据科学的交叉应用而发展起来的新型医学概念与医疗模式。通过基因组学、蛋白质组学等前沿生物技术,对大样本人群与特定疾病进行生物标记物的分析与鉴定、验证与应用,从而精确寻找到疾病的原因和治疗的靶点。在对某种疾病不同状态和过程进行精确亚分类的基础上,最终实现个性化精准治疗的目的,提高疾病诊治与预防的效果。
人类微生物组计划
美国白宫2016年5月13日宣布启动“国家微生物组计划” 。 “国家微生物组计划”有三大目标: 1)支持跨学科研究,以回答多样化生态系统中微生物组的基本问题; 2)开发检测、分析微生物组的工具,如实时检测空气、
土壤、水或人体微生物的手持传感器; 3)培训更多的微生物组相关工作人员。
宏基因组或共栖基因组:
有许多生物,特别是只能生长在极端的或特殊环境的微生物,它们在人工条件下无法繁殖,不能获得大量的纯化的样品。从这些环境采取的生物样品一般包括许多不同的微生物种类,它们共栖同一环境。由于缺少有效的方法将同一物种的个体分离归类,这些生物的基因组测序只能采用混合鸟枪法测序,被称为环境共栖生物基因组测序(metagenome sequencing)。
基因组表观遗传:
在人类基因组计划即基因组DNA测序完成之后,在功能基因组研究方面,最具深远意义的研究进展当属基因组表观遗传(Epigenetics)。所谓表观遗传系指基因或基因组在序列不发生改变的状态下,基因或基因组的表达模式发生可遗传的动态的变化。表观遗传可解释胚胎发育模式如何奠定,细胞分化的遗传基础,重要疾 病的调控机理等。表观遗传是基因或基因组表达调控中最核心的内容之一。
第一章 基因组
1 什么是基因组(genome)(学(genomic)) : 生物整套染色体所含有的全部DNA序列
2遗传的分子基础 : 1) DNA的化学与生物学2) RNA的化学与生物学3) 蛋白质的结构与生物学
3 基因组顺序复杂性
4 基因与基因家族
5 基因组的结构特征
- DNA的结构特点
1) DNA由两条具有极性的互补单链组成 2) 两条互补单链走向相反 3) DNA双螺旋大小沟槽交替排列 4)碱基配对原则: A-T, C-G, A-T配对形成2对氢键, C- G配对形成3对氢键. 5)每旋转一圈为10.5 bp (碱基对)
- 核苷酸的化学极性与生物学
1) DNA的合成具有方向性, 造成前导链与延迟链复制方式的差异;
2) DNA的降解具有方向性, 3’→5’ 和5’→3’ 的降解由不同的酶执行;
3) 遗传密码的编排具有方向性, 只有正链才具有编码功能;
4) 转录也具有方向性, 5’→3’.
- DNA双螺旋的生物学
1) DNA的双螺旋使DNA的复制复杂化, 必需一套解旋机制;
2) DNA双螺旋的大小沟具有结构信息,许多蛋白质都与大沟结合;
3) DNA双螺旋产生了环状DNA和长链DNA分子的拓扑学构像变化;
4) DNA双螺旋的螺距10.5 bp,转录因子结合在DNA双螺旋的同一侧。
碱基互变异构体可导致错配 ;碱基动态互变异构体可引起DNA复制和mRNA翻译差错


- 螺距长为10.5碱基对每一轮双螺旋由10碱基对组成, 这一结构具有多种生物学意义:
1) 决定了启动子与转录起始点的相对位置。
2)转录因子与DNA结合在同一侧面。
3) 引起DNA弯曲---A/T碱基对的平面有点倾斜,G/C较平整. 在周期性重复的(A/T)5-6与(G/C)4-6序列, DNA分子会发生弯曲。弯曲DNA在基因表达调控中具有重要意义。
4) 影响在核小体上DNA碱基对的朝向。
- 蛋白质的二级结构
1) α-螺旋 2) β-折叠 3) 转角(turn)
基序或模体(motif) 锌指结构(zinc finger) 域(domain) 羧基端域(C-terminal domain, CTD)
- 基因组-结构特征
1 C值悖理 : 生物基因组的大小(C值:DNA总量)同生物在进化上所处地位的高低无关的现象 (C—value paradox)。
2 基因组DNA的顺序组成:
1) 单一顺序: 基因组中只有单拷贝的顺序;
2) 中度重顺序: 拷贝数在1-10万, 长度50-1000bp在基因组中分散分布;
3) 高度重复顺序: 串接排列, 拷贝数达数百万, 离心时形成卫星带.
3 顺序复杂性
4 基因与基因家族 : 同一物种或不同物种中来自一个共同的祖先, 因加倍趋异而产生的一组具有相似顺序组成的基因成员: 1) 具有氨基酸顺序相似性; 2) 具有相同的功能域.
超基因家族(Supergene family):DNA顺序相似但功能不一定相似的若干组基因家族的总称, 或DNA顺序相似但功能不一定相似的若干个单拷贝基因的总称.
5 真核基因组与原核基因组
- 特殊结构基因
1) 重叠基因 (病毒φX174基因组中、人类INK4a/ARF基因座含两个重叠基因,共享外显子
2) 基因套基因 (gene in gene) (线虫某基因中的内含子中含一套独立的基因)
3) 反义基因
4) 分裂基因 (由两段非连续DNA组成的基因)
- 假 基 因 (Pseudogenes)
定义: 来源于功能基因但已失去活性的DNA顺序.
1) 重复假基因: 串接排列, 具有祖先基因的组成特点, 具内含子和外显子,突变失活.
2) 加工假基因: 由RNA反转录再插入基因组中的基因顺序, 无内含子.
3) 残缺假基因: 因不等交换使部分顺序缺失而失去功能的假基因.
4) 单一假基因(unitary pseudogenes ):由于点突变而失去功能的基因,产生无效蛋白.


假基因有没有功能?有两层含义:
1) 能转录,但相对于原来的功能基因而言,假基因已失去正常功能.
随着基因组数据的积累, 现在已知有不少假基因仍然保持转录的活性, 特别是起源于重复基因的假基因和获得启动子的加工的假基因。
假基因的转录产物已失去原有的功能, 如产生残缺蛋白质。
2) 假基因可能产生了新的功能:
1. 产生反义RNA, 抑制靶基因功能.
2. 在RNA水平与正常基因的mRNA竞争, 起调控作用, 如软体动物Lymnaea stagnalis 的神经细胞NO合成酶假基因产物调控NOS酶的合成.
3. 在DNA水平与正常基因竞争转录因子, 起抑制作用, 如老鼠的Makorin1基因的转录.
4. 作为人类免疫球蛋白多样性的顺序库.
第二章 遗传图谱绘制
遗传图(Genetic Map) :
通过遗传学方法, 以遗传图距(cM) 为单位绘制的染色体上基因或标记之间相对位置的连锁图。
物理图(Physical Map) :
通过DNA克隆,细胞原位杂交或DNA测序等方法将DNA克隆或DNA分子标记锚定在染色体的确定空间位置上而绘制的连锁图。物理图是一种实物图,有确定的物理距离,如碱基对数目。
- 为何要绘制遗传图和物理图?
1)基因组太大,必需分散测序,然后将分散的顺序按原来位置组装,需要图譜进行指导。
2)基因组存在大量重复顺序,会干扰排序,因此要高密度基因组图。
3)遗传图和物理图各有优缺点,必须相互整合校正。
- 分子标记与基因组作图
1) 目标 : 基因组测序的基本策略是将整个基因组分割成一些小片段分别测序, 然后将测序的片段进行组装, 使其回归到原来的位置。
2) 标记 : 为了确保分散的DNA片段正确归位, 必须寻找一批标记,它们在染色体上的位置是已知的、唯一的、定的, 并位于不同的测序片段之中。这些标记可以指导DNA克隆准确地锚定到染色体的确切位置。
分子标记 : 基因组路标(landmarker): 染色体上的基因和DNA顺序均可作为路标, 路标具有物理属性,它们由特定的DNA顺序组成. 路标位于染色体上的位置是固定的,唯一的,不会更改的,因而提供了作图的依据。
Locus : 座位 : 是经典遗传学中常用的概念, 系指染色体上经遗传分析确定的某个位置, 它们可以是基因、 DNA顺序或分子标记,但具体物理位置不确定。因此locus系指遗传单元在染色体所占据的相对位置。
Site : 位点 : 是指基因组物理图上某一确定的DNA顺序。

- 遗传作图标记
1) 第一代分子标记,单一顺序多态性:
Restriction Fragment Length Polymorphism限制性片段长度多态性RFLP, AFLP, RAPD
2) 第二代分子标记, 重复顺序多态性:
Simple sequence length polymorphisrns, SSLPs Variable number of tandem repeats,
VNTR Simple tandem repeats, STR Single sequence repeats, SSR
3) 第三代分子标记, 单核苷酸多态性:
Single nucleotide polymorphisms, SNP
第3章 物理图绘制
1 大分子DNA分离:选用稀有切点限制性内切酶产生大片段(大分子DNA:百万碱基对, Mb)
2 大分子DNA克隆:(选择合适载体 YAC: yeast artifitial chromosome酵母人工染色体
BAC: bacterial artifitial chromosome细菌人工染色体(主流)
PAC: P1-derived artifitial chromosome噬菌体人工染色体)
3 重叠群组建:由连续重叠的一组克隆DNA组建的克隆群称为叠连群或重叠群(contig), 是初始的基因组物理图。
4 STS作图:顺序标签位点作图(Sequence tagged site, STS mapping)通过PCR或分子杂交将单一DNA顺序定位在基因组染色体位置
图距单位厘镭 (centiRay, cR):DNA分子暴露在N拉徳(rad) X射线剂量下两个分子标记之间发生1%断裂的机率。


第4章 基因组测序技术
DNA复制是以5’—3’ 方向进行
- 第三代DNA测序
主要特征可以归结为单分子测序(single -molecule sequencing, SMS),包括三种技术路线:
1) 基于单分子DNA合成的实时测序(single-moleculereal-time sequencing);
2) 纳米孔单分子DNA电流阻遏(current blockage)测序;
3) 纳米孔单分子DNA碱基序列的电子阅读。
目前单分子DNA测序技术总体上极不成熟,实现单分子DNA的电子阅读必须克服一系列的技术难点, 主要涉及:
1) 建立适合纳米孔单分子DNA测序的平台;
2) 确定识别单分子DNA序列的技术参数;
3) 控制单分子DNA在纳米孔道中的移动速度,便于电子阅读与记录。
- 全基因组测序
Contig N50:DNA序列组装的后质量判断
基因组DNA随机克隆后,采取克隆DNA两端测序。获得的测序称为读序(reads),可以根据序列的重叠依次排序组成重叠群(Contig)。这些Contig的质量判断引入了一个统计学的估算,即Contig N50。大于Contig N50的重叠群可被入选,进入下一步的组装。 N50 计算方法:

- 测序规模预定
在进行一个具体的基因组测序之前,首先需要考虑测序的规模,
即需要获得多少测序数据才能覆盖整个基因组。
这里有一个可供测算的公式用以计算测序的覆盖面,其中P定义为丢失概率:
m为覆盖面,即单倍体基因组数; e为自然对数底数。
若m = 1 P0 = e-1 = 0.37 = 37% (遗漏37%)
若m = 5 P0 = e-5 = 0.0067 = 0.67% (遗漏0.67%)
若m = 10 P0 = e-10 = 4.5 × 10-5 =0.000 045 = 0.004 5% (遗漏0.0045%)
理论上遗漏的比例越少越好,但实际基因组测序必须考虑成本。通常兼顾准确率和耗费,一般覆盖面在x10。
测序深度(Deepth in DNA sequencing):
系指 测序的DNA核苷酸序列的总长与被测序DNA序列之间的倍数,即覆盖面积或者平均每个核苷酸被测序次数。
通常基因组测序的总长要大大超过基因组实际的碱基数目,即单个核苷酸被重复多次测序。
一般深度测序指测序覆盖倍数大于7xDNA测序。文献中将大于100倍(>100x)覆盖测序称为超深度测序。
- World standards for sequence fidelity (known as the BermudaStandards, 百慕大标准)
基因组测序的序列真实度(sequence fidelity )即百慕大标准
是在1997年人类基因组计划课题负责人(PI)在百摹大召开的学术会议上确定的,包含两个内容:
1)每10 000个DNA碱基序列中仅允许出现1个碱基的差错, 0.01%;
2)这 10 000个DNA碱基序列是连续的,内部不存在任何的序列中断或间隙。
- 参考基因组(Reference Genome)
是一个基因组核酸序列数据库。
由于用于组装的序列常常来自物种的许多不同个体,因此参考序列并不代表某个确定的个体基因组。
因为参考基因组最接近真实基因组的序列,所以用来指导新测序获得的人类基因组序列的组装。
- 人类和小鼠的参考基因组
序列系由20位科学家组成,参考基因组联盟(Genome Reference Consortium, GRC)进行日常的维持和改进,他们来自许多基因组研究单位,如欧洲生物信息研究所(EuropeanBioinformatics Institute,EBI),美国国家生物技术信息中心(National Center for Biotechnology Information, NCBI)和西雅图华盛顿大学的McDonnell基因组研究所。
人类基因组参考序列版本GRCh38已于2013年12月24日公布。
此前的一个版本GRCh37于2010年10月公布,含有250个间隙,而第一个版本则含有150 000个间隙。
可以登陆Ensembl或UCSC Genome Browser 查询人类参考基因组序列。
- 了解nanopore测序技术
https://mp.weixin.qq.com/s/hg_y3iXyLVdYVlYF9zK4ow
第5章-1 基因组序列注释
1 内含子组成特点
2 外显子组成特点
3 结构域
4 同源查询

保守序列consensus
一些遗传元件(如启动子)中反复出现的保守DNA序列。 比如不同种生物编码同一种蛋白质的基因会有共有序列。
在序列比对中也叫共有序列。序列比较中 相似但不一定完全相同的核苷酸/氨基酸序列。
寻找方法- https://mp.weixin.qq.com/s/2jXihiV6rHmaxnzYQQT8pA
知识概念- https://mp.weixin.qq.com/s/U8FZ5_o_NCObo0RvdWGnSQ
算发理解-https://blog.csdn.net/klcola/article/details/104060642
- 常用的基因注释方法如下:
1) 外显子分布;
2) 内含子组成特点;
3) 密码子使用偏好;(不同物种爱好不同,设计软件时需注意)
4) 同源性查询;
5) 转录表达产物比对;
6) 保守的蛋白结构基序;
7) 转录时的加尾序列。
- 真核生物基因的组成特征
1 外显子的组成
1) 摇摆密码子的使用频率或密码子偏爱 2) 不含或含有较少的终止密码
2 内含子的组成

- 真核生物基因的内含子具有一些特征序列:它是非常保守的
1) 5’剪接供体顺序GT和3’ 受体顺序AG;
2) 近3’剪接位的一段富嘧啶区;
3) 前体mRNA加工所需分支点A。
内含子含有高比例三种读框的终止密码。内含子三种读框中终止密码比率远高于外显子近一倍(18%>10%)
因为内含子它允许突变,所以终止子的密码出现的频率较高,这也是注释的依据。

密码子有简并性,且密码子第三个碱基上面有摇摆特征,不同氨基酸对应的密码子在不同物种中使用的频率不同,即密码子使用爱好有差别。
3 碱基的组成规律
- DNA序列同源查询
在获得新的DNA序列时,通常会将该序列在已有数据库中进行序列比对或查询(BLAST),用以确定新获得的序列与已知的序列之间的关联。
- DNA序列与氨基酸顺序同源性查询
这里所列出的两段DNA编码序列之间一致性的比例远高于一致性氨基酸的比例。由于密码子的第3位碱基可摇摆, 允许代换,因此从功能的意义看, 氨基酸的同源性比DNA更加重要。 在查询DNA编码序列同源性时通常更多参考氨基酸顺序一致性。

- 相似性与一致性

注: 红色为一致性氨基酸, 蓝色为可取代氨基酸, 白色为趋异氨基酸
一致性氨基酸百分比: 红色氨基酸所占的比例。
相似性氨基酸百分比: 红色和蓝色氨基酸相加所占的比例。
注意: 同源性不能用百分比表示! 只有“是” 或“否” 。
² 功能域注释
1) 任何基因编码的蛋白质都由一些在高级结构水平具有特征性的功能域组成, 如信号肽,受体区, 激酶区, DNA或RNA结合域等。
2) 功能域具有很强的保守性, 关键的氨基酸组成及其排列顺序是相当保守的,是鉴定基因功能的主要依据。
3)功能域是目前注释软件确定基因功能的主要内容之一。
² 基因注释软件的特点
1)目前基因注释程序的编写主要依据两种信息内涵:
1.signal terms (信号指令), 如
起始密码, 终止密码,终止信号, 剪接受体位与供体位顺序, 多聚嘧啶顺序,分支点等保守的顺序组成;
2.content terms (内容指令), 如密码子使用偏好。
2) 常用的注释软如GenScan主要偏重于内容指令, 而FgeneSH则着重于信号指令。
由于每种生物都有种属专一性的密码子偏好,也存在某些非保守的信号指令, 因此注释软件的编写会注意不同
物种的特点。超长基因注释常出现正向错误(false-positive, 多注释)或负向错误(false-negetive, 少注释).
Nature Reviews/Genetics, 4:741-749,2003
- 基因的命名规则
迄今为止国际上还没有一个普遍公认的适合所有生物种属的基因命名规则。
脊椎动物基因和蛋白质缩写约定
物 种 基因简写 蛋白质简写
-----------------------------------------
人类(Homo sapiens) SHH SHH 小鼠(Mus musculus) SHH SHH
原鸡(Gallus gallus) SHH SHH 安乐蜥(Anolis carolinensis) shh SHH
爪蟾 (Xenopus laevis) shh Shh 斑马鱼(Danio rerio) shh Shh
注: SHH, 基因sonic hedgehog的简称。在命名基因符号(symbol)时,要求尽可能简短,通常在3-8个字母范围。 如编码cytotoxic T-lymphocyte-associated protein 4的基因简称, 斜体, CTLA4; 蛋白质简称, 正体, CTLA4。https://en.wikipedia.org/wiki/Gene_nomenclature
- 拟南芥的基因注释ID号制定和编写规则:

为何每个初定的基因ID号末尾均为0(xxxx0)?
初始注释时以每条染色体含9000个代码为限。十位数是基因初始排序的个位数,如随后在基因附近发现新的基因,可在保留的0位逐个添加1, 2, 3….。如AT4G00210,或AT4G00212。
- 基因注释分类—人类
Known gene:
与人类已知cDNA(即已经在人类中发现的基因中)和蛋白质顺序同源的基因.
Novel gene:
与脊椎动物cDNA(即脊椎动物中中发现的基因中)或其它物种蛋白质同源的基因,此时基因叫做新基因.
Novel transcripts:
与novel 基因相似, 但缺少明确的ORF.(密码框还不清楚,蛋白序列还未知)
Putative gene(假定基因):
有同源EST支持, 但缺少cDNA或ORF.
Predicted gene (预测基因):
数据库中至少有一个外显子支持,但缺少cDNA或明确的ORF.(比如知道起始但终止不清楚)
Pseudogene(假基因):
与已知蛋白质有50%的相似性, 但cDNA残缺, 在其它位点存在正常的同源基因的顺序.
Nature 414:865-871, 2001
不同物种的注释程度是不同的,它关注点不同,注释水平就不同。
- 水稻注释基因类群的划分标准
Homology(同源的):
与某一蛋白质氨基酸顺序完全一致或相当一致的基因, 有两种水平: 一致的命名(same name); 可能的(putative protein)或类似的(-like protein)命名.
Unknown(未知的):
具有全长cDNA或EST(覆盖几乎整个基因范围)(有转录物的支撑但没有同源记录)支持但没有任何同源蛋白质记录的基因.
hypothetical (假定的):
由一个或几个注释软件认可的蛋白质, 但缺少cDNA或EST支持的基因.
第5章-2 基因组注释-实验检测
1全长cDNA克隆(通过实验方法来验证)
2基因功能实验验证
3基因本体功能聚类
- 全长cDNA与基因位置锚定成对末端序列克隆

基因表达可转录mRNA, mRNA逆转录为cDNA。通过捕获cDNA两端序列,即可确定基因的转录区间,
这一技术称为基因鉴定信号(gene identification signature, GIS)。
- GIS(gene identification signature, 基因鉴别信号)
是一种确定基因边界顺序的测定技术。在全长cDNA文库基础上,借助每个cDNA的两端连接的特定接头,获取成对末端标签。随后构建成对末端文库,测序后将末端序列锚定到基因组DNA。
- 人类基因组的基因注释
这是一份根据测序的人类基因组DNA序列和表达产物序列进行的初步基因注释,涉及17 500个, 29大类基因。

- 几种模式生物注释的基因数
大肠杆菌(E.coli): 4 288 酵母(yeast): 6 294 线虫(nematode): 19 000 果蝇(fly): 13 600
拟南芥(Arabidopsis): 25 498 水稻(rice): 30 000 小鼠(mouse): 20 210
- 基因功能的研究方法
1)正向遗传学(forward genetics)
在已知表型变异的前提下,通过遗传学分析寻找引起表型变异的遗传基础及其原因。涉及基因定位,基因克隆,基因的分子生物学功能研究等。又简称为表型到基因的研究(phenotype-to-gene)。
2)反求遗传学(reverse genetics)
已知某个或某些基因的组成,但不清楚这些基因对哪些表型有影响。采用人为方法有目的的引起靶基因的结构或表达变异,随之追踪基因变异对表型的影响及其分子生物学能。又简称为基因到表型的研究(gene-to-phenotype)。
- 反求遗传学方法
由于生物的突变类型和突变数目有限,不可能获得绝大多数基因的突变体,因此反求遗传学是研究基因功能的重要手段:
1) 上调基因的表达: 基因过表达 (gene overexpression)
2)破坏基因的表达: 基因剔除(gene knockout)
下调表达(Knockdown) : 如RNAi, 基因组编(ZFN, TALEN, CRISPR/Cas9, CRISPRi)
基因互作网络-依赖细胞周期素(cyclin)与蛋白质激酶(Cdks)互作网络图
- 转基因过表达检测基因功能
- 互作基因筛选—酵母双杂实验
转录因子一般有两个结构域,一个是与之结合的启动子,一个是激活域(可以激活下面的基因)。
技术上可以将这两个结构域分开。
- 基因互作网络-依赖细胞周期素(cyclin)与蛋白质激酶(Cdks)互作网络图
- 生物的必须基因:
在满足基本营养和无环境压力条件下维持生物个体生存必不可少的基因。一般不通过实验,不去对它进行突变的话很难识别。(物种之间有差别)
- 基因功能全方位注释--GO
另一种注释方式和思路:基因组它在整个代谢路线中,在代谢网络中的地位起什么作用。
基因本体(Gene Ontology)
是一个可以共享的词汇体系或图式词汇表, 用于生物信息学的词条搜索、语义交流和软件开发的工作平台。 以图解的方式进行注释。
组建基因本体的初衷
是希望提供一个可具代表性的规范化的基因和基因产物特性的术语描绘或词义解释的工作平台,使生物信息学研究者对基因和基因产物的数据能够进行统一的归纳、处理、解释和共享。
- 基因本体的组成
基因本体(GO)是一个词汇表,具有树形的结构,具有三个分枝:
1细胞组分: 细胞内部或细胞外环境的组成成分。
2生物学过程:由一个或多个分子功能有序组合而产生的系列事件。比如细胞周期分裂,某一个糖代谢。
3分子功能: 分子水平的活性(activity)。它是跨膜蛋白,还是催化蛋白。
树的基部是一个大概念,由大概念向下延伸产生中概念,再向下产生小概念。在概念集的延伸过程中可以产生分枝,每个分枝可以视作一个子集。每个概念模块都有一个约束其范围或边界的定义,并由基因本体指定相关基因的身份号(ID)。 基 因 本 体树 型 图 如下:

- 词义,节点及连接
基因本体对生物学词汇的描述是将其放在整个生物学网络的框架内,从不同的角度, 不同的层次以及整体活性的视角对生物学词汇进行注解。通过对词义之间的关联对词条的含义进行立体交叉注释。
在基因本体树形图中,处在各个节点的词条所对应的生物学事件具有相对的独立性,每个节点和其它节点的关系由编辑人员根据文献报道的结果进行筛选甄别后确定。
节点之间的关系或连接有三种:隶属,部分,调控。
节点关系连接图解,图中“祖孙”节点的关系是通过相邻两个“父子”关系的逻辑联系推论的,虚线表示“祖孙”节点之间的关系性质。
怎样描述基因:把它放在图中那个节点上,关系是什么。 ABC属于不同的层次,各节点之间的关系描述出来。

- GO操作
芯片聚类分析网上GO分析:
在GO网站上可以找到与芯片杂交结果相对应的GO分析工具,将所获得的数据按要求输入,即可获得基因富集分析结果. http://omicslab.genetics.ac.cn/GOEAST/php/agilent.php
eg:
草莓(strawberry)基因表达譜基因本体(生物学过程) 图中给出的是草莓果实(A)和根(B) 两种组织器官转录物组基因本体功能注释与作图。每个圆圈都是基因本体的一个节点, 圆圈大小代表草梅基因组中属于节点定义的基因数目。圆圈颜色深浅表示根据转录物组数据判断的相关程度及其意义,颜色深度表示重要性程度。例如, 草莓果实(A)转录物中代谢过程基因表达数量多于根(B) 。 根(B)组织中,细胞过程基因表达极少。
Nature 43: 109-116, 2011
第5章 基因组序列诠释---实验验证--基因组编辑
(也属于基因组实验研究的注释方法)
基因组编辑 (genome editing) 是一种人工靶向诱导基因组目标DNA序列发生突变的遗传工程。通过导入的核酸酶使DNA靶点发生双链DNA断裂,(一断列就会激活修复系统)再经细胞内DNA修复系统在靶点引入突变。
² 这一技术涉及两个问题:
1)如何实现靶向?
2)怎样产生双链DNA断裂(DSB) ?
² 基因组编辑技术有四大种类
1) meganuclease (罕见位点核酸酶) 现在已放,弃由于应用价值不大
2) ZFN Zinc-Finger Nucleases(锌指核酸酶)的简称。 ZFN技术原理: PNAS 93: 1156-1160, 1996
3) TALEN Transcription activator-like effector nucleases (转录激活因子样效应物核酸酶)
4) CRISPR/Cas9 or CRISPRi
2)锌指蛋白是真核生物中最丰富的转录因子之一。图示 TFIII A是5SrRNA基因的转录调控因子, 含9个锌指基序, 可识别与结合启动子区33个碱基序列,控制基因表达。
3)发现CRISPR
嗜热乳酸链球菌(Streptococcus thermophilus)酸奶发酵菌。抗噬菌体侵染的乳酸链球菌基因组中含有一种特别的遗传成分—CRISPR (规律性簇集间隔分布短回文重复序列),具有DNA免疫的功能。Science 315: 1709 -1712, 2007
第6章基因组解剖--真核生物基因组————认识整体的结构状况、结构特点。
- 染色体结构:DNA结合在染色体上
1) 染色体结构部件:端粒、着丝粒、复制起始点、MAR(基质附着区),SAR(支架附着区)
2)染色体带型:常染色质着色较淡(富基因区),异染色质着色较深(贫基因区)
3)人类染色体区带命名:断臂由p表示,长臂由q表示
- 基因组的结构成分
1)SAR和MAR
2) CpG岛
3) 等高线
4) 基因区
- SAR和MAR:
基质附着区matrix arrechment region与细胞核基质蛋白成分结合的染色体DNA序列。
支架附着区Scaffold attehment region与染色体骨架蛋白结合的染色体DNA序列

- MAR和SAR的特征
1) 环突DNA基部与细胞核基质紧密结合, 将染色体DNA分成相对独立的结构区域。
2) 与细胞核基质结合的DNA顺序(基质附着区,MAR)含有较高比例的AT, 约占总DNA的10%。
3) 拓扑酶II可与MAR结合, 因此推测MAR成分与DNA复制有关。
4) SAR可用二碘水扬酸铝分离, MAR则用高盐NaCl溶液分离。
由于发现许多功能基因的两侧含有MAR或SAR的结构,(所以可把基因两侧的功能给隔绝一下)并证实MAR和SAR具有阻止异染色质位置效应和隔离相邻基因彼此干扰的功能, 因此为了提高转基因的表达水平,在构建表达载体时可在基因两侧安装MAR或SAR顺序,以减少转基因沉默效应。
- CpG岛
CpG 段岛是基因组中一段200-500 bp的含有高于50%的双碱基CpG的区段。
基因组序列组成分析发现,脊椎动物中CpG岛大多分布在基因上游启动子的区和第一个外显子位置。
CpG岛中胞嘧啶不发生甲基化修饰。 PNAS 99:3740-3745,2002


哺乳动物基因启动子约40%含有CpG岛, 人类基因启动子CpG岛的比例高达70%。
- CpG岛的分布及其生物学意义:CpG岛主要是作为基因调控的信号指示。
- 脊椎动物DNA甲基化只发生在双碱基-CpG-的胞嘧啶(C)位置。胞嘧啶甲基化是基因沉默的信号,是基因表达调控的结构基础。在人体癌变细胞中一些重要的功能基因因甲基化修饰而沉默。绝大多数管家基因含有CpG岛, 是基因注释的重要依据。Genes & Dev. 25: 1010-102, 2011
- 等高线:碱基非均一分布
基因组顺序组成的等高线:把DNA片段取出后,发现不同区段的碱基组成有特征区别。一段AT多,一段GC多。
1) 等高线(isochore)系指基因组中具有较均一的相似比例碱基组成的连续的DNA顺序.
2) 脊椎动物基因组中等高线DNA顺序具有相嵌分布的特征.(一块一块的)
3) 高GC比例区总是分布在基因密集区或常染色质区, 高AT比例区大多数分布在异染色质区或贫基因区.
4) 梯度密度离心可将不同碱基比例的具有均一性组成的DNA顺序分离.

- 基因组等高线:
系指连续分布的具有相似碱基组成的DNA区段,它们在基因组中成片相嵌排列。按离心沉降区带分为为高比重(H)与低比重(L)两类。H3组分的单拷贝比例高达50%~70%。H3,H1+H2和L1+L2所含基因的数量分别占整个基因组的28%,38%和34%,说明大量的基因集中分布在人类基因组的有限区域。Gene 100: 181-187,1991
- 基因组的顺序组成根据序列的特征,可将人类基因组序列分为:
1) 编码顺序 2) 非编码顺序
3) 重复顺序 4) 单一顺序
人类基因组:在不同染色体上基因数差别较大。且基因分布密度
- 人类基因的一般结构
1) 人类基因平均含有4个外显子, cDNA长度平均为1350bp,编码450个氨基酸。
2) 人类基因组不同染色体之间基因密度差异悬殊(在不同染色体上基因数差别较大):
基因密度最高: 染色体19, 平均每Mb为23 个基因,43 kb/基因
基因密度最低: 染色体13 ,平均每Mb为 5 个基因,200 kb/基因
3) 目前人们确定人类基因组的编码基因约为22 333, 远低于预期。
http://users.erols.com/jkimball.ma.ultranet/BiologyPages/H/HGP.html
1) 人类蛋白质基因的大小相差悬殊,外显子和内含子的组成差别也很大。
最长的基因为肌萎缩蛋白,约2 220 kb。
最小的基因为组蛋白H1A,只有781 bp。 外显子数目最多的为肌联蛋白基因, 364个,
并且含有已知最长的内含子, 为1 209 kb。 肌联蛋白编码27 000个氨基酸, 为已知最大的人类蛋白质。
(外显子、内含子越多,越长,编码的蛋白质越大。)
2) 人类基因组转录因子基因
据推测人类基因组 转录因子数目的 上限在1,700–1,900之间。 左图显示24种人类细胞中的转录因子家族, 其成员数目相差很大, 从转录因子在生物学功能方面的分布数目来看, 大多数涉及发育过程, 其次为代谢调控, 第 3为刺激响应, 以下为免疫, 生殖和内部定位, 表明发育调控极其复杂。

- 不同生物基因数目及其分布密度:
原核生物密度较高。高等及人类的密度较稀疏。(调控序列较高)
植物相对于动物,转录因子较高,因为不能动,很大程度上需要响应外界环境,以及进行次生代谢。
- 基因区
基因沙漠区:
全基因组注释发现,在许多染色体区段存在大量无编码功能的DNA。人类基因组中其比例约占25%。除少数基因沙漠区外,绝大多数基因沙漠区是否属于真正的垃圾DNA(junk DNA),目前尚无定论???
不同染色体上沙漠区分布不同。不同物种间的沙漠区组成及保守型不同。
物种间亲缘关系越远,基因沙漠区的保守性越低。 富基因区和调控基因间区的沙漠带G+C含量(44.7-47.4%)高于全基因组平均值。(原因:与CpG岛有关系,岛是不编码的)Genome Research 15:137-145,2005。


- 染色体结构与重组位点
1) 短臂交换率大于长臂
2) 近端粒区交换率大于内部区域
3) 富基因区大于贫基因区(如基因沙漠区)
4) 存在重组热点Nat Rev Genet. 2:360-9, 2001
5) 染色体交换的位置大多分布在近启动子区或转录因子结合的区域
第6章 基因组解剖--原核生物及细胞器基因组
第7章 基因的转录调控 (这一章介绍三种RNA)
l 真核生物三种RNA聚合酶及基因分类
————————————————————
RNA聚合酶 转录产物
------------------------------------------------------------
RNA聚合酶I 28S,5.8S,18S核糖体RNA基因
RNA聚合酶II 蛋白质编码基因,小分子细胞核RNA(snRNA, U RNA)基因
RNA聚合酶III 转运RNA(tRNA), 5S核糖体RNA 、U6- snRNA,小分子核仁R(snoRNA)、小分子细胞质RNA(sc RNA)基因
————————————————————-
1) 三种RNA聚合酶的命名系根据这三种酶在层析柱上洗脱时出现的先后秩序依次命名.
2) 根据基因转录时采用的RNA聚合酶类型分别将基因分为PolI基因, PolII基因,PolIII基因.
- POLI基因-rRNA基因的结构
1) 真核生物rRNA基因编码18s, 5.8s和28s rRNA, 组成一个转录单位。
2) 真核生物rRNA基因均为多拷贝,首尾串联,在染色体上簇集分布。
3) rRNA基因转录场所在核仁区。
4) rRNA基因组成: 1, 非转录间区 (NTS), 含调控元件;
2, 外转录间区(ETS);
3, 内转录间区 (ITS);
4, rRNA基因编码区。


- rRNA基因启动子剖析
接头扫描法剖析rRNA基因调控区的结构,在rRNA基因上游-164至下游+33区段,合成10bp寡聚核苷酸依次代换原位10bp序列,检测它们对rRNA基因表达调控的影响。
采用这一方法确定-164至下游+33 位,有两段rRNA基因转录调控区,分别位于-156至-107和-45至下游+20。
- rRNA基因的转录调控
rRNA转录单位控制区 由一个覆盖转录起始点的核心启动子和,上游100bp位置的上游控制成分(UCE)组成。
第1步:结合因子(UBF)二聚体与核心启动子和UCE结合。
第2步:选择因子SL1与 UBF-DNA复合物以及核心启动子区结合。
SL1由TBP和三个TBP-缔合因子(TAF1)组成。
第3步: RNA多聚酶1附着到前面的复合物上,完成整个起始复合物的组装。
第4步:转录起始与延伸。

- Pol I调控顺序的物种间专一性
真核生物rRNA 基因的调控区有很强的种属专一性。
人类 rRNA基因不能再小鼠细胞表达,反之亦然。
人类的USE元件和小鼠的USE元件混合也不能调控转录。
- Pol I基因的调控顺序
真核生物细胞核rDNA转录区在各物种间显示很强的保守性,
而非转录区即调控区在长度与顺序组成上很大变异。
非转录区有以下三个特点:
1)含有启动子,控制rRNA基因的转录;
2)很多小段的重复序列,又称亚重复子,有增强子功能;
3) rRNA基因的调控顺序表现高度的种属专一性。
不同种属的rRNA基因缺少普遍适用的保守的启动子顺序。
- Pol II基因转录起始调控:以病毒为模式研究高等真核生物基因的表达调控
1)早期的高等真核生物基因表达研究是从动物病毒入手。因为高等生物病毒结构简单, 拷贝数高, 可以体外操作。
2)病毒基因的表达直接利用了寄主细胞基因调控装置, 反应了真核细胞内部的调控机理
- 实验方法Eg:SV40 猿猴病毒
(1)SV40基因组启动子功能解剖:将SV40启动子区分离克隆, 然后再整合到表达载体对其结构进行剖析。
(2)启动子与增强子功能-(方法)缺失检测

如上图, SV40启动子的序列组成, 有2个72bp和3个21bp的重复序列(GC盒框), TATA盒位置位于21bp盒下游。


如上图 , 分别将该调控区从5’-或3 -位置部分缺失,
检测其转录效率,可探知不同区段对基因转录的影响。 R, PV, Bgl, B: 不同的限制酶酶切位点。 得
1) 72bp,21bp必须同时具备
2) TATA不可或缺
3) 说明TATA盒决定转录起始、 转录起始点及转录方向。

- 增强子结构与功能剖析
1) 缺少增强子基因不能表达(E,F);
2) 增强子元件可以正反方向排列, 不影响基因表达效率(A,B);
3) 增强子有冗余现象(C,D)。
- 增强子与启动子 -位置关系

上图实验说明: 增强子和启动子(TATA盒框)之间的距离 与DNA双螺旋螺距的倍数有关,
整倍数可以转录, 但效率不同。 如增强子与启动子间的螺旋圈数为非整倍数, 转录效率急剧下降。
- 启动子的功能
1)为RNA聚合酶的结合提供平台 2)确定转录的方向 3)规定转录起始点
- Pol II增强子的特点
增强子特点如下:
1) 无启动子特异性,病毒SV40增强子可调控兔子β- 球蛋白启动子的表达。
2) 顺式作用(in cis) ,同一基因的启动子,编码序列与增强子位于同一DNA链。
3) 双向调控,反向插入时,仍然保持其原有功能。
4) 独立结构,改变其两侧的顺序组成不影响增强子的作用。
5) 超长距离调控,增强子可远离启动子位置,或位于内含子中。
6 ) 组合调控, 增强子中不同的调控元件可排列组合,控制基因时空特异性表达。
- POL III基因的种类
1) 5S rRNA基因 (启动子位于基因内部:采取5’-和3’-端逐段缺失的方法对5S rRNA基因的调控区进行功能检测,发现5S rRNA基因的调控区位于基因内部。 )
2) tRNA基因 启动子也位于基因内部,由两个分开的区段组成:
A盒(+10 至+20序列);
B盒(+50至+65序列)A盒与B盒之间间隔约30 bp。
3) 7SK RNA, 7SL RNA基因
4) U6 RNA
5) 某些病毒RNA基因


- PolIII基因结构-三种类型
1) 基因内启动子,
tRNA和5S rRNA基因;
2) 基因外启动子,
如U6 RNA和7SK RNA基因;
3) 混合启动子,
如7SL RNA基因,它们的转录起始由 上游调控顺序和基因内调控顺序共同负责。
A盒, B盒, C盒,均为调控顺序。DSE远端顺序元件; PSE近端顺序元件。
- Pol III基因转录起始复合物组装
第1步, Pol III C(tRNA基因), Pol III A-C(5S rRNA基因)和SNAPc(U6基因)与调控元件结合;
第2步,转录因子Pol III B随之结合;
第3步, Pol III RNA聚合酶与Pol III B结合。
整个转录起始复合物的组装按部就班,依次结合完成。
- 增强子由序列专一的元件组成
增强子含有许多不同的调控基序又称顺式元件, 每个特定的顺式元件都有特定的碱基序列组成。
。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。
细胞中RNA组成

- 转录物组决定于: 转录的基因与转录的方式
1)基因类别与RNA组成
2)组织与发育特异性
3)多启动子利用
- 单个基因具有复杂的转录模式
果蝇G蛋白β亚基13F基因(Gβ13F ) 含有3个不同的可用启动子, 10个不同的转录终止位置, 8种可变剪接方式。
果蝇神经细胞的RNA测序发现, Gβ13F 基因有235个不同的转录产物。 Nature 512: 393–399,2014
- 转录物组决定于: 基因的转录及转录后的加工与周转
1)m R N A加帽 目前已知所有Pol II RNA聚合酶转录物mRNA, U RNA (snRNA,snoRNA), miRNA前体, siRNA前体,piRNA前体均有5’ 加帽。(加了个磷酸集团)
2)加尾 可以让mRNA在特定时间翻译(可以不用刚转录就翻译)
3)剪接
4) 基因组转录面积
1)mRNA加帽的功能4个方面:
1 阻止mRNA的降解,mRNA的5'端加上m7GpppG帽子后,带有3个连接磷酸5‘帽结构可阻止RNase切割;
2 提高翻译效率,核糖体结合mRNA需借助加帽结构;
3 进出细胞核的识别标记;
4 提高mRNA的剪接效率。
2)mRNA 3’加尾
- mRNA 3’加尾的生物学功能:
1)可保护mRNA的稳定性,防止降解;
2) 提高mRNA翻译效率, Poly (A)可起始翻译;
3) 影响mRNA前体最后一个内含子的剪切;
4)调控 mRNA加尾的长短可用于控制mRNA的翻译。
真核生物mRNA的3'端含有三个涉及多聚腺苷酸化信号,AAUAAA, CA和G(U) n区。
3)前体mRNA剪接
- 真核生物mRNA剪接方式
A)真核生物有两种前体mRNA加工方式: GU-AG,AU-AC;
B)参与mRNA剪接加工的小分子RNA可分4种类群;
C)参与mRNA剪接加工的snRNA和snoRNA转后加工,有两次加帽,分别在细胞核和细胞质

真核生物两种mRNA剪接方式:
GU-AG,AU-AC
Pre-mRNA的剪接方式有两种,
依赖U1和依赖U12的剪接路线。
GU-AG模式为U1型,
AU-AC模式为U12型, 但其剪接步骤基本一致。

浙公网安备 33010602011771号