随笔分类 - Python编程
摘要:植物基因组里藏着大量调控元件和结构信息,它们分布在编码区和非编码区,参与转录起始、可变剪接、染色质开放等关键过程。这些区域碱基组成不均、依赖关系长、交互复杂,传统窗口式模型很难捕捉全局上下文。 高通量测序数据越来越多,物种越来越广,我们急需一个能跨物种泛化、支持多任务学习的统一建模框架。 植物科学领
阅读全文
摘要:近期,山东农业大学刘红军联合内布拉斯加大学杨金良等团队在Nature Communicaitons 上发表研究论文:The incomplete dominance of gene expression controlled by Trans-eQTL hotspots contributes to
阅读全文
摘要:番茄是重要蔬菜与果实研究模式植物,经万年人工驯化形成现代品种。人工选择提升产量等性状,但造成遗传瓶颈、多样性降低与有害突变积累。当前育种转向风味与营养,亟需以基因组解析为基础的精准设计育种。 近日,南京农业大学园艺学院吴瑶瑶教授团队在园艺学顶刊Horticulture Research上在线了题为:
阅读全文
摘要:提高大豆籽粒蛋白含量是大豆遗传育种的核心目标之一。传统育种依赖多年多点田间表型筛选,周期长且成本较高。东北农业大学宁海龙教授团队近期在The Crop Journal发表研究,系统整合基因挖掘、基因组选择模型与计算机模拟育种技术,构建从基因定位到杂交组合优化的完整技术链条,为高蛋白大豆品种选育提供可
阅读全文
摘要:全基因组重测序技术凭借覆盖全面、检测精准的特点,已成为挖掘功能位点、解析性状遗传基础的重要工具。随着研究群体规模的持续扩大,面对畜禽、水产以及水稻、小麦、玉米、大豆等作物的大样本量数据,常规计算平台常面临资源紧张、分析周期长等问题,影响项目整体进度。 米源生物基于企业级高性能计算集群与优化并行策略,
阅读全文
摘要:最近和朋友聊到一个问题:为什么现在的大语言模型在解读基因组数据时,效果总差那么一点意思? 不是模型能力不够,也不是训练数据不足,问题可能出在数据格式本身。 比如我们用了十几年的VCF格式,设计初衷是让生物信息分析师能看懂、能处理。每一行记录的是与参考基因组的差异,配合大量的元数据和外部注释文件,人类
阅读全文
摘要:2025年10月,国际水稻研究所(IRRI)公开发布了其水稻育种现代化的核心成果——Onerice育种框架,其宣称该框架已在IRRI及其合作伙伴的育种网络中全面落地。那么,今天我们来了解一下这个Onerice育种框架到底是个什么。 基于OneRice开发的优质水稻品种,以适应优先市场细分。图片来源于
阅读全文
摘要:基因挖掘与性状定位是连接表型变异与底层核酸序列差异的关键桥梁。长沙米源生物科技有限公司依托高密度变异图谱与多组学生信算力,构建涵盖全基因组关联分析、高密度遗传图谱构建及极端混池分组分析的高效挖掘体系,旨在为复杂数量性状与单基因突变性状提供精确的分子标记与候选功能靶标。 一、基因挖掘核心服务体系 1.
阅读全文
摘要:最近在一对一辅导一位同学做全基因组关联分析(GWAS)项目。他在处理一批水稻的数据时,使用 rMVP 跑流程遇到了几个非常典型的坑。从上千万个原始变异位点的质控过滤,到代码报错排查,再到最终模型选择,在这里记录总结下,供开展植物 GWAS 的同行参考。 一、 过滤位点过犹不及 在使用 PLINK 对
阅读全文
摘要:近日,华中农业大学胡学海&上海交通大学陆钰明团队在Plant Communications 发表了题为TargetGAN: A generative AI framework for designing plant core promoters with targeted activity 的研究文
阅读全文
摘要:陆地植物约有45万个物种,构成了陆地生态系统的根基,也支撑着人类文明。从不足0.1Gb到超过160Gb的基因组大小,从以单倍体配子体为主到以二倍体孢子体为主的生活史,从根、叶、花、果等复杂器官的诞生到退化或高度特化,陆地植物展现出了惊人的形态、核型、生态和生理多样性。然而,这些多样性的基因组基础,至
阅读全文
摘要:分享近期一篇发表在 Communications Biology 上比较接地气的文章:Large scale wheat data integration improves genomic prediction accuracy with the potential to facilitate in
阅读全文
摘要:全基因组重测序(Whole Genome Resequencing, WGRS)是对已知参考基因组序列的物种进行个体或群体测序,通过与参考图谱比对,全景式鉴定单核苷酸多态性(SNP)、小片段插入缺失(InDel)、结构变异(SV)及拷贝数变异(CNV)等遗传变异。该技术是开展种质资源评价、群体演化解
阅读全文
摘要:近期,张志武&王嘉博老师在Molecular Biology and Evolution上发表GAPIT Version 4。 GAPIT 第4版的核心是将全基因组关联分析(GWAS)结果整合到基因组预测(GP)中,提出了一种称为 GAGBLUP(GWAS-Assisted Genomic BLUP
阅读全文
摘要:Sentieon开发了一个名为vcflib的开源Python库,用于解析和操作变异检测的VCF结果文件。以下是该库的一些亮点功能: 支持读写未压缩或bgzip压缩并经过tabix索引的VCF文件; 支持VCF和gVCF(以.g.vcf.gz为后缀)文件; 输出文件会即时写入tribble(.vcf.
阅读全文
摘要:生信人员基本都是半路出家的野路子,大多没有系统学习过IT知识,只是在终端运行一些简单命令。而IT人员往往不懂生物、不懂统计、也不懂生信,因此要开发生物领域的系统和平台往往需要双方通力合作完成。 假设问题 假设你是生信人员,有一个命令行是:vcftools --vcf input.vcf --max-
阅读全文
摘要:CherryPy 是一个用于构建 Web 应用的微框架。它通过简洁的 API 和强大的功能,使开发者能够快速创建高性能的 Web 应用。在生物信息开发中,数据库搭建和模型部署等场景可能会用到,因此记录下。 学习资源 官方文档:https://docs.cherrypy.dev/en/latest/
阅读全文
摘要:作物模型提出很早,但应用有限。看起来复杂,其实解决的是环境与表型间的关联,可参考前期推文:作物生长模型CropGrow。环境组的复杂,关键在于数据的准确性获取。对于数据分析人员来说,如果不care数据准确性,分析其实很简单的,就是经典的机器学习流程。 这里提供一段伪代码仅供参考。 1. 导库 imp
阅读全文
摘要:目录问题解决 问题 Python通过pip安装PyVCF成功,但运行脚本时出现问题: File "/home/theo/anaconda3/lib/python3.9/site-packages/vcftoolz/vcftoolz.py", line 19, in <module> import v
阅读全文
摘要:折腾 数据分析用惯了R,感觉pandas用起来就有点反人类了。今天用python的pandas处理数据时两个数据框硬是合并不起来。 我有两个数据框,列名是未知的,只能知道索引,以及哪两个索引是用做主键合并的。(别问我为啥列名未知,因为我是开发工具)。 思路是这样的,找到主键列,重命名,再合并。 df
阅读全文

浙公网安备 33010602011771号