随笔分类 -  数据处理脚本

摘要:一、软件配置 curl -O ftp://ftp.ncbi.nlm.nih.gov/blast/executables/blast+/LATEST/ncbi-blast-2.6.0+-x64-linux.tar.gz tar zxvf ncbi-blast-2.6.0+-x64-linux.tar. 阅读全文
posted @ 2018-01-05 15:20 遗世独立的愚公 阅读(2025) 评论(0) 推荐(0)
摘要:一.软件配置: 1.下载 curl -OL http://iubio.bio.indiana.edu/soft/molbio/readseq/java/readseq.jar 2.运行方式: java -jar readseq.jar [options] 3.改运行方式稍显麻烦,且必须在readse 阅读全文
posted @ 2018-01-05 13:35 遗世独立的愚公 阅读(1405) 评论(0) 推荐(0)
摘要:一、安装好Entrez Driect 见:http://www.cnblogs.com/lmt921108/p/8087474.html 二、在NCBI官网找到需要下载的文件的accession号 二.创建bash脚本文件 1.下载全基因组fasta序列(get_comseq.sh) 运行:bash 阅读全文
posted @ 2017-12-28 16:36 遗世独立的愚公 阅读(2015) 评论(0) 推荐(0)
摘要:方法一:(见方法三的编程版) 1.表达矩阵56sr.count 57sr.count 2.利用pandas的合并函数进行合并,注意需要取并集 datamerge=pd.merge(data1, data2, on='gene', how='outer') 3.将缺失值重新赋值 datamerge.f 阅读全文
posted @ 2017-12-26 12:58 遗世独立的愚公 阅读(2353) 评论(0) 推荐(0)
摘要:seq=['A', 'C', 'G', 'T', 'S'] 计算出seq中两两排列组合,并以列表的方式排列。 阅读全文
posted @ 2017-12-11 16:07 遗世独立的愚公 阅读(267) 评论(0) 推荐(0)
摘要:"计算数组中最小的两个数的和" #!usr/bin/python3 #-*- coding:utf-8 -*- numbers=np.array((4,3,7,5,6)) def sum_two_smallest_numbers(numbers): numbers.sort() return numbers[0]+numbers[1] 阅读全文
posted @ 2017-12-11 15:07 遗世独立的愚公 阅读(275) 评论(0) 推荐(0)
摘要:"""将多行文件转换为一行 例: >001 AAGTCCGGTAA GGCTAGCTAAC TTCGAACGACA >002 GGCTAGCATGA CACATCGACAC CAGTAGCATCT 转换为: >001 AAGTCCGGTAAGGCTAGCTAACTTCGAACGACA >002 GGCTAGCATGACACATCGACACCAGTAGCATCT """ fr=open('test... 阅读全文
posted @ 2017-12-11 14:30 遗世独立的愚公 阅读(4411) 评论(0) 推荐(0)
摘要:""" 当add已有元素时,则不会有任何变化,这也是集合唯一性的表现,现在有一个全是字符串的集合,你设计程序,当加入一个字符串是集合中已有元素时,会自动在字符串后面加上“_1”再加入元素中,如 set1 = {'qwe', 'asd', 'z'} #加入'qwe',实际加入qwe_1,集合变成 {'qwe_1', 'qwe', 'asd', 'z'} """ set1 = {'qwe_1',& 阅读全文
posted @ 2017-12-11 14:03 遗世独立的愚公 阅读(260) 评论(0) 推荐(0)
摘要:#例如: dna = "GATGGAACTTGACTACGTAAATT" ##输出结果: """['GAT', 'ATG', 'TGG', 'GGA', 'GAA', 'AAC', 'ACT', 'CTT', 'TTG', 'TGA', 'GAC', 'ACT', 'CTA', 'TAC', 'AC 阅读全文
posted @ 2017-12-11 14:01 遗世独立的愚公 阅读(828) 评论(0) 推荐(0)
摘要:"""一段DNA序列,每3个字符作为一个整体,放入一个列表中,若最后不够3个,则剩下的作为一个整体。 例如: dna = "GATGGAACTTGACTACGTAAATT" 结果为: ['GAT', 'GGA', 'ACT', 'TGA', 'CTA', 'CGT', 'AAA', 'TT'] """ dna = "GATGGAACTTGACTACGTAAATT" t= 阅读全文
posted @ 2017-12-11 13:59 遗世独立的愚公 阅读(328) 评论(0) 推荐(0)
摘要:该软件功能强大,兼容所有系统。 网站:http://bioinf.shenwei.me/seqkit/usage/ 下载,解压,安装seqkit软件,下载二进制文件较好。 一、序列操作: 1.取反向序列 seqkit seq test.fa -r > test_re.fa 2.取互补序列 seqki 阅读全文
posted @ 2017-09-22 20:14 遗世独立的愚公 阅读(7245) 评论(0) 推荐(0)
摘要:1.利用Linux命令:awk 2.用法如下: awk '{if(NR%4 == 1){print ">" substr($0, 2)}}{if(NR%4 == 2){print}}' fastq > fasta 3.上述用法注意事项: fastq文件必须是解压格式的,不能是gz后缀的,虽然命令也能 阅读全文
posted @ 2017-09-22 17:10 遗世独立的愚公 阅读(10257) 评论(0) 推荐(0)
摘要:数值60代表每行输出60个碱基。(感谢原作者) 执行命令:perl fasta_re.perl srr.fasta > srr_re.fasta 如若执行不了,记得查看pl文件是否有可执行权限。 阅读全文
posted @ 2017-09-22 16:56 遗世独立的愚公 阅读(672) 评论(0) 推荐(0)