摘要
本发明公开了一种基因测序数据质量分数的并行压缩方法,包括步骤:1)对FASTQ格式文件数据进行划分,获得质量分数部分的数据;2)以行为单位,计算每一行质量分数的得分,并根据得分对这一行数据进行分类;3)当一个分类中质量分数数量达到阈值,或者这个分类无更多的质量分数加入时,将这个分类中的质量分数作为一个数据块放入计算缓冲队列中,并清空这个分类中的数据;4)由一个空闲的计算单元取走计算缓冲队列中的一个数据块,进行变换,使用向量化优化的ZPAQ进行编码,完成后放入输出缓冲队列中;5)由输出处理单元处理的压缩数据输出,直到完成所有压缩数据的输出,然后加入维护信息。本发明的技术方案具有性能高、扩展性强的特点。
- 单位