超大数据量存储常用数据库分表分库算法总结

更新时间：2015年07月06日 11:44:42 投稿：junjie

这篇文章主要介绍了超大数据量存储常用数据库分表分库算法总结,本文讲解了按自然时间来分表/分库、按数字类型hash分表/分库、按md5值来分表/分库三种方法,以及分表所带来的问题探讨,需要的朋友可以参考下

当一个应用的数据量大的时候，我们用单表和单库来存储会严重影响操作速度，如mysql的myisam存储，我们经过测试，200w以下的时候，mysql的访问速度都很快，但是如果超过200w以上的数据，他的访问速度会急剧下降，影响到我们webapp的访问速度，而且数据量太大的话，如果用单表存储，就会使得系统相当的不稳定，mysql服务很容易挂掉。所以当数据量超过200w的时候，建议系统工程师还是考虑分表.

以下是几种常见的分表算法。

1.按自然时间来分表/分库;

如一个应用的数据在一年后数据量会达到200w左右，那么我们就可以考虑用一年的数据来做为一个表或者库来存储，例如，表名为app，那么2010年的数据就是app_2010，app_2011;如果数据量在一个月就达到了200w左右，那么我们就可以用月份来分，app_2010_01，app_2010_02.

2.按数字类型hash分表/分库;

如果我们要存储用户的信息，我们应用的注册量很大，我们用单表是不能满足存储需求的，那么我们就可以用用户的编号来进行hash，常见的是用取余操作，如果我们要分30张表来存储用户的信息，那么用户编号为1的用户1%30=1，那么我们就存在user_01表里，如用户的编号为500，那么500%30=20，那么我们就将此用户的信息存储在user_20的表里.

3.按md5值来分表/分库;

我们假设要存储用户上传的文件，如果上传量大的话，也会带来系统的瓶颈问题，我们做过试验，在一个文件夹下如果超过200个文件的话，文件的浏览效率会降低，当然，这个不属于我们本文讨论的范围，这块也要做散列操作.我们可以用文件的用户名来md5或者用文件的md5校验值来做，我们就可以用md5的前5位来做hash，这样最多我们就可以得到5^5=3125个表，每次在存储文件的时候，就可以用文件名的md5值的前5位来确定这个文件该存那张表.

4.实例:某微博的url加密算法和存储策略的猜想.

现在好多微博都用这样的url来访问，如果他们的域名为www.example.com，那么如果你发微博的时候，你会发现你所发的url都变成了http://t.cn/Mx4ja1，这样的形式，他们是怎么进行这样的转换呢?我猜想就是用到了我们上面讲的md5的存储和查找规则，用你发的url来进行md5，得到md5值之后，如我们例子来说，就会用前6位来进行分表.

5.分表所带来的问题.

分表也会带来一系列的问题，如分页的实现，统计的实现，如果我们要做一个所有数据的分页，那么我们得每张表都得遍历一遍，这样访问效率会很低下.之前我尝试过用mysql的代理来实现，最终用tcsql来实现了.

6.分表算法的选择.

如果你的应用数据量不是特别大的话，最好别用分表。

您可能感兴趣的文章:

SQL注入详解（扫盲篇）
刚进公司的时候，研究的主要是SQL注入，因为之前没有搞过安全，所有费了好长一段时间对SQL注入基本知识进行了解。所以这篇文章并不是什么很深入的技术博客，或许应该叫它‘ SQL注入扫盲 ’有需要的朋友可以参考学习，下面来一起看看吧。
2017-01-01
SELECT INTO用法及支持的数据库
SQL中的SELECT INTO是一种将查询结果插入到新表中的操作,能够快速复制数据和表结构,本文主要介绍了SELECT INTO用法及支持的数据库,感兴趣的可以了解一下
2025-03-03
隐式转换引起的sql慢查询实战记录
大家知道数据库为了提高查询速度，增加索引是必不可少的，但是有些时候即使你加了索引也不定有效果，这篇文章主要给大家介绍了一次因为隐式转换引起的sql慢查询的相关资料，需要的朋友可以参考下。
2018-04-04
SQL行转列、列转行的简单实现
这篇文章主要给大家介绍了关于SQL行转列、列转行的简单实现方法，文中通过示例代码介绍的非常详细，对大家学习或者使用SQL具有一定的参考学习价值，需要的朋友们下面来一起学习学习吧
2019-05-05
数据分析数据库ClickHouse在大数据领域应用实践
这篇文章主要为大家介绍了数据分析数据库ClickHouse在大数据领域应用实践，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步早日升职加薪
2022-04-04
数据库中row_number() 分组排序函数的具体使用
row_number()是一个强大的SQL窗口函数,它通过partitionby和orderby子句实现分组和排序,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
2024-11-11
Sql Server 和 Access 操作数据库结构Sql语句小结
Sql Server 和 Access 操作数据库结构Sql语句小结...
2007-06-06
如何在mac中修改环境变量path
这篇文章主要介绍了如何在mac中修改环境变量path,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2020-07-07
在telnet下操作memcache详解（操作命令详解）
这篇文章主要介绍了在telnet下操作memcache详解,telnet下的memcache操作命令详解,需要的朋友可以参考下
2014-07-07
你应该知道的States字段使用规范
这篇文章主要给大家介绍了一些大家应该知道的States字段使用规范的相关资料，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧。
2017-12-12

超大数据量存储常用数据库分表分库算法总结

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具