Question

我通过一个由约200万行+约600k行（两个MyISAM表）组成的宠物项目来学习MySQL的性能。在两个INT（10）索引列上使用BETWEEN进行范围查询，LIMITed为1返回结果大约需要160ms（包括INNER JOIN）。我认为我的配置没有经过优化，我正在寻找一些关于如何诊断或者可能＆＃34;常见配置＆＃34;的建议。

我创建了一个gist，其中包含表格，查询和my.cnf的内容。

在插入从MaxMinds open database的CSV文件导入的所有数据后，我创建了b-tree索引。我尝试了两个单独的，现在是一个综合索引，性能没有差异。

我在Macbook Pro上本地运行，主频为2,6GHz（i5）和8GB 1600MHz RAM。 MySQL是使用mysql的下载页面中的可下载二进制文件安装的（因为我的代表很低，无法提供第三个链接）。它是一个默认安装，没有对my.cnf配置文件进行重大添加，包含在gist中（位于我系统上的/usr/local/mysql-5.6.xxx/目录下）。

我担心的是，我达到了约160毫秒，这表明我错过了一些东西。我考虑过压缩桌面，但我觉得我错过了其他配置。 myisampack也不在我的PATH中（我认为）所以在我进一步探索之前我还在考虑其他优化。

感谢任何建议！

$ mysql --version
/usr/local/mysql-5.6.23-osx10.8-x86_64/bin/mysql  Ver 14.14 Distrib 5.6.23, for osx10.8 (x86_64) using  EditLine wrapper

表

CREATE TABLE `blocks` (
  `id` int(11) unsigned NOT NULL AUTO_INCREMENT,
  `begin_range` int(10) unsigned NOT NULL,
  `end_range` int(10) unsigned NOT NULL,
  `_location_id` int(11) unsigned DEFAULT NULL,
  PRIMARY KEY (`id`),
  KEY `begin_range` (`begin_range`,`end_range`)
) ENGINE=MyISAM AUTO_INCREMENT=2008839 DEFAULT CHARSET=ascii;

CREATE TABLE `locations` (
  `id` int(11) unsigned NOT NULL AUTO_INCREMENT,
  `country` varchar(2) NOT NULL DEFAULT '',
  `region` varchar(255) DEFAULT NULL,
  `city` varchar(255) DEFAULT NULL,
  `postalcode` varchar(255) DEFAULT NULL,
  `latitude` float NOT NULL,
  `longitude` float NOT NULL,
  `metro_code` int(11) DEFAULT NULL,
  `area_code` int(11) DEFAULT NULL,
  PRIMARY KEY (`id`)
) ENGINE=MyISAM AUTO_INCREMENT=641607 DEFAULT CHARSET=utf8;

查询

SELECT locations.latitude, locations.longitude
FROM blocks
INNER JOIN locations ON blocks._location_id = locations.id
WHERE INET_ATON('139.130.4.5') BETWEEN begin_range AND end_range
LIMIT 0, 1;

编辑; 在SELECT上更新了带有EXPLAIN的要点，为了方便起见也在这里发布了。

EXPLAIN SELECT locations.latitude, locations.longitude FROM blocks INNER JOIN locations ON blocks._location_id = locations.id WHERE INET_ATON('94.137.106.123') BETWEEN begin_range AND end_range LIMIT 0, 1;

+----+-------------+-----------+--------+---------------+-------------+---------+---------------------------+---------+------------------------------------+
| id | select_type | table     | type   | possible_keys | key         | key_len | ref                       | rows    | Extra                              |
+----+-------------+-----------+--------+---------------+-------------+---------+---------------------------+---------+------------------------------------+
|  1 | SIMPLE      | blocks    | range  | begin_range   | begin_range | 4       | NULL                      | 1095345 | Using index condition; Using where |
|  1 | SIMPLE      | locations | eq_ref | PRIMARY       | PRIMARY     | 4       | geoip.blocks._location_id |       1 | NULL                               |
+----+-------------+-----------+--------+---------------+-------------+---------+---------------------------+---------+------------------------------------+
2 rows in set (0.00 sec)

编辑2;为方便起见，将数据包含在问题中。

Answer 1

问题和正常方法（您的代码举例说明）会导致出现1095345行。我有一种方法可以在一个磁盘命中中执行该查询，即使缓存很冷。

摘自http://mysql.rjweb.org/doc.php/ipranges：

情况

您的数据包含大量不重叠的范围＆＃39;。这些可以是IP地址，日期时间（单站的显示时间），邮政编码等。

你有一对开始和结束值;一个项目＆＃39;属于每个这样的范围＆＃39;。因此，本能地，您创建一个包含范围的开始和结束的表格，以及有关该项目的信息。您的查询涉及一个WHERE子句，用于比较起始值和结束值。

问题

一旦获得大量项目，性能就会下降。你玩索引，但找不到任何效果。索引无法实现最佳功能，因为数据库不了解范围是不重叠的。

解决方案

我将提出一个解决方案，强制执行项目不能具有重叠范围的事实。该解决方案构建了一个表来利用它，然后使用存储例程来解决它所带来的笨拙。

在200万行MySQL MyISAM表上~150ms

1 个答案: