應(yīng)用場景:
有時需要測試插入數(shù)據(jù)庫的記錄來測試,所以就非常需要用到這些腳本。
創(chuàng)建表:
CREATE TABLE `tables_a` ( `id` int(10) NOT NULL DEFAULT '0', `name` char(50) DEFAULT NULL, PRIMARY KEY (`id`) ) ENGINE=InnoDB DEFAULT CHARSET=utf8;
創(chuàng)建產(chǎn)生隨機字符串的函數(shù):
set global log_bin_trust_function_creators = 1; DROP FUNCTION IF EXISTS rand_string; DELIMITER // CREATE FUNCTION rand_string(n INT) RETURNS VARCHAR(255) BEGIN DECLARE chars_str varchar(100) DEFAULT 'abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ0123456789'; DECLARE return_str varchar(255) DEFAULT ''; DECLARE i INT DEFAULT 0; WHILE i <p>創(chuàng)建插入表的procedure,x是從多少開始。y是多少結(jié)束,z是產(chǎn)生多少位隨機數(shù)</p> <p> </p><pre class="prebrush"> delimiter // create procedure test(x int(10),y int(10),z int(10)) begin DECLARE i INT DEFAULT x; while i<y do insert into tables_a values set i="i+1;" end whi><p><strong>mysql隨機數(shù)據(jù)生成并插入</strong></p> <p>dblp數(shù)據(jù)庫中引用信息很少,平均一篇論文引用0.2篇。使用dblp做實驗數(shù)據(jù)集的某篇論文提到,可以隨機添加引用信息。受此啟發(fā),我打算為每一篇論文都添加20篇隨機引用,于是就寫出了如下的sql語句:</p> <p>String sql = "insert into citation(pId1,pId2) values( (select pId from papers limit ?,1),(select pId from papers limit ?,1))";</p> <p>使用preparedstatement,以batch方式提交數(shù)據(jù)庫。</p> <p>第一個參數(shù)是paper的rowid信息,從0~N(N為papers的total row)。第二個參數(shù)是Java生成的20個不重復(fù)的隨機數(shù),范圍是0-N。然后嵌套在for循環(huán)里,每1w條數(shù)據(jù)提交給數(shù)據(jù)庫一次。</p> <p>這段代碼巧妙運用limit的特性完成隨機選tuple,本來是暗暗得意的。自以為把所有的select都交給數(shù)據(jù)庫去做了,省去了通過jdbc的多次連接,應(yīng)該是很快就可以運行完成的。哪知,插了不過10w條(10000*10)數(shù)據(jù),就耗時22分鐘之多。最終的實驗需要插入400w條數(shù)據(jù),也就是說要花14h左右。</p> <p>于是開始反思,不斷做寫類似的程序查找時間瓶頸,最終鎖定在select limit,這個操作極耗時間。當(dāng)初選用limit,原因在于:隨機生成的是數(shù)字,要把數(shù)字映射到tuple,也就是對應(yīng)到rowid;由于papers表的主鍵并非遞增int,所以默認(rèn)的rowid不存在。后來一想,可以在papers表上先增加一個auto_increment的temp列,完成citation插入后再刪除。這樣sql語句就改成了:</p> <p>String sql = "insert into citation(pId1,pId2) values((select pId from papers where temp=?), (select pId from papers where temp=?))";</p> <p>再一次插入10w條數(shù)據(jù),耗時38s。效率大幅提高,但不知道還可不可以進一步優(yōu)化。</p></y>
? 版權(quán)聲明
文章版權(quán)歸作者所有,未經(jīng)允許請勿轉(zhuǎn)載。
THE END