Lyra adlı üyeden alıntı: mesajı görüntüle
çok uzun sürebilir. bir veri için bir milyar datayı kontrol etmek mi yoksa bir veri için sürekli artan bir datayı kontrol etmek mi? Tabii ki ikinci. Sürekli bir milyar arasında aramaktansa eklemeden önce araması çok daha performanslı olacaktır.

Ya da hiç insert yapmadan python gibi alternatif bir dil kullanarak bu veri içerisindeki tekrar edenleri silebilirsiniz. Yükü php ve mysqlden almış olursunuz. Çok daha verimli.

bkz: https://stackoverflow.com/questions/...large-datasets
Onun hakkında şöyle bir düşücem olmuştu hocam veritabanında hiç sorgu çalıştırmamak adına fakat buda yapılabilir bişey mi pek bir fikrim yok, şöyle bir örnek vermek istiyorum,

Veri dosyası 1.txt 1GB
Veri dosyası 2.txt 890MB
Veri dosyası 3.txt 1.2GB

Bu 3 metin dosyamız daha önceden veri tabanına benzersiz bir şekilde yazdırıldı buraya kadar sorun yok.

Veri dosyası 4.txt 1GB , Bütün satırlar yukarıdaki 3 metin dosyası ile karşılaştırılacak ve tekrar eden satırlar Veri dosyası 4.txt içersinden temizlenecek ya da yeni bir metin belgesi olarak yazılacak. Böylelikle veri tabanında sorgu çalıştırmadan extra yük bindirmeden benzersiz verileri almış olacağım. Fakat 100 adet karşılaştırılacak metin dosyası olduğunu düşünürsek 80GB lık 100 adet metin dosyası ile 1GB metin dosyasını karşılaştırıp ayrıştırmak yapılabilecek birşey mi?