關聯規則--用來發現資料中屬性具有高度關聯的樣式(fpgrowth algorithm)
這篇不是要講很艱深的東西,簡單解釋一下啥事關聯規則。 基本上上面這張購物欄交易資料,透過底下的 apriori 演算法程式,可以找到啤酒和尿布具有很大的相關性,他的支持度高達 50 。 故事請看這裡 。這是個範例,只是說明關聯規則程式可發覺這樣形式的規則關聯樣式。 在網路上有個人 Christian Borgelt 寫了很多程式,其中有 apriori 和 fpgrowth ,基本上這兩個程式做的工作差不多,但是 fpgrowth 有效率多了。 所以今天用這個 fpgrowth 程式來跑跑看數據。 我從: http://fimi.ua.ac.be/data/ Frequent Itemset Mining Dataset Repository 抓了很多資料 http://fimi.ua.ac.be/data/T10I4D100K.dat http://fimi.ua.ac.be/data/T40I10D100K.dat http://fimi.ua.ac.be/data/webdocs.dat.gz 放到我的電腦內,然後去找 Christian Borgelt http://www.borgelt.net/fpgrowth.html 抓了一些程式。 大概長的這樣: [hadoop@hnamenode FrequentItemset]$ ls -la -rwxrwxr-x. 1 hadoop hadoop 486760 Sep 5 05:17 fpgrowth -rw-rw-r--. 1 hadoop hadoop 4022055 Oct 14 2010 T10I4D100K.dat -rw-rw-r--. 1 hadoop hadoop 15478113 Oct 14 2010 T40I10D100K.dat -rw-rw-r--. 1 hadoop hadoop 151 Oct 17 23:15 webdocs.out 有個很簡單的檔案 sample_fpgr...