本週創紀錄的連發兩篇文章,希望大家不會覺得很煩!! 本週在找資料的時候,無意中發現了這個部落格,我覺得他把Data mining的基本概念整理的很好,尤其是下面有針對關連性法則的詳細說明,所以我提出來跟大家分享,所以如何大家有發現什麼好站,也歡迎推薦給我喔!! 感謝
宅學習網址
底下還有針對心智圖的筆記,大家也不妨試試,我個人是用Xmind,所以如果有任何問題,也可以討論喔!!
2013年5月30日 星期四
集群分析(K-Means Clustering)
想說很久沒有發文了,再不發文可能就會一直拖下去,看來寫部落格應該也是培養一種習慣吧!! 上週在找教學範例檔的時候,無意發現了這個網站「Analytics and Visualization of Big Data」,裏面有cover一些資料探勘的內容,如:如何用RapidMiner做集群分析(K-Means Clustering)的教學(Tutorial),雖然沒有影片,但是有Step-by-Step的操作畫面,所以,有興趣的同學可以去參考一下。
網址在此
另外,想到之前上課一直沒有講到的地方,就是RapidMiner本身就有教學的範例,如果你想要多練習、多觀摩,可以使用軟體本身的例子,範例檔的位置就在一開啟Rapidminer資料庫(Repository)的時候,一般我們會在DB下面建立我們自己的資料庫,在樹狀資料的最上方有個Sample,展開後就會發現有Data和Process兩個目錄匣,可以在裏面找到教科書中有涵蓋和沒有涵蓋的程序,例如SVM、Validation等,可以學習到進階的資料分析方式。至於Data,則可以配合YouTube上的Tutorial或是利用學過的分析方法(例如相關性分析、關連法、迴歸等)則加以分析,各位同學可以先將資料拉進RapidMiner看看資料的內容,再決定選擇那一種分析方式即可。
使用Rapidminer操作SVM的教學影片如下:
使用Rapidminer操作Cross-validation的教學影片如下:
網址在此
另外,想到之前上課一直沒有講到的地方,就是RapidMiner本身就有教學的範例,如果你想要多練習、多觀摩,可以使用軟體本身的例子,範例檔的位置就在一開啟Rapidminer資料庫(Repository)的時候,一般我們會在DB下面建立我們自己的資料庫,在樹狀資料的最上方有個Sample,展開後就會發現有Data和Process兩個目錄匣,可以在裏面找到教科書中有涵蓋和沒有涵蓋的程序,例如SVM、Validation等,可以學習到進階的資料分析方式。至於Data,則可以配合YouTube上的Tutorial或是利用學過的分析方法(例如相關性分析、關連法、迴歸等)則加以分析,各位同學可以先將資料拉進RapidMiner看看資料的內容,再決定選擇那一種分析方式即可。
使用Rapidminer操作SVM的教學影片如下:
使用Rapidminer操作Cross-validation的教學影片如下:
2013年5月21日 星期二
RapidMiner與其他資料探勘軟體的比較
我又發現了一個網站,把市面上常見的開放源碼做資料探勘的軟體羅列比較,但由於沒時間翻譯,因此,我把連結貼出來,希望有興趣的人自己上網參考。
網站AI Computer Vision
比較一
比較二
相較於貴森森的SPSS、SAS,RapidMiner在各方面的表現(ex. 文件處理、圖形化介面、操作簡易、指令敘述與演算法)均在中上水準。
以下是我直接把作者覺得的優點和缺點貼上給各位參考
希望以上資訊對各位學習上
網站AI Computer Vision
比較一
比較二
相較於貴森森的SPSS、SAS,RapidMiner在各方面的表現(ex. 文件處理、圖形化介面、操作簡易、指令敘述與演算法)均在中上水準。
以下是我直接把作者覺得的優點和缺點貼上給各位參考
RapidMiner
RapidMiner is an open source statistical and data mining package written in Java.
- Solid and complete package.
- It easily reads and writes Excel files and different databases.
- You program by piping components together in a graphic ETL work flows.
- If you set up an illegal work flows RapidMiner suggest Quick Fixes to make it legal.
Issues:
- I only got it to works under Windows, but others have gotten it to work in other environments, see comment below.
- There are a lot of different ETL modules; it took a while to understand how to use them.
- First I had a hard time making a comparison between different models. Eventually I found a way: You chose a cross validation and select different models one by one. When you run the model the will all be stored on the result page and you can do comparison there.
希望以上資訊對各位學習上
標籤:
資料探勘軟體比較,
R,
Rapidminer,
Weka
資料探勘與資料庫行銷專題
使用軟體:RapidMiner 5.0版
軟體優點:不需要瞭解複雜的演算法、資料結構與撰寫程式的能力
下載位置:Rapid-i.com網站(需註冊後下載) Dropbox載點
教材檔案
課程進度
第一週 軟體安裝、操作介面介紹、資料準備、相關性分析(Correlation)
第二週 關連分析(Association Rules)、集群分析(K-Means Clustering)、區別分析(Discriminant Analysis)
第三週 線性迴歸分析(Linear Regression)、羅吉斯分析(Logistic Regression)
第四週 決策樹(Decision Trees)、社群網絡分析(SNA)
第五週 類神經網路 (Neural Network)
第六週 文字探勘(Text Mining)、網頁探勘(Web Mining)
章節導讀
Step 1. 個案內容
Step 2. 瞭解資料類型與資料分析的目的(ex. 解決問題或輔助決策)
Step 3. 資料準備 (ex. 檢視資料是否完整或遺漏值)
Step 4. 建立資料分析模型 (ex. 分類、預測還是兩者都有)
Step 5. 結果評估 (ex. 統計結果、因果邏輯、交叉驗證)
Step 6. 成果報告 (ex. 簡報結果、與客戶交換意見與資料儲存)
上課注意事項
- 因為課程時間很短,儘量每週都能出席。
- 範例檔或操作結果請儲存在隨身碟或雲端,以便每次上課時使用。
- 鼓勵帶自己的資料來分析,在每堂課結束前可留半小時提問。
- 可多利用網路資源(ex. YouTube或社群討論),輔助學習。
個人心得分享:
網路資料無窮無盡、免費且方便取得,分析工具眾多,電腦運算能力強大,在Big Data海量資料分析的時代,只有懂得問對問題的人才能挖到真正的金礦。
2013年5月20日 星期一
RapidMiner在YouTube上的教學影片
開發開放源碼的資料探勘軟體RapidMiner的公司Rapid-i有一個YouTube的專屬頻道(名稱是Rapid-I: OS Business Analytics),目前上面有17隻影片,大部份是講分析工具RapidAnalytics的用法,總共有1-9個單元,也有RapidMiner的影片,所以,想要學習RapidMiner和RapidAnalytics的人不要錯過囉!!不過,講者和內容都是英文,如果英文聽力有點吃力的讀者,可以試著打開YouTube字幕翻譯的功能,應該多少可以瞭解大概的內容。
頻道的連結在此
頻道的連結在此
2013年4月28日 星期日
走在時尚前端的Zara用Big Data打敗LV, H&M
這一期的Wired Taiwan主題介紹Big Data,看來應該去買本雜誌來瞧瞧裏面寫了什麼內容。
以下摘錄自TechOrange網站,我認為比較精華的部份
以下摘錄自TechOrange網站,我認為比較精華的部份
- 以線上店為實體店的前測指標
2010 年秋天,Zara 的 Big Data 系統,向前邁開更大一步。
Zara 一口氣在六個歐洲國家成立網路商店,增添了網路巨量資料的串連性。隔年,分別在美國、日本建構網路平台,除了增添營收,線上商店強化了雙向搜尋引擎、資料分析的功能。不僅回報意見給生產端,讓決策者精準找出目標市場,對消費者提供更準確的時尚訊息,雙方都能享受 Big Data 帶來的好處。分析師預估,網路商店為 Zara 至少提升了 10% 營收。
此外,線上商店除了交易行為,也是活動產品上市前的行銷試金石。Zara 通常先在網路上舉辦消費者意見調查,再從網民回饋中,擷取顧客意見,以此改善實際出貨的產品。
在實體的消費行為中,很難立即分析出不同消費族群的偏好。然而,網路上的行銷活動,消費者每一筆點選過的資料、停留時間、下單數量、單次購買金額,都會被記錄在交易系統內,送到 Zara 系統中樞建擋。產品區隔化和生產目標客群,不需要真正出貨,網路資料一覽無遺。
因此,Zara 將網路上的巨量資料視為實體店面的前測指標。會在網路上搜尋時尚資訊的人,對服飾的喜好、資訊的掌握,催生潮流的能力,比一般大眾更前衛。再者,會在網路上搶先得知 Zara 資訊的族群,進實體店面消費的比率也很高。Zara 選擇迎合網民喜歡的產品或趨勢,果然在實體店面的銷售成績,依舊亮眼。
這些珍貴的顧客資料,除了應用在生產端,同時被整個 Zara 所屬的英德斯(Inditex)集團各部門運用:包含客服中心、行銷部、設計團隊、生產線和通路等。根據這些巨量資料,形成各部門的關鍵績效指標(Key Performance Indicators),進而完成 Zara 內部的垂直整合主軸。
有什麼其他的心得,等我看了雜誌再分享!!
2013年4月27日 星期六
RapidMiner教材
由於這學期要教授Datamining課程,我遍尋簡單又好上手的教材,但無奈台灣使用RapidMiner的人實在太少了,對岸有一些參考資料,但多半是一些影片而不是完整的教材,倒是有搜尋到徵教Rapidminer的人,酬勞還不少呢!也許將來教材做好之後還可以拿來賣錢(旁白:想太多)。不過後來在RapidMiner官網上看到一絲希望,Dr. North針對Rapidminer寫了一本書,書名叫Datamining for the Masses,正合我意。Amazon有賣,但是無奈國內也沒有中文書,但好在內容真的是淺顯易懂啊,還附上資料檔,可以直接按步驟操作,有沒有那麼容易啊,不懂Datamining的演算法也可以跑出資料,這真是太神奇了!!

Amazon的介紹在此,一本書$39.9元。書中的參考範例檔放在Google雲端硬碟上,隨時可以下載使用
(範例檔網址)
由於RapidMiner是一個開放源碼的軟體,因此,我推薦本書給想要學習Datamining,但又不想花錢購買軟體的使用者。
關於作者的簡歷,由於無暇翻譯,提供Amazon上的介紹給大家參考
Dr. Matthew North is Associate Professor of Computing and Information Studies at Washington & Jefferson College in Washington, Pennsylvania, USA. He has taught data management and data mining for more than a decade, and previously worked in industry as a data miner, most recently at eBay.com. He continues to consult with various organizations on data mining projects as well. Dr. North holds a Bachelor of Arts degree in Latin American History and Portuguese from Brigham Young University; a Master of Science in Business Information Systems from Utah State University; and a Doctorate in Technology Education from West Virginia University. He is the author of the book Life Lessons & Leadership (Agami Press, 2011), and numerous papers and articles on technology and pedagogy. His dissertation, on the topic of teaching models and learning styles in introductory data mining courses, earned him a New Faculty Fellows award from the Center for Advancement of Scholarship on Engineering Education (CASEE); and in 2010, he was awarded the Ben Bauman Award for Excellence by the International Association for Computer Information Systems (IACIS). He lives with his wife, Joanne, and their three daughters in southwestern Pennsylvania.

Amazon的介紹在此,一本書$39.9元。書中的參考範例檔放在Google雲端硬碟上,隨時可以下載使用
(範例檔網址)
由於RapidMiner是一個開放源碼的軟體,因此,我推薦本書給想要學習Datamining,但又不想花錢購買軟體的使用者。
關於作者的簡歷,由於無暇翻譯,提供Amazon上的介紹給大家參考
Dr. Matthew North is Associate Professor of Computing and Information Studies at Washington & Jefferson College in Washington, Pennsylvania, USA. He has taught data management and data mining for more than a decade, and previously worked in industry as a data miner, most recently at eBay.com. He continues to consult with various organizations on data mining projects as well. Dr. North holds a Bachelor of Arts degree in Latin American History and Portuguese from Brigham Young University; a Master of Science in Business Information Systems from Utah State University; and a Doctorate in Technology Education from West Virginia University. He is the author of the book Life Lessons & Leadership (Agami Press, 2011), and numerous papers and articles on technology and pedagogy. His dissertation, on the topic of teaching models and learning styles in introductory data mining courses, earned him a New Faculty Fellows award from the Center for Advancement of Scholarship on Engineering Education (CASEE); and in 2010, he was awarded the Ben Bauman Award for Excellence by the International Association for Computer Information Systems (IACIS). He lives with his wife, Joanne, and their three daughters in southwestern Pennsylvania.
訂閱:
文章 (Atom)
