跳到主要內容

發表文章

目前顯示的是 五月, 2015的文章

大數據人才培訓方向

2015年大數據的人才需求看似都是工程師類,實際真實狀況卻是,工程師可以找到,寫程式也沒問題,但是資料怎麼分析卻沒有人可以分析。如果說財經資料最龐大,華爾街早已經使用大數據分析財經走勢,那麼這肯定也是金融海嘯後的事情了。

大數據需要的技能可分為四類:

資料分析(data analysis)資料取得(data acquisition)資料探勘(data mining)資料結構(data structures)
最根本的問題還是在於

大數據怎麼定序?大數據該怎麼分析?
當上面兩個問題解決了,那麼軟體才可以著手進行撰寫。根據大數據定序方法,將其以母體方式討論,只有對與錯的分別,沒有任何的模糊地帶,這才是大數據告訴我們的真相。於是公司的營收與背後的製程將成為隨機變數與機率分配,透過資料形成的機率分配進行測定,了解各隨機變數之間的因果關係,從而為公司提供最佳的決策意見,甚至公司可能發生的問題也可從中發現。

不過有趣的是,無論是Cisco、IBM、Oracle與各自的供應商、合作夥伴或供應鏈的公司群都增加對大數據的人才需求,唯有IBM反而是減少。

其實這是因為IBM走行銷而非研發,更進一步來說,IBM並沒有需要大數據分析人才。
有意思的點是IBM的廣告多是提供顧問服務,若顧問服務不需要分析,那麼IBM就沒有需要大數據分析人才。

但是,大數據代表公司的所有資料,IBM不需要公司的所有資料就能夠分析出公司所有完整狀況,提供公司顧問服務,這顯得有點矛盾。

因此,可以知道IBM只走行銷路線!
缺少大數據分析的顧問服務,對IBM將是很大的衝擊!

另外一點就是美國的幾家大公司都認為大數據人才需求必須具備的技能都是電腦程式,不過,電腦程式工程師是否也是統計專家或財經專家,這有待商榷。

所以大數據人才培訓的方向,除了程式工程師外,更重要的是基礎的研究人才:分析人員!
大數據分析師將是成為主要的人才之一,偏偏都缺少了這樣的人才培訓。

問題在於人員看到大數據,但沒有軟體可以分析,想要讓軟體出現,又需要人員對資料定序,定序的原則須符合統計原則,就像雞生蛋、蛋生雞的問題一樣。

即便如此,分析人員在沒有大數據可以分析下,可以透過適度大的數據資料,經由分析之報表,練習如何解讀公司現況或是金融現況,從而推導出未來可能發生狀況或走勢,進而訂出策略。

古典經濟世界觀

經濟學的教科書大多是使用凱因斯的概念來說明總體經濟的總合供需,這是因為在古典學派的觀點上是以實質面為主,導致經濟體系內的市場呈現類獨立。
這樣的感覺在繪製圖形上特別明顯。 下圖的5個市場合成的圖內,勞動市場、生產函數與45度線都是為了畫出商品市場的總合供給。


而總合需求則是使用劍橋方程式(或貨幣數量學說:py =MV)得到的。
至於外匯市場的均衡線則是購買力平價說得到。
5張圖的關聯就在橘色線上。

這邊並沒有加入可貸資金市場圖來調節家計單位與廠商之金流。

Durbin-Watson檢定與LM檢定的存在意義

每一本統計學、計量經濟學、時間序列分析、迴歸分析、市場預測的書籍都會提到資料自我相關問題。為了找到資料的自我相關性,有的學者從樣本相關係數出發進行資料的假設檢定,有的學者則是創造與樣本相關係數很相近的數學公式進行資料的假設檢定,其中,最知名的便是Durbin-Watson檢定與LM檢定(Breusch–Godfrey)。兩個檢定公式的出發點都是一樣的,那就是從迴歸分析的殘差出發。

Durbin-Watson檢定公式

LM檢定公式
從資料角度去看,無庸置疑的是資料的數值都是已知的,我們使用迴歸分析來瞭解資料間的因果關係。換言之,此時,解釋變數與被解釋變數之間是樣本條件關係。然而,我們卻遺忘了一件事情,那就是資料也是可以形成分配的,那就是抽樣分配。
既然資料可形成抽樣分配,這意味著解釋變數與被解釋變數都是抽樣分配,需要以分配的概念去解讀。於是,在統計學內就明確寫著: 每個樣本服從母體分配樣本的變異數一樣都是母體變異數樣本之間是無線性相關
同樣在迴歸分析的解釋變數、被解釋變數與誤差都有各自的母體分配,並且滿足上面的三個條件。同時解釋變數與被解釋變數之間可以是聯合關係,也可以是條件關係。
進一步推導所得到的係數、殘差、甚至是殘差的數學組合、變異數分析表內的SSR、SSE、MSR、MSE、自我相關係數都是抽樣分配。
請注意,這些都是隨機變數或隨機變數的數學組合,所以都是抽樣分配(只討論一個數字,不是分配)。當樣本數夠大時,才能夠代表母體分配(樣本要多大,沒人知道)。
所以要使用公式前,問問: 你確定資料的抽樣分配了嗎?你確定資料的抽樣分配轉換過程了嗎?(是數值的亂數表,不是機率生成的亂數表)隨機變數的數學組合之間有沒有成為函數關係?(例如自我相關係數與MSE)
當我們確定每一個轉換步驟狀況後,就可以觀察到解釋變數數值、解釋變數個數、誤差母體分配、樣本數、殘差限制對Durbin-Watson檢定與LM檢定的抽樣分配變化。
確實,Durbin-Watson檢定適合所有樣本大小,但是Durbin-Watson檢定的決策規則本身有問題,不符合統計公式的原則,那就是灰色地帶判定給虛無假設,因此只有虛無與對立假設的二分法,以及分配的臨界值只會有一個數字,而不會有所謂的上下界。除非沒有控制住解釋變數數值與殘差限制影響,才會讓這兩個影響融入分配當中,造成臨界值的不確定,產生了帶狀區間。
Dur…