2020年6月9日 星期二

[tf.keras]利用LSTM預測泵傳感器剩餘壽命(四)—驗證

在上一章節我們訓練完成了模型檔,並儲存為LSTM_result.h5的檔案,現在,我們在資料檔的同一個資料夾建立名為lstm_verification.py的檔案,並使用程式碼編輯器開啟它。

驗證前將引入以下套件:
import pandas as pd
import numpy as np
from tensorflow.keras.models import load_model

import copy

利用pandas讀取上一章節建立的正規化前資料。
valueList= pd.read_csv('./ValueList.csv')

利用pandas讀取一開始建立的訓練檔資料。
df2 = pd.read_csv('./test_sensor.csv')

利用drop移除不需要的欄位,並利用fillna將空白資料填滿0。
df2 = df2.drop(['timestamp','sensor_15','sensor_50','Unnamed: 0','machine_status'],axis=1)
df2 =df2.fillna(value=0)

建立正規化的函數,使用訓練時儲存的參數。
def normalize(train2):
    for i in train2:
        max11=valueList[i][0]
        min11=valueList[i][1]
        mean11=valueList[i][2]
        train2[i]= train2[i].apply(lambda x: (x - mean11) / (max11 - min11))
        train2[i][train2[i]>(max11 - mean11) / (max11 - min11)]=(max11 - mean11) / (max11 - min11)
        train2[i][train2[i]<(min11 - mean11) / (max11 - min11)]=(min11 - mean11) / (max11 - min11)

    return train2

建立反正規化函數,依然是使用訓練時儲存的參數。
def unnormalize(train):
  train2 = copy.deepcopy(train) 
  for i in range(len(train)):
      train2[i]=train[i]*(valueList['time_left'][0]-valueList['time_left'][1])+valueList['time_left'][2]

  return train2

資料的X刪除剩餘時間,而Y則是只保留剩餘時間。
def buildTrain(train):
  X_train, Y_train = [], []
  train2=train.drop(['time_left'],axis=1)
  #for i in range(train.shape[0]):
  X_train=np.array(train2.iloc[:][:]).tolist()
  Y_train=np.array(train.iloc[:]["time_left"]).tolist()
  return np.array(X_train), np.array(Y_train)

工具函數都訂好了之後,將資料除60再除24,能夠將分鐘換算成天,我們就以天為單位做驗證。
df2["time_left"]=df2["time_left"]/60/24

替驗證資料做正規化及上一章節提到過的動作。
test_norm =normalize(df2)
X_val, Y_val = buildTrain(test_norm)

X_val = X_val[:,np.newaxis]

載入訓練完成的模型。
model=load_model("LSTM_result.h5")

進行預測
prediction=model.predict(X_val)
count=0
prediction1=prediction
for i in range(prediction1.shape[0]):
    prediction1[i]=unnormalize(prediction[i])
Y_val1=unnormalize(Y_val)
for i in range(len(Y_val)):
    if prediction1[i][0][0]<=Y_val1[i]+0.5 and prediction1[i][0][0]>=Y_val1[i]-0.5:
        count=count+1
print(count/len(Y_val1))

最後驗證的準確度為:0.9955842595373986
意謂著,若以天為單位(正負誤差12小時),訓練集跟驗證集的準確度差不多,都有99%的準確度。

[tf.keras]利用LSTM預測泵傳感器剩餘壽命(三)—訓練

我們在資料檔的同一個資料夾建立名為lstm_train.py的檔案,並使用程式碼編輯器開啟它。

訓練前將引入以下套件:
import pandas as pd
import numpy as np
from tensorflow.python.keras.models import Sequential
from tensorflow.python.keras.layers import Dense, Dropout, Activation, Flatten, LSTM, TimeDistributed, RepeatVector
from tensorflow.python.keras.layers.normalization import BatchNormalization
from tensorflow.python.keras.optimizer_v2.adam import Adam
from tensorflow.python.keras.callbacks import EarlyStopping, ModelCheckpoint
import matplotlib.pyplot as plt
from tensorflow.keras.models import load_model
import copy

利用pandas讀取上一章節建立的訓練檔資料。
df = pd.read_csv('./train_sensor.csv')

利用drop移除不需要的欄位,並利用fillna將空白資料填滿0。
df = df.drop(['timestamp','sensor_15','sensor_50','Unnamed: 0','machine_status'],axis=1)
df =df.fillna(value=0)

定義正規化函數,將資料正規化為:

(值-平均)/(對大值-最小值)
/def normalize(train):
  train_norm = train.apply(lambda x: (x - np.mean(x)) / (np.max(x) - np.min(x)))
  return train_norm

定義反正規化函數,目的是最後在驗證時要把正規化後的剩餘時間反轉回原來的數字。
註:valueList為之後才會宣告的物件。
def unnormalize(train):
  train2 = copy.deepcopy(train) 
  for i in range(len(train)):
      train2[i]=train[i]*(valueList['time_left'][0]-valueList['time_left'][1])+valueList['time_left'][2]

  return train2

這個是儲存正規化前資料用的csv檔,包含資料欄位的最大值、最小值、平均值。
註:如忽略此項動作,對驗證檔單獨驗證時會比較麻煩。
def save_normalize(df):
    ValueList=copy.deepcopy(df[:][:3])
    for i in df:
        max1=np.max(df[i][:])
        min1=np.min(df[i][:])
        mean1=np.mean(df[i][:])
        ValueList[i][0]=max1
        ValueList[i][1]=min1
        ValueList[i][2]=mean1
    ValueList.to_csv('./ValueList.csv')

這是切分函數,輸入數值(如0.1)將切割成90%的訓練資料及10%的驗證資料並回傳。
def splitData(X,Y,rate):
  X_train = X[int(X.shape[0]*rate):]
  Y_train = Y[int(Y.shape[0]*rate):]
  X_val = X[:int(X.shape[0]*rate)]
  Y_val = Y[:int(Y.shape[0]*rate)]
  return X_train, Y_train, X_val, Y_val

這是將訓練資料的X刪除剩餘時間,而Y則是只保留剩餘時間。
def buildTrain(train):
  X_train, Y_train = [], []
  train2=train.drop(['time_left'],axis=1)
  X_train=np.array(train2.iloc[:][:]).tolist()
  Y_train=np.array(train.iloc[:]["time_left"]).tolist()
  return np.array(X_train), np.array(Y_train)

shuffle函數則是將訓練資料洗牌(由於之前在Excel洗牌過了,所以也可忽略)。
註:np.random.seed相當重要,那代表亂數種子,可以用它來確保每次亂數結果相同,在模型儲存後重開視窗二度訓練時就能使這次的打亂跟上次一樣,否則第二次切分後的訓練集跟驗證集將跟第一次的切分混淆。
def shuffle(X,Y):
  np.random.seed(10)
  randomList = np.arange(X.shape[0])
  np.random.shuffle(randomList)
  return X[randomList], Y[randomList]

工具函數都訂好了之後,將資料除60再除24,能夠將分鐘換算成天,我們就以天為單位做訓練和驗證。
df["time_left"]=df["time_left"]/60/24

儲存正規化前的資料。
save_normalize(df)

將資料正規化,並讓X跟Y分離:
X為sensor的資料,Y為剩餘天數。
train_norm = normalize(df)
X_train, Y_train = buildTrain(train_norm)

將資料洗牌(可斟酌情況忽略)
X_train, Y_train = shuffle(X_train, Y_train)

將資料切分為訓練過程時的訓練,跟驗證(並非驗證檔的驗證)。
X_train, Y_train, X_val, Y_val = splitData(X_train, Y_train, 0.1)

提升X的維度。
X_train = X_train[:,np.newaxis]

X_val = X_val[:,np.newaxis]

建立model用的函數,我們疊了四層LSTM,損失函數為mse,優化器為adam。
註:這些並沒有標準答案,可以自己配置。
def buildOneToOneModel(shape):
  model = Sequential()
  model.add(LSTM(128input_length=shape[1], input_dim=shape[2],return_sequences=True))
  model.add(LSTM(128input_length=shape[1], input_dim=shape[2],return_sequences=True))
  model.add(LSTM(128input_length=shape[1], input_dim=shape[2],return_sequences=True))
  model.add(LSTM(128input_length=shape[1], input_dim=shape[2],return_sequences=True))
  model.add(TimeDistributed(Dense(1)))
  model.compile(loss='mse'optimizer="adam")
  model.summary()
  return model

定義繪製圖形函數,在訓練完後可以輸出訓練過程。
def plot1(history):
     N = np.arange(0len(history['loss']))
     fig=plt.figure()
     fig.set_size_inches(18.510.5)
     plt.plot(N, history['loss'], label = "train_loss")
     plt.plot(N, history['val_loss'], label = "val_loss")
     plt.xlabel("Epoch #")
     plt.ylabel("Loss")
     plt.legend()
     plt.savefig('loss.png'dpi=100)
     plt.close()

建立模型
model = buildOneToOneModel(X_train.shape)

我們使用,EarlyStopping做訓練時的callback,當發生訓練時loss不減反增10次時立即停止訓練。
callback = EarlyStopping(monitor="loss"patience=10verbose=1mode="auto")

這是執行訓練,放入X_train, Y_train分別為訓練的90%資料,validation_data是驗證的資料(10%),epochs為訓練次數,batch_size為每批次訓練的樣本數,callbacks為剛剛指定的EarlyStopping。
history=model.fit(X_train, Y_train, epochs=300batch_size=256validation_data=(X_val, Y_val), callbacks=[callback])

訓練完後將執行這行,輸出訓練過程。
plot1(history.history)

接著讀取訓練前建立的資料檔案,它是正規化之前的最大值、最小值、平均值。
valueList= pd.read_csv('./ValueList.csv')

這是訓練完後對那10%的驗證進行的準確度評估,步驟是預測X_val的結果並儲入prediction並將其反正規化。
然後用迴圈一條一條確認真實結果跟預測的差別,在此範例,誤差半天的range就是24小時,所以以誤差半天作為驗證標準是合理的。
prediction=model.predict(X_val)
count=0
prediction1=prediction
for i in range(prediction1.shape[0]):
    prediction1[i]=unnormalize(prediction[i])
Y_val1=unnormalize(Y_val)
for i in range(len(Y_val)):
    if prediction1[i][0][0]<=Y_val1[i]+0.5 and prediction1[i][0][0]>=Y_val1[i]-0.5:
        count=count+1
print(count/len(Y_val1))  

驗證完後如果評估訓練結果成功,可以將結果儲存。
model.save("LSTM_result.h5")

以後要二次訓練或驗證時,只要將程式碼中的:
model = buildOneToOneModel(X_train.shape)
取代為:
model=load_model("LSTM_result.h5")
即可接續上次的模型繼續訓練或驗證。

=====執行結果=====
執行model.fit時應該會出現類似以下的畫面:

Model: "sequential"
_________________________________________________________________
Layer (type)                 Output Shape              Param #   
=================================================================
lstm (LSTM)                  (None, 1, 128)            92160     
_________________________________________________________________
lstm_1 (LSTM)                (None, 1, 128)            131584    
_________________________________________________________________
lstm_2 (LSTM)                (None, 1, 128)            131584    
_________________________________________________________________
lstm_3 (LSTM)                (None, 1, 128)            131584    
_________________________________________________________________
time_distributed (TimeDistri (None, 1, 1)              129       
=================================================================
Total params: 487,041
Trainable params: 487,041
Non-trainable params: 0
_________________________________________________________________
Train on 119836 samples, validate on 13315 samples
Epoch 1/300
119836/119836 [==============================] - 14s 113us/sample - loss: 0.0385 - val_loss: 0.0258
Epoch 2/300
119836/119836 [==============================] - 7s 58us/sample - loss: 0.0215 - val_loss: 0.0206
Epoch 3/300
119836/119836 [==============================] - 7s 56us/sample - loss: 0.0150 - val_loss: 0.0122
Epoch 4/300
119836/119836 [==============================] - 7s 58us/sample - loss: 0.0117 - val_loss: 0.0107
.
.
.
Epoch 185/300
119836/119836 [==============================] - 7s 55us/sample - loss: 1.9707e-05 - val_loss: 4.0432e-05
Epoch 186/300
119836/119836 [==============================] - 7s 55us/sample - loss: 1.9298e-05 - val_loss: 3.8655e-05
Epoch 187/300
119836/119836 [==============================] - 7s 55us/sample - loss: 9.7278e-05 - val_loss: 6.1180e-05
Epoch 00187: early stopping

訓練過程則會儲存成loss.png檔,可以看出沒有明顯的過擬合。

驗證時則會出現類似以下數字:
0.9960946301164101
這個數字代表準確度99.6%,但,我們還有一份切割20%的驗證檔,利用它評估比較準確,將於下一章節驗證。

另外,神經網路這種東西本來就有運氣成分在,所以執行結果跟本文的結果有微小的誤差是正常的。

[tf.keras]利用LSTM預測泵傳感器剩餘壽命(四)—驗證

[tf.keras]利用LSTM預測泵傳感器剩餘壽命(二)—數據預處理


在上一章節,提供了數據的csv檔,在開始之前,請將數據檔案下載進電腦裡(此章節將用Excel做第一步的預處理)

https://www.kaggle.com/nphantawee/pump-sensor-data

下載完並解壓縮後會得到一個sensor.csv檔案,我們利用Excel開啟它。
從欄位中可以看到序號、日期時間、52項數據資料以及機器狀態。
其中,機器的狀態包含:broken(故障):7個、recovering(修復中)14477個、normal(正常狀態)220320個



我們按下,排序與篩選/篩選,然後對machine_status欄位按下篩選箭頭,勾銷NORMAL和RECOVERING後,就只剩下機器故障時的資料了。

接著我們在[timestamp]右邊插入剩餘時間欄位[time_left],格是選擇數值,目前可以看到最左邊的機器狀態為broken,所以我們把那7筆資料的剩餘時間填滿0。
請記得左側的藍色數字(最左側的編號),等一下會用到。

處理完之後解除篩選功能。
我們於C2的地方輸入公式:
=($B$17157-B2)*60*24
B12157是剛剛記下的藍色數字的第一個,減掉B2後代表機器第一次壞掉前的剩餘時間,60跟24則是讓它以分鐘為單位(本來是以天為單位)。
然後設定格是為數值。

沒意外的話得到的結果為17155,接著向下填滿,它並不會直接填滿到最底下,而是在剛剛輸入了0的地方被擋住,我們可以看到數字結果剛好符合。
如果0的上方不是1而是別的數字,則須考慮是否有操作錯誤(如果上方數字是三,則有可能是你將第A列的序號誤看成最左側的編號了)。
另外,機器狀態為RECOVERING的資料適不適用此計算方式尚未能完全確認(可以考慮刪除RECOVERING的資料)。

接著我們重複剛剛的動作,將第二次故障的時間減去現在的時間。

然後依此類推,總共做七次。



做完後可以先儲存成xlsx檔做備份,因為等一下要拆成兩份csv資料檔。

由於24512之後的資料並沒有損壞數據,故無法得知時間序列,將其刪除。

此時只剩下166442筆資料(含欄位名稱)。

接著複製[time_left]整個欄位並原地貼上為"值"。

貼上後可按圖中所框選的按鈕兩次,可以縮短為整數。


接著我們要打散資料,再最尾端增加[random]欄位,公式輸入:
=RAND()
並向下填滿

接著對[random]選擇從小到大排序,資料就隨機打散了。
然後記得,排序完[random]欄位要刪除。

訓練檔跟驗證檔比例我們分為8:2,由於現在資料總共是166442-1筆,故我們到166442*0.8=133152筆資料的地方停下,按ctrl+shift+↑可以選取上方所有資料。

然後按右鍵/刪除,然後將資料另存新檔成驗證檔test_sensor.csv(此時資料包含欄位大約33291筆)。

另存完後按ctrl+z回到刪除前,按下第133152筆資料,然後按ctrl+shift+↓可以選取下方所有資料。


然後按右鍵/刪除,然後將資料另存新檔成訓練檔train_sensor.csv(此時資料包含欄位大約133152筆)。

資料預處理完畢,下一章節將正式打code了。

[tf.keras]利用LSTM預測泵傳感器剩餘壽命(三)—訓練

[tf.keras]利用LSTM預測泵傳感器剩餘壽命(一)—簡介

本系列文章使用的數據為Kaggle的一項競賽[Pump sensor data for predictive maintenance](泵傳感器數據可進行預測性維護)所提供的資料
https://www.kaggle.com/nphantawee/pump-sensor-data

在此系列文章,我們將利用長短期記憶(Long Short-Term Memory,LSTM)預測機器還剩餘幾天會故障,使用的Library及API為tensorflow.keras。

LSTM簡介:
LSTM的中文名稱是長短期記憶,它可以記憶不定時間長度的數值,適合於處理和預測時間序列中間隔和延遲非常長的事件 [1]。
目前的應用包括:
  • 時間序列
  • 機器控制
  • 語音識別
  • 自然語言處理
  • 手寫識別
  • 自動駕駛汽車
  • 動畫


數據簡介:
數據的提供者在一個小組中工作,該小組需維護距離城鎮非常遙遠的小區域的水泵,去年有7個系統故障。這些故障給許多家庭面臨嚴重的生活問題。當系統出現故障時,團隊無法看到數據中的任何規律,因此他們也不確定應該特別注意哪些地方。
數據中大約有55個欄位,包含序號、時間、52個機器數據以及機器的狀態。
其中,機器的狀態包含:
  • broken(故障):7個
  • recovering(修復中)14477個
  • normal(正常狀態)220320個

在下一章節,我們將整理這些數據,做更詳細的說明。

[tf.keras]利用LSTM預測泵傳感器剩餘壽命(二)—數據預處理


參考文獻:
[1] 長短期記憶
https://zh.wikipedia.org/wiki/%E9%95%B7%E7%9F%AD%E6%9C%9F%E8%A8%98%E6%86%B6