TensorFlow dataset.shuffle、batch、repeatの使用詳細


コードの例を直接見て、詳しい注釈があります。

import tensorflow as tf
import numpy as np


d = np.arange(0,60).reshape([6, 10])

#  array   tensor
data = tf.data.Dataset.from_tensor_slices(d)

#  data         buffer_size     buffer ,    buffer    
# buffer       buffer_size,   data          buffer_size,
#        
data = data.shuffle(buffer_size=3)

#    buffer   4   
data = data.batch(4)

#  data     ,    2 epoch   
data = data.repeat(2)

#           
iters = data.make_one_shot_iterator()

#              
batch = iters.get_next()

sess = tf.Session()

sess.run(batch)
#           ,         :OutOfRangeError

In [21]: d
Out[21]: 
array([[ 0, 1, 2, 3, 4, 5, 6, 7, 8, 9],
  [10, 11, 12, 13, 14, 15, 16, 17, 18, 19],
  [20, 21, 22, 23, 24, 25, 26, 27, 28, 29],
  [30, 31, 32, 33, 34, 35, 36, 37, 38, 39],
  [40, 41, 42, 43, 44, 45, 46, 47, 48, 49],
  [50, 51, 52, 53, 54, 55, 56, 57, 58, 59]])
In [22]: sess.run(batch)
Out[22]: 
array([[ 0, 1, 2, 3, 4, 5, 6, 7, 8, 9],
  [30, 31, 32, 33, 34, 35, 36, 37, 38, 39],
  [20, 21, 22, 23, 24, 25, 26, 27, 28, 29],
  [10, 11, 12, 13, 14, 15, 16, 17, 18, 19]])

In [23]: sess.run(batch)
Out[23]: 
array([[40, 41, 42, 43, 44, 45, 46, 47, 48, 49],
  [50, 51, 52, 53, 54, 55, 56, 57, 58, 59]])
出力結果から:
shuffleはデータを順番にブザーに入れます。
repeat関数がshuffleの後にある場合は、一つのepochのデータセットを抽出して次のepochを行います。
では、repeat関数はshuffleの前にはどうなりますか?以下のとおりです

data = data.repeat(2)

data = data.shuffle(buffer_size=3)

data = data.batch(4)

In [25]: sess.run(batch)
Out[25]: 
array([[10, 11, 12, 13, 14, 15, 16, 17, 18, 19],
  [20, 21, 22, 23, 24, 25, 26, 27, 28, 29],
  [ 0, 1, 2, 3, 4, 5, 6, 7, 8, 9],
  [40, 41, 42, 43, 44, 45, 46, 47, 48, 49]])

In [26]: sess.run(batch)
Out[26]: 
array([[50, 51, 52, 53, 54, 55, 56, 57, 58, 59],
  [ 0, 1, 2, 3, 4, 5, 6, 7, 8, 9],
  [30, 31, 32, 33, 34, 35, 36, 37, 38, 39],
  [30, 31, 32, 33, 34, 35, 36, 37, 38, 39]])

In [27]: sess.run(batch)
Out[27]: 
array([[10, 11, 12, 13, 14, 15, 16, 17, 18, 19],
  [50, 51, 52, 53, 54, 55, 56, 57, 58, 59],
  [20, 21, 22, 23, 24, 25, 26, 27, 28, 29],
  [40, 41, 42, 43, 44, 45, 46, 47, 48, 49]])
データセットをコピーして、二つのepochを同じ新しいデータセットとしてshuffleとbatchを続けていることが分かります。
以上のTensorFlow dataset.shuffle、batch、repeatの使用詳細は小編が皆さんに共有された内容の全部です。参考にしていただければと思います。皆さん、よろしくお願いします。