HIVE実戦:公式ケーストレーニング

1279 ワード

テストファイルのダウンロード
このケースはhive公式ドキュメントから
需要:1部の映画を観覧するログ(u.data)に関して、10 W条のデータがあって、分析して1週間の内にその日の映画の人数が多いことを出します
1、元のテーブルを作成する
CREATE TABLE u_data (
  userid INT,
  movieid INT,
  rating INT,
  unixtime STRING)
ROW FORMAT DELIMITED
FIELDS TERMINATED BY '\t'
STORED AS TEXTFILE;

LOAD DATA LOCAL INPATH '/usr/datas/u.data' into table u_data;
、新しいテーブルの作成
CREATE TABLE u_data_new (
  userid INT,
  movieid INT,
  rating INT,
  weekday INT)
ROW FORMAT DELIMITED
FIELDS TERMINATED BY '\t';
3、pythonスクリプトを作成してunixtimeを曜日に変換する
import sys
import datetime

for line in sys.stdin:
  line = line.strip()
  userid, movieid, rating, unixtime = line.split('\t')
  weekday = datetime.datetime.fromtimestamp(float(unixtime)).isoweekday()
  print '\t'.join([userid, movieid, rating, str(weekday)])
、スクリプトを使用して新しいテーブルにデータを挿入
add FILE /usr/datas/weekday_mapper.py;

INSERT OVERWRITE TABLE u_data_new
SELECT
  TRANSFORM (userid, movieid, rating, unixtime)
  USING 'python weekday_mapper.py'
  AS (userid, movieid, rating, weekday)
FROM u_data;
、照会
SELECT weekday, COUNT(1) count
FROM u_data_new
GROUP BY weekday order by count desc;