<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">

  <channel>
    <title>オライリー on @johtaniの日記 3rd</title>
    <link>https://blog.johtani.info/tags/%E3%82%AA%E3%83%A9%E3%82%A4%E3%83%AA%E3%83%BC/</link>
    <description>Recent content in オライリー on @johtaniの日記 3rd</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>ja</language>
    <lastBuildDate>Fri, 09 May 2014 00:45:00 +0900</lastBuildDate><atom:link href="https://blog.johtani.info/tags/%E3%82%AA%E3%83%A9%E3%82%A4%E3%83%AA%E3%83%BC/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>アジャイルデータサイエンスが届きました</title>
      <link>https://blog.johtani.info/blog/2014/05/09/reading-agile-data-science/</link>
      <pubDate>Fri, 09 May 2014 00:45:00 +0900</pubDate>
      
      <guid>https://blog.johtani.info/blog/2014/05/09/reading-agile-data-science/</guid>
      <description>&lt;p&gt;「アジャイルデータサイエンス」の見本をいただいてしまいました。&lt;/p&gt;
&lt;iframe src=&#34;http://rcm-fe.amazon-adsystem.com/e/cm?t=johtani-22&amp;o=9&amp;p=8&amp;l=as1&amp;asins=4873116716&amp;nou=1&amp;ref=qf_sp_asin_til&amp;fc1=000000&amp;IS2=1&amp;lt1=_blank&amp;m=amazon&amp;lc1=0000FF&amp;bc1=000000&amp;bg1=FFFFFF&amp;f=ifr&#34; style=&#34;width:120px;height:240px;&#34; scrolling=&#34;no&#34; marginwidth=&#34;0&#34; marginheight=&#34;0&#34; frameborder=&#34;0&#34;&gt;&lt;/iframe&gt;
&lt;p&gt;なので、感想文でも書いてみようかと。&lt;/p&gt;
&lt;!-- more --&gt;
&lt;h2 id=&#34;どんな本&#34;&gt;どんな本？&lt;/h2&gt;
&lt;p&gt;想像以上に薄かったです、物理的に。
なのに、とても幅広い範囲をカバーしています。&lt;/p&gt;</description>
      <content:encoded>&lt;p&gt;「アジャイルデータサイエンス」の見本をいただいてしまいました。&lt;/p&gt;
&lt;iframe src=&#34;http://rcm-fe.amazon-adsystem.com/e/cm?t=johtani-22&amp;o=9&amp;p=8&amp;l=as1&amp;asins=4873116716&amp;nou=1&amp;ref=qf_sp_asin_til&amp;fc1=000000&amp;IS2=1&amp;lt1=_blank&amp;m=amazon&amp;lc1=0000FF&amp;bc1=000000&amp;bg1=FFFFFF&amp;f=ifr&#34; style=&#34;width:120px;height:240px;&#34; scrolling=&#34;no&#34; marginwidth=&#34;0&#34; marginheight=&#34;0&#34; frameborder=&#34;0&#34;&gt;&lt;/iframe&gt;
&lt;p&gt;なので、感想文でも書いてみようかと。&lt;/p&gt;
&lt;!-- more --&gt;
&lt;h2 id=&#34;どんな本&#34;&gt;どんな本？&lt;/h2&gt;
&lt;p&gt;想像以上に薄かったです、物理的に。
なのに、とても幅広い範囲をカバーしています。&lt;/p&gt;
&lt;p&gt;データの分析にどんな人が関わっているのか、アジャイルにデータを分析する目的から始まり、
データから何かを見つけるための手順、考え方などをさらっとですが、
システムに取り込む流れから取り込んだあとに改良するという流れまで紹介してくれます。
流れはこんな感じ。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;イベント：ログとかのイベントの発生&lt;/li&gt;
&lt;li&gt;コレクタ：イベントの収集&lt;/li&gt;
&lt;li&gt;バルクストレージ：イベントの一時保存&lt;/li&gt;
&lt;li&gt;バッチ処理：ストレージにあるデータに対して処理&lt;/li&gt;
&lt;li&gt;分散ストア：処理結果をWebアプリなどで表示するために保存&lt;/li&gt;
&lt;li&gt;Webアプリ：処理結果をユーザに提供&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Webアプリでデータを見えるようにして、そこから更にフィードバックを受けることで、データの分析などを進めていくという流れです。&lt;/p&gt;
&lt;p&gt;私はデータサイエンス系の人ではないのでこの流れで作業をされているかはわからないのですが、
検索のシステムについてもこの流れに似ているなと感じました。&lt;/p&gt;
&lt;p&gt;検索システムでも、検索したいデータを収集して、加工（検索したい項目の洗い出しやファセットにする項目の選定とか）して、
インデックスを生成するといった処理が必要になるからです。&lt;/p&gt;
&lt;p&gt;この本では、Python、Hadoop（Pig）、MongoDB、ElasticSearch（バージョンが0.90だから）、d3.jsなどが出てきます。
また、日本語版の付録では、Fluentd、Kibana+Elasticsearchといった組み合わせの紹介もあります。&lt;/p&gt;
&lt;p&gt;コードも書かれていますが、すみません、そこまでちゃんと読んでません。。。&lt;/p&gt;
&lt;p&gt;後半では、データを活用して行くためには順序があるという話が書かれています。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;レコード：レコード1件のアトミックな処理と表示&lt;/li&gt;
&lt;li&gt;グラフ：レコードを元に集計したりグラフ作ったり&lt;/li&gt;
&lt;li&gt;レポート：関係性やトレンドを抽出し、インタラクティブに探求&lt;/li&gt;
&lt;li&gt;予測：構造を利用して、推論やレコメンドとか&lt;/li&gt;
&lt;li&gt;行動：上記の結果を元にユーザに行動を促す&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;前のステップがおろそかだと次のステップがうまくいかないという話です。
後半はこの流れに沿って、先ほどのシステムの流れを変更していく方法が展開されます。&lt;/p&gt;
&lt;h2 id=&#34;注意点&#34;&gt;注意点&lt;/h2&gt;
&lt;p&gt;ちょっとだけ気になる点があったので。&lt;/p&gt;
&lt;p&gt;Elasticsearch周りについては少し注意が必要かと。（Pigとかは詳しくないので不明です。）
紹介されているElasticsearchのバージョンが0.90と少し古いのと、
Hadoopとの統合（Pigで処理したデータをElasticsearchに出力）に利用されているWondordogというツールも最近更新がされていないみたいです。
おそらく、1.0系では動かないのではないかと。&lt;/p&gt;
&lt;p&gt;1.0系の場合は、Elasticsearchが提供している&lt;a href=&#34;http://www.elasticsearch.org/overview/hadoop&#34;&gt;elasticsearch-hadoop&lt;/a&gt;を利用するのが良いと思います。&lt;/p&gt;
&lt;p&gt;付録については1.0系で記載されているので問題ないかと。ただし、Elasticsearchは更新が早いので、公式サイトで最新情報を入手するのが良いと思います。&lt;/p&gt;
&lt;h2 id=&#34;感想&#34;&gt;感想&lt;/h2&gt;
&lt;p&gt;データを解析するシステムってどんなことやってるの？という全体像を
俯瞰するのに良い本なのではないかと思います。
また、データの解析を活かすために、必要な順序と疎かにできない点もあって面白かったです。&lt;/p&gt;
&lt;p&gt;紹介されているツール類については、OSSのトレンドや開発速度が早いので、参考程度にとどめておいて、
自分たちで使いやすいものを探してきて検討するのがいいと思います。&lt;/p&gt;
&lt;p&gt;付録がとても豪華です。FluentdやKibanaがわかりやすく解説されてます。&lt;/p&gt;
&lt;p&gt;あと、薄いのでさらっと読めます。ｗ&lt;/p&gt;
</content:encoded>
    </item>
    
    <item>
      <title>『プログラミング Hive』 『Hadoop 第3版』刊行記念セミナーに参加しました！ #oreilly0724</title>
      <link>https://blog.johtani.info/blog/2013/07/25/hadoop-hive-publication-party/</link>
      <pubDate>Thu, 25 Jul 2013 02:11:00 +0900</pubDate>
      
      <guid>https://blog.johtani.info/blog/2013/07/25/hadoop-hive-publication-party/</guid>
      <description>&lt;p&gt;Hadoopとか離れちゃってるし、Hive触ったこと無いにもかかわらず参加しました！&lt;br&gt;
（たまたま近くにいるからって理由なのは内緒で）&lt;br&gt;
玉川さんの四方山話を聞くのが主目的で参加しました。（ちょっと翻訳が気になってるので）&lt;/p&gt;</description>
      <content:encoded>&lt;p&gt;Hadoopとか離れちゃってるし、Hive触ったこと無いにもかかわらず参加しました！&lt;br&gt;
（たまたま近くにいるからって理由なのは内緒で）&lt;br&gt;
玉川さんの四方山話を聞くのが主目的で参加しました。（ちょっと翻訳が気になってるので）&lt;/p&gt;
&lt;p&gt;イベントページは&lt;a href=&#34;http://connpass.com/event/2944/&#34;&gt;こちら&lt;/a&gt;&lt;br&gt;
刊行記念イベントにも関わらず、想像以上の人の入りでびっくりしました。Hadoop、Hive界隈はまだまだ人気なんだなぁと。&lt;br&gt;
プレゼントじゃんけん大会もあったのですが、早々に負けてしまったのが悔やまれます。。。
Team Geek欲しかったなぁ。もちろん、懇親会まで参加しました。&lt;/p&gt;
&lt;p&gt;以下、いつものメモです。&lt;/p&gt;
&lt;!--  more --&gt;
&lt;h2 id=&#34;hiveの正しい使い方cloudera-嶋内さん&#34;&gt;Hiveの正しい使い方（Cloudera 嶋内さん）&lt;/h2&gt;
&lt;p&gt;残念ながら、マサカリは持ってなかったです。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;スライドの各所に本の章番号が書いてあるのがうれしい。&lt;/li&gt;
&lt;li&gt;Hiveロゴが回ってたのでスライドの時に集中できなかったｗ&lt;/li&gt;
&lt;li&gt;Impalaの話も出てきた。
&lt;ul&gt;
&lt;li&gt;速いけど、色々足りない。Hiveの置き換えじゃないよと。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;hiveとimpalaのおいしいとこ取りセラン須田さん&#34;&gt;HiveとImpalaのおいしいとこ取り（セラン　須田さん）&lt;/h2&gt;
&lt;p&gt;スライド：&lt;a href=&#34;http://www.slideshare.net/sudabon/20130724-oreilly-org&#34;&gt;http://www.slideshare.net/sudabon/20130724-oreilly-org&lt;/a&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;オンプレだとCDH便利だよと教えてもらう&lt;/li&gt;
&lt;li&gt;いくつかSlideshareにImpalaの性能評価の資料を上げてある（必要になったら検索で。。。）&lt;/li&gt;
&lt;li&gt;リリースされたその日に性能評価やってレポート書くとかすごすぎ！&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;翻訳の四方山話玉川さん&#34;&gt;翻訳の四方山話（玉川さん）&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;翻訳＝写経です&lt;/li&gt;
&lt;li&gt;締め切り駆動勉強法ｗ&lt;/li&gt;
&lt;li&gt;4page/day&lt;/li&gt;
&lt;li&gt;自分から電突してオライリーさんに翻訳させてくださいと。&lt;/li&gt;
&lt;li&gt;他の方の本が読めない（チェックしちゃうのでｗ）&lt;/li&gt;
&lt;li&gt;動機があるから読めるってのはあるだろうなぁ。&lt;/li&gt;
&lt;li&gt;選び方：わくわくするもの、仕事に活きるもの&lt;/li&gt;
&lt;li&gt;今年もあと2冊やる予定（Hadoop Operations、Vagrantを翻訳中）&lt;/li&gt;
&lt;li&gt;来年の候補（Chefとか）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;高可用性hdfsのご紹介cloudera-小林さん&#34;&gt;高可用性HDFSのご紹介（Cloudera 小林さん）&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;スライドにどの版で書いてあったかがわかりやすく書いてある。&lt;/li&gt;
&lt;li&gt;3段階の開発フェーズを経てる&lt;/li&gt;
&lt;li&gt;QJMのお話&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;cloudera-universityとhadoop認定試験cloudera-川崎さん&#34;&gt;Cloudera UniversityとHadoop認定試験（Cloudera 川崎さん）&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Clouderaデータアナリスト向けトレーニング（3日間、10月日本語で開催予定）
&lt;ul&gt;
&lt;li&gt;Hive、Pig、Impalaなど&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Data Science入門コースも準備中&lt;/li&gt;
&lt;li&gt;出版記念！
&lt;ul&gt;
&lt;li&gt;8月管理者向け先着20 or 30名にHadoop第3版贈呈予定&lt;/li&gt;
&lt;li&gt;先着20名にプログラミングHive贈呈予定&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
</content:encoded>
    </item>
    
  </channel>
</rss>
