Scraps 最終更新 2026/10/01 18:50

#データ分析

@Tim De Chant /

ビル・ゲイツのブレイクスルー・エナジーが21のスタートアップを支援、エネルギーの未来を形作る

  • ブレイクスルー・エナジーが21のスタートアップを支援し、エネルギーの未来を形作ると発表
  • プロトンボーラン燃料を使った核融合や半導体効率向上、水素輸送のアンモニア利用が含まれる
  • エネルギー需要の増加に対応するための技術開発が進んでおり、インフラ整備が課題となる

@Zack Whittaker /

ハッカーがフロリダ州の自動車データベースをハッキングし、数十万件のデータを漏洩

  • フロリダ州の自動車関連データベースがハッキングされ、数十万件のデータが漏洩した
  • DAVIDデータベースの侵入と、車両所有権証明書、住所、車両識別番号、社会保障番号などの情報が含まれた
  • 個人情報保護の重要性と、セキュリティ対策の見直しが求められる

@riona /

2026年8月21日開催|DataOps Night #11 〜金融データ基盤と、現場を支えるデータエンジニアリング〜

  • 金融データ基盤でSnowflakeをセキュアに活用するための実践的な取り組みが紹介された
  • セマンティックレイヤーの自動構築、3つの防衛境界、コンテキスト自動更新ループ、段階的解放、マルチパーティ承認
  • データ機密度に応じたレベル設計で機能の段階的解放を実現し、セキュリティと利便性のバランスを取る

@nolanlover0527 /

Claudeに920万件規模のニュース記事を解析させた事例が話題に【大規模データ分析】

  • 920万件のニュースデータをClaudeで分析する際、生データではなく集計データを渡す設計が採用された
  • 集計データと代表的なサンプルデータを渡し、クラスタ数・ストーリー数・スコア分布などの数値をもとに分析を行った
  • LLMに処理を任せるのは傾向解釈や仮説提示に限定し、前処理は従来型パイプラインで行う設計が効果的

@Tim De Chant /

米国データセンターが2035年までにドイツと日本の合計より多くの自然ガスを消費する見込み

  • 米国データセンターが2035年までにドイツと日本の合計より多くの自然ガスを消費する見込み
  • データセンターの電源確保に自然ガスが使われ、LNG輸出と併せて需要が急増、1日当たり180億立方フィートに
  • 自然ガス価格の上昇と電力料金への影響、気候変動への貢献が懸念される

@キエットくん /

Co-purchaseからPersonalized Recommendationまで — 商品レコメンドの仕組みをシンプルに理解する

  • 商品レコメンドはCo-purchase、Product理解、User理解の3ステップで構築される
  • Co-purchaseではP(B|A)とLiftで関連性を測定、Productベクトルで特徴を数値化、Userベクトルで好みを表現
  • Liftで人気商品の影響を調整し、コサイン類似度で商品の類似度を計算する際の注意点を説明

@本間宏紀@理論を重んじるデータサイエンティスト /

P値は帰無仮説が誤っている確率ではない

  • P値は帰無仮説が誤っている確率を測らない
  • P値は帰無仮説が正しいとき一様に分布し、事前確率と対立仮説の設定によって事後確率が大きく変わる
  • P値が0.05でも帰無仮説が正しい確率は29%以上あり、効果量や標本サイズに注意が必要

@Vishal Batchu /

宇宙からメタン排出源をマッピングする新しい深層学習モデルが公開される

  • Googleがメタン排出源を宇宙からマッピングする深層学習モデルを公開した
  • MAPL-EMITは360万件のシミュレーションデータで訓練され、人間より50%多くの排出源を検出できる
  • 公開されたデータベースとツールは研究者や政策決定者に利用可能で、気候対策の効率化に寄与する

@Yuta NAKATA /

エンジニアサマーインターンシップ2026を開催しました

  • ウェザーニュースが2028年卒向けにエンジニアサマーインターンシップを開催し、気象データと生成AIを活用したAIエージェント開発を実施した
  • WxTech APIとMCPサーバーを活用した気象データ取得、Claude CodeとGeminiを前提とした開発、LangGraphとVue3を用いたエージェント構築
  • 生成AIの活用はコード作成速度より「作りたいものを言語化する力」が重要とし、データ利用時のルール確認が必須であることが強調された

@aokikenichi /

生成AIで分析できる時代。それでも読むべき機械学習・データ分析70冊【2026年版】

  • 生成AI時代に必要な機械学習・データ分析の70冊が選定された
  • ビジネス課題定義・結果説明、入門・アラカルト的な本、手法の本質的理解が重視される
  • 生成AIで代替できる実践方法は減り、結果の解釈やビジネス文脈への翻訳が重要になる

@taki_tech /

なぜPythonは選ばれ続けるのか——歴史・強み・10の活用分野から考える

  • Pythonが選ばれ続ける理由は、豊富なライブラリと情報の蓄積にある
  • 部品(ライブラリ)の層が厚く、情報が見つかりやすい。pandasやscikit-learn、OpenCVなどの具体例が挙げられている
  • 実行速度やモバイルアプリ開発では他の言語に優位性があるため、開発の速さと部品の豊富さが効く領域で使うのが適切