【BigQuery】クエリの単体テストを書こうと思ったけど壁が厚くてどうしようか悩んでいる話

こんにちは。久しぶりのブログ投稿になってしまったのですが、今日は「クエリの単体テストを書こうと思ったけど、壁が厚くてどうしようかなと思った話」を書きたいと思います。はじめに言っておきますが、この記事は特に何か解決策があるわけでもなんでもな…

2021-06-23

【Airflow】KubernetesPodOperatorにdag_run.confを渡したい

Data Engineer Docker GCP airflow

こんにちは。今日は、airflowと戯れていたら、なんかバグを踏んだか何かをしたので、それについて書きたいと思います。やりたいこと KubernetesPodOperatorにdag_run.confをenv_varsのパラメーター経由で渡して、そのenv_varsに、実行日を渡して、どの日の…

2021-01-14

【Pandas】週の曜日の始まりが違う場合の週ごとの日付を取得する方法があったのでまとめる

Python Data Engineer

こんにちは。モチベーション今開発で、週の曜日の始まりが違うケースがあって、でも一年間の週の通し番号ごとに集計をしたい、みたいな感じのことがしたく、週の曜日始まりが違う曜日のスタートで、週ごとの日付を取得したいなという気持ちがありました。p…

#Python #pandas #データ分析 #データサイエンス #データエンジニア

2021-01-11

【Python】Pandasでcross joinをする方法

Python

こんにちは。今日は、pandasでcross joinをする方法について書きたいと思います*1。やりたいこと df_a, df_bの二つのデータフレームがあったとして、その二つのデータフレームをcross joinしたいなという気持ちになったとします。ただ、Pandasにはこれをそ…

2021-01-08

自然言語処理向けのデータ作成ツールの「doccano」を使ってみたので、まとめる

AI Data Engineer Data Science Python 自然言語処理

こんにちは。最近、仕事で自然言語処理関係のプロジェクトをやっているのですが、その関係でdoccanoというツールを触ってみることになったので、使い方とかをまとめておきます。 doccanoとは doccanoとは、オープンソースのテキストアノテーションツールです…

#自然言語処理 #アノテーション #Python #Python #NLP

2021-01-02

【kedro】gcsのファイルを読み込むときのcredentialsの設定方法

Data Engineer Python

こんにちは。kedroのドキュメントにもし書いてあったらすみませんなのですが、地味にハマったので、備忘録的に書いておきます。やりたいこと gcsにあるデータを読み込んで、それを処理のなかで使いたいです。設定方法 credentials系の情報は、 conf/local/…

2020-11-27

【 Kedro】Kedroに入門したのでまとめる

AI Data Engineer Data Science Machine Learning Python

こんにちは。最近、Kedroと言う機械学習向けのパイプライン構築用のツールを使ってみたので、それについてまとめます。 Kedroとは？概要 Kedro は QuantumBlack というデータ分析企業が公開している、プロダクションレディなデータ分析用ワークフロー構築…

2020-11-16

【AWS】AWS Data PipelineのstartDateTimeの指定で盛大にハマった話

AWS Data Engineer

こんにちは。今日は、AWS Data Pipelineを使っていてstartDateTimeの指定で盛大にハマったので、その話を書きます。そもそもAWS Data Pipelineって何？って方は、以下の記事をどうぞ。まぁ、この記事読んでいる人はこれについては知っているだろうけど。ww…

2020-11-04

【GCP】Serverless frameworkを使ってCloud Functionを作る

GCP

こんにちは。最近、Serverless Frameworkを使ってCloud functionを作る機会があったので、そちらについてまとめておきます。 Serverless Frameworkとは ServerlessアプリケーションであるLambdaやCloud Functionを構成管理したりデプロイしたり、ローカルで…

2020-08-06

【AWS】AWS Data Pipelineでプライベートサブネット内にあるDB(RDS)を操作するのに盛大にハマったのでまとめる

AWS Data Engineer

こんにちは。今日は、Data Pipelineでプライベートサブネット内にあるDBを操作する場合の対処方法についてはまったので、書いてみたいと思います。 AWS Data Pipelineとは AWS Data Pipelineについては、以前記事にしているので、以下の記事をご覧ください*1…

2020-08-06

【AWS】AWS Data Pipeline入門

AWS Data Engineer terraform

こんにちは。最近仕事でAWS Data Pipelineを使う機会があったので、その機能についてまとめます。 AWS Data Pipelineとは AWS Data Pipelineとは、一言で言うとAWSが提供するAirflow、みたいな感じになると思います。aws.amazon.comAWSのS3やDynamoDB、Redsh…