cloud.google.com 2日前

ゼロコード、低コストのデータの取り込み: BigQuery DTS の新機能

BigQuery Data Transfer Service(DTS)の新機能まとめ。Apache Iceberg マネージドテーブルへの直接取り込みやリモートMCPサーバー対応に加え、SQL Server・PostgreSQL・MySQLなどのDB系、Shopify・Klaviyo・HubSpot・Mailchimpなどのマーケティング系コネクタ、Snowflakeからの移行コネクタが追加された。Googleソースの取り込みは無料、サードパーティSaaSも従量課金で低コスト、Cloud IAMとのネイティブ統合や99.99%以上の稼働率を強みとして訴求している。

BigQuery Data Transfer Service(DTS)の新機能まとめ。Apache Iceberg マネージドテーブルへの直接取り込みやリモートMCPサーバー対応に加え、SQL Server・PostgreSQL・MySQLなどのDB系、Shopify・Klaviyo・HubSpot・Mailchimpなどのマーケティング系コネクタ、Snowflakeからの移行コネクタが追加された。Googleソースの取り込みは無料、サードパーティSaaSも従量課金で低コスト、Cloud IAMとのネイティブ統合や99.99%以上の稼働率を強みとして訴求している。
↗ 元記事を開く
www.infoq.com 4日前

Article: Beyond Offset Lag: Computing Time in Queue for Apache Hudi Data Lake Pipelines at Petabyte Scale

Twilioがデータレイクパイプライン(Apache Hudi Delta Streamer)の鮮度監視で、Kafkaのオフセット遅延ではなく実時間の遅延を計測する手法を解説。HudiのコミットファイルからKafkaチェックポイントを読み取り、該当オフセットにシークして未処理メッセージのタイムスタンプと現在時刻の差分を計算する。チェックポイント欠落時の遡り探索やepochタイムスタンプの罠など、実運用で遭遇したエッジケースへの対処も紹介している。

Twilioがデータレイクパイプライン(Apache Hudi Delta Streamer)の鮮度監視で、Kafkaのオフセット遅延ではなく実時間の遅延を計測する手法を解説。HudiのコミットファイルからKafkaチェックポイントを読み取り、該当オフセットにシークして未処理メッセージのタイムスタンプと現在時刻の差分を計算する。チェックポイント欠落時の遡り探索やepochタイムスタンプの罠など、実運用で遭遇したエッジケースへの対処も紹介している。
↗ 元記事を開く
cloud.google.com 6日前

WPP が AI マーケティングのためにプラットフォームとデータ エンジニアリングを運用化

WPP は Google Cloud と提携し、世界中に分散していたマーケティングデータを GCS と BigQuery に一元化し、Apache Spark と Kubeflow によるサーバーレス処理パイプラインと標準コホート定義(SCD)を整備した。GitLab による CI/CD テンプレート標準化、再ビルド不要のプロモーション、Wiz や Identity-Aware Proxy によるセキュリティ自動化も導入し、クリエイティブ制作時間を4週間から3時間に短縮、制作効率70%向上、コンテンツ量33倍、キャンペーンROI2.8倍を達成した。

WPP は Google Cloud と提携し、世界中に分散していたマーケティングデータを GCS と BigQuery に一元化し、Apache Spark と Kubeflow によるサーバーレス処理パイプラインと標準コホート定義(SCD)を整備した。GitLab による CI/CD テンプレート標準化、再ビルド不要のプロモーション、Wiz や Identity-Aware Proxy によるセキュリティ自動化も導入し、クリエイティブ制作時間を4週間から3時間に短縮、制作効率70%向上、コンテンツ量33倍、キャンペーンROI2.8倍を達成した。
↗ 元記事を開く