www.dampfkraft.com 15時間前

Parsing the Infamous Japanese Postal CSV

日本郵便が公開する郵便番号CSV「ken_all.csv」は広く使われる一方でパース困難なことで有名。開発者がposutoパッケージを作る過程で直面した問題を解説している。行末の注記が行の並び順に依存する、地名が長いと不自然な位置で複数行に分割される、区切り文字が通常のカンマと異なる、「以下を除く」「一円」といった除外表記や特殊地名の例外処理が必要、ローマ字変換ファイルの品質が低い(cutletの方が優れている)など、フォーマット上の癖と歴史的な複雑さが積み重なっている実例を紹介している。

日本郵便が公開する郵便番号CSV「ken_all.csv」は広く使われる一方でパース困難なことで有名。開発者がposutoパッケージを作る過程で直面した問題を解説している。行末の注記が行の並び順に依存する、地名が長いと不自然な位置で複数行に分割される、区切り文字が通常のカンマと異なる、「以下を除く」「一円」といった除外表記や特殊地名の例外処理が必要、ローマ字変換ファイルの品質が低い(cutletの方が優れている)など、フォーマット上の癖と歴史的な複雑さが積み重なっている実例を紹介している。
↗ 元記事を開く
www.infoq.com 昨日 20:00

Presentation: Architecting the Data Layer for AI Agents: From Transactional Systems to MCP and Semantic Models

TOTVSのFabiane Nardon氏が、AIエージェント向けにエンタープライズデータ基盤を設計する手法を解説。決定論的システムと確率的LLMをどう線引きするかを精度・セキュリティ・コストの3軸で説明し、データメッシュとデータプロダクト単位でMCPツールを設計しガバナンスを確保する方法、RDF/OWLによるセマンティックオントロジーでLLMの回答精度を高める事例、Postgres/DuckDBベースの低レイテンシ層をSpark/BigQueryと組み合わせた3層データ基盤アーキテクチャを紹介している。

TOTVSのFabiane Nardon氏が、AIエージェント向けにエンタープライズデータ基盤を設計する手法を解説。決定論的システムと確率的LLMをどう線引きするかを精度・セキュリティ・コストの3軸で説明し、データメッシュとデータプロダクト単位でMCPツールを設計しガバナンスを確保する方法、RDF/OWLによるセマンティックオントロジーでLLMの回答精度を高める事例、Postgres/DuckDBベースの低レイテンシ層をSpark/BigQueryと組み合わせた3層データ基盤アーキテクチャを紹介している。
↗ 元記事を開く
blog.masahiko.info 昨日 14:01

ロケーションインテリジェンス市場を「6つのレイヤー」で読み解く ~ データから意思決定まで - いっしきまさひこBLOG

ロケーションインテリジェンス市場を、基礎地理・POIデータ、人流・行動データ、クラウド・データ基盤、空間分析・GeoAI、アプリ・地図・検索、意思決定という6つのレイヤーに分けて整理した記事。各社のサービスは単一の技術ではなく異なるレイヤーを担っており、単純な横並び比較は難しいと指摘。日本市場では国内の地理・人流データとグローバルなクラウド・分析基盤を組み合わせる構成が有力になると論じている。

ロケーションインテリジェンス市場を、基礎地理・POIデータ、人流・行動データ、クラウド・データ基盤、空間分析・GeoAI、アプリ・地図・検索、意思決定という6つのレイヤーに分けて整理した記事。各社のサービスは単一の技術ではなく異なるレイヤーを担っており、単純な横並び比較は難しいと指摘。日本市場では国内の地理・人流データとグローバルなクラウド・分析基盤を組み合わせる構成が有力になると論じている。
↗ 元記事を開く
www.shoeisha.co.jp 昨日 09:22

データ利活用人材の育て方 データをもとに行動し価値を生み出す人をつくる

翔泳社の書籍紹介記事。りそなホールディングスとブレインパッドの事例をもとに、データ利活用人材を「専門家」「ビジネス実行人材」「マネジメント層」の3レイヤーで育成する体系的手法を解説。候補者選定から生成AI時代の役割変化まで扱う書籍案内。

翔泳社の書籍紹介記事。りそなホールディングスとブレインパッドの事例をもとに、データ利活用人材を「専門家」「ビジネス実行人材」「マネジメント層」の3レイヤーで育成する体系的手法を解説。候補者選定から生成AI時代の役割変化まで扱う書籍案内。
↗ 元記事を開く
dev.classmethod.jp 2日前

【kaimei試してみる】社内の暗黙知を1行教えるだけで、AIの分析精度はここまで変わる

クラスメソッドのAIデータ分析基盤kaimeiで、社内固有の業務知識を登録する「ビジネスナレッジ」機能を検証。ナレッジ0件では会計年度を一般的な4月始まりと誤って解釈し正解の約2.9倍の金額を回答、出荷遅延では聞くたびに判定基準が変わり結果が841件ぶれた。定義を1行登録すると両題材とも3回とも正解と一致する安定した結果になった。

クラスメソッドのAIデータ分析基盤kaimeiで、社内固有の業務知識を登録する「ビジネスナレッジ」機能を検証。ナレッジ0件では会計年度を一般的な4月始まりと誤って解釈し正解の約2.9倍の金額を回答、出荷遅延では聞くたびに判定基準が変わり結果が841件ぶれた。定義を1行登録すると両題材とも3回とも正解と一致する安定した結果になった。
↗ 元記事を開く
motherduck.com 3日前

MotherDuck CLI: query, pipelines, and dashboards from your terminal

MotherDuckが新しいCLIツールをリリース。従来のMCPサーバーに加え、シェル環境で動くコーディングエージェントやCI向けにquery/pipeline(flight)/dashboard(dive)をコマンド一つで操作可能にした。ブラウザ不要のログイン、エージェント向けガイド内蔵、JSON出力対応などにより、Claude Codeが1プロンプト・約45秒でデータセットの取り込みからダッシュボード公開まで完了する事例を紹介している。

MotherDuckが新しいCLIツールをリリース。従来のMCPサーバーに加え、シェル環境で動くコーディングエージェントやCI向けにquery/pipeline(flight)/dashboard(dive)をコマンド一つで操作可能にした。ブラウザ不要のログイン、エージェント向けガイド内蔵、JSON出力対応などにより、Claude Codeが1プロンプト・約45秒でデータセットの取り込みからダッシュボード公開まで完了する事例を紹介している。
↗ 元記事を開く
www.oreilly.co.jp 4日前

メタデータ管理入門

組織内に乱立するメタデータリポジトリ(EMS、IR、IAM等)を統合・調整する「メタグリッド」という概念を紹介する書籍。データディスカバリーチームの構築手法や、経営層からアーキテクトまでが押さえるべきメタデータ管理戦略を解説し、データ民主化とセキュリティ強化を支える基盤の全体像を提示する。

組織内に乱立するメタデータリポジトリ(EMS、IR、IAM等)を統合・調整する「メタグリッド」という概念を紹介する書籍。データディスカバリーチームの構築手法や、経営層からアーキテクトまでが押さえるべきメタデータ管理戦略を解説し、データ民主化とセキュリティ強化を支える基盤の全体像を提示する。
↗ 元記事を開く
cloud.google.com 5日前

メジャーがサポートされるようになった BigQuery Graph を使用して、信頼できるエージェント ワークロードを実現

BigQuery Graph(プレビュー版)がメジャー(SUM/AVG等の指標定義)に対応し、既存テーブルをETL不要でプロパティグラフにマッピングできるようになった。エージェントがグラフの関係パスを辿りながら管理された指標で正確に推論できるようになり、フラットテーブルでは追えなかった因果関係の分析が可能になる。BigQuery Studioの視覚的グラフモデラーや会話型分析との統合、LookMLとのネイティブ連携も強化され、指標ロジックを一元管理できる。

BigQuery Graph(プレビュー版)がメジャー(SUM/AVG等の指標定義)に対応し、既存テーブルをETL不要でプロパティグラフにマッピングできるようになった。エージェントがグラフの関係パスを辿りながら管理された指標で正確に推論できるようになり、フラットテーブルでは追えなかった因果関係の分析が可能になる。BigQuery Studioの視覚的グラフモデラーや会話型分析との統合、LookMLとのネイティブ連携も強化され、指標ロジックを一元管理できる。
↗ 元記事を開く
motherduck.com 5日前

MotherDuck Acquires Tower: Agents Can Answer. Now They Can Build.

MotherDuckがデータエンジニアリング実行基盤を提供するTower Computingを買収。TowerはMotherDuckのFlights機能(プロンプトからのデータパイプライン生成)を支えており、今後はサンドボックス・スケジューリング・可観測性に加え、FlightをデータAPI化しエージェントを統括する基盤へ発展させる狙い。可視化機能Divesと組み合わせることで単一プロンプトからのアプリ構築も視野に入れる。

MotherDuckがデータエンジニアリング実行基盤を提供するTower Computingを買収。TowerはMotherDuckのFlights機能(プロンプトからのデータパイプライン生成)を支えており、今後はサンドボックス・スケジューリング・可観測性に加え、FlightをデータAPI化しエージェントを統括する基盤へ発展させる狙い。可視化機能Divesと組み合わせることで単一プロンプトからのアプリ構築も視野に入れる。
↗ 元記事を開く
thinkit.co.jp 5日前

AIプロジェクトが本番前で止まる理由――Clouderaがデータのある場所にクラウドを持ち込む「Anywhere Cloud」を発表

Clouderaがデータの所在を移動させずにクラウド同様の運用体験を提供する新プラットフォーム「Cloudera Anywhere Cloud」を発表。パブリッククラウド・ソブリンインフラ・プライベートデータセンターを単一の管理画面で扱うモジュール型アーキテクチャで、Apache IcebergとPolaris Catalogによる標準ベースの相互運用性を持つ。AIプロジェクトが本番化前で停滞する要因はデータ主権や既存インフラからの分断であり、それを解消する狙い。自然言語指示でワークフロー自動化やインフラ管理を行う自律型AIコパイロットも搭載する。

Clouderaがデータの所在を移動させずにクラウド同様の運用体験を提供する新プラットフォーム「Cloudera Anywhere Cloud」を発表。パブリッククラウド・ソブリンインフラ・プライベートデータセンターを単一の管理画面で扱うモジュール型アーキテクチャで、Apache IcebergとPolaris Catalogによる標準ベースの相互運用性を持つ。AIプロジェクトが本番化前で停滞する要因はデータ主権や既存インフラからの分断であり、それを解消する狙い。自然言語指示でワークフロー自動化やインフラ管理を行う自律型AIコパイロットも搭載する。
↗ 元記事を開く
cloud.google.com 6日前

SOAP Architecture: S3 に眠るデータを、Google Cloud で AI エージェントの基盤に変える

S3に保存されたデータを移動せず、BigQueryやLookMLなどのセマンティック層・オントロジー層で意味付けし、Conversational AnalyticsやGemini Enterpriseからエージェントに活用させるGoogle Cloudのリファレンスアーキテクチャ「SOAP」を紹介する記事。Borderless Lakehouseによるゼロコピー分析、LookMLとBigQuery Graphによる意味の付与、3つの利用者ペルソナへの提供方法、モダナイゼーション計画のエージェント支援までを解説している。

S3に保存されたデータを移動せず、BigQueryやLookMLなどのセマンティック層・オントロジー層で意味付けし、Conversational AnalyticsやGemini Enterpriseからエージェントに活用させるGoogle Cloudのリファレンスアーキテクチャ「SOAP」を紹介する記事。Borderless Lakehouseによるゼロコピー分析、LookMLとBigQuery Graphによる意味の付与、3つの利用者ペルソナへの提供方法、モダナイゼーション計画のエージェント支援までを解説している。
↗ 元記事を開く
motherduck.com 2026/08/20

AI Writes the Semantic Layer

MotherDuckがAIエージェントによるセマンティックレイヤー(Malloy)の自律構築を検証した実験報告。AIは「hands-off」でMalloyモデルを生成できたが、Markdown+SQL方式より2.5倍のトークンを消費し、精度も95%対100%で劣り速度も遅かった。ここから、実装(セマンティックレイヤー自体)は使い捨て可能になり、質問と期待回答のペア(evalセット)こそが組織の意図を保存する耐久的な資産になるという洞察を提示。今後はコードではなく「振る舞いの記述」を蓄積し、必要に応じてAIで再生成する設計への転換を提案している。

MotherDuckがAIエージェントによるセマンティックレイヤー(Malloy)の自律構築を検証した実験報告。AIは「hands-off」でMalloyモデルを生成できたが、Markdown+SQL方式より2.5倍のトークンを消費し、精度も95%対100%で劣り速度も遅かった。ここから、実装(セマンティックレイヤー自体)は使い捨て可能になり、質問と期待回答のペア(evalセット)こそが組織の意図を保存する耐久的な資産になるという洞察を提示。今後はコードではなく「振る舞いの記述」を蓄積し、必要に応じてAIで再生成する設計への転換を提案している。
↗ 元記事を開く