本文へ移動
cccskills
無料GitHub で公開

pipeline-architecture-patterns

Data pipeline architecture patterns for ETL/ELT design, orchestration, and data quality frameworks

インストール方法を見る

含まれるファイル(1)

  • SKILL.md2.2 KB

SKILL.md(原文)

インストールする前に、エージェントに与えられる指示の中身を確認できます。

Data Pipeline Architecture Patterns

Pipeline Architectures

ETL vs ELT (CRITICAL)

  • ETL: Extract → Transform (staging) → Load
    • Traditional, on-premise data warehouses
    • Pre-aggregation, complex transformations
  • ELT: Extract → Load (raw) → Transform (in warehouse)
    • Cloud warehouses (Snowflake, BigQuery)
    • Leverage warehouse compute power

Lambda Architecture

  • Batch layer: historical data processing
  • Speed layer: real-time stream processing
  • Serving layer: merge batch + real-time views
  • Complexity: maintain two codebases

Kappa Architecture

  • Stream-only processing
  • Single codebase for batch + real-time
  • Reprocessing via replay
  • Simpler than Lambda

Medallion Architecture

  • Bronze: Raw data (append-only)
  • Silver: Cleaned, conformed data
  • Gold: Business-level aggregations
  • Databricks pattern

Orchestration Patterns

DAG-Based Orchestration

  • Airflow, Prefect, Dagster
  • Task dependencies as DAG
  • Retries, backfills, scheduling

Event-Driven Orchestration

  • Kafka, Pub/Sub triggers
  • Real-time, low-latency
  • Decoupled producers/consumers

Hybrid Orchestration

  • Scheduled batch + event-driven streams
  • Example: Airflow DAG triggered by Kafka event

Data Quality Frameworks

Data Contracts (CRITICAL)

  • Define schema, freshness, volume expectations
  • Producer-consumer agreement
  • Break build on violation

Validation Frameworks

  • Great Expectations: Python-based expectations
  • dbt tests: SQL-based tests
  • Soda: YAML-based checks

Data Lineage

  • Track data origin and transformations
  • Debug data quality issues
  • Compliance and auditing

Idempotency Patterns

Idempotent Design (CRITICAL)

  • Same input → same output (no side effects)
  • Upserts instead of inserts
  • Partition replacement instead of append

Deduplication

  • Use unique keys
  • Window-based deduplication
  • Consumer group offset management

References

レビュー

まだレビューはありません。使ってみた感想をお寄せください。

同じリポジトリのスキル

概要と使いどころ

Pre-action boundary checking — validates agent tool calls against declared capabilities and task contracts

日本語の概要は準備中です。原文の説明を表示しています。

baekenough/second-brain152026年10月8日 更新

Auto-detect project context and optimize harness — deactivate unused agents/skills, suggest missing experts, generate project profile

日本語の概要は準備中です。原文の説明を表示しています。

baekenough/second-brain152026年10月8日 更新

Adversarial code review using attacker mindset — trust boundary, attack surface, business logic, and defense evaluation

日本語の概要は準備中です。原文の説明を表示しています。

baekenough/second-brain152026年10月8日 更新

Apache Airflow best practices for DAG authoring, testing, and production deployment

日本語の概要は準備中です。原文の説明を表示しています。

baekenough/second-brain152026年10月8日 更新

Alembic migration patterns for naming conventions, safety checks, expand-contract, env.py configuration, and CI integration

日本語の概要は準備中です。原文の説明を表示しています。

baekenough/second-brain152026年10月8日 更新

Pre-routing ambiguity analysis — scores request clarity and asks clarifying questions when needed (inspired by ouroboros)

日本語の概要は準備中です。原文の説明を表示しています。

baekenough/second-brain152026年10月8日 更新

baekenough のスキルをすべて見る

このスキルの問題を報告する