【Core SSoT】Extreme Observability & SLO Manifesto(超観測性・SLO絶対定義書)
⚠️ THE GENERATIVE SSoT: ZERO-DOWNTIME OBSESSION & AIOps 本ドキュメントは、士業やユーザーからの「技術的信用」を絶対的に担保するため、Rustアプリケーションの超観測性と、AIによる自己修復(Zero Marginal Cost AIOps)の運用ルールを定義する。
1. サービスレベル目標 (SLO: Service Level Objective)
「もしものはなし」B2BダッシュボードおよびコアAPIに対する、いかなる言い訳も通用しない厳格なSLO。
- 可用性 (Availability): 99.99% (月間ダウンタイム 4.38分以内)
- レイテンシ (Latency): 99%のAPIリクエストが 100ms 以内に応答すること(※意図的に遅延させるAI推論やサードパーティ通信を除く)
- エラー率 (Error Rate): HTTP 5xx エラーが全リクエストの 0.05% 未満であること
2. 超観測性 (Extreme Observability) アーキテクチャ
Rustのゼロコスト抽象化の特性を活かし、極めて低負荷で高解像度なテレメトリをシステム全体から搾り取る。
tracingクレートによる細胞レベルの可視化:- Rustバックエンド内の全HTTPリクエスト、関数呼び出し、DBクエリ、SSS暗号化ステップを
tracingによって構造化ログおよびスパン(Span)として記録する。
- Rustバックエンド内の全HTTPリクエスト、関数呼び出し、DBクエリ、SSS暗号化ステップを
- OpenTelemetry の絶対統合:
- 収集したテレメトリデータを OpenTelemetry Protocol (OTLP) 経由で Datadog, Honeycomb, または Grafana (Loki/Tempo) へストリーミング送信。
- 「ユーザーがフロントエンドのボタンをクリックした瞬間」から「Rustでの暗号化処理」「PostgreSQLへのクエリ実行」に至るまでの**完全な分散トレース(Distributed Tracing)**を実現し、パフォーマンスのボトルネックやエラー原因を数秒で特定可能にする。
3. Zero Marginal Cost AIOps とエラーバジェットの強制
人間の運用エンジニアが深夜に叩き起こされるレガシーな運用を完全に排斥する。
- AIドリブン自動修復(Auto-Healing):
- SentryやDatadogのクリティカルアラートをWebhookで受け取り、n8n.ok.st (中枢神経系) がインフラ(AWS/GCP/Alibaba)の再起動やリソース拡張、あるいはDBフェイルオーバーを人手を介さずに自動で実行する。
- エラーバジェットの絶対ルール:
- 月間のSLOバジェット(許容ダウンタイム4分)を使い果たした場合、新機能の開発をいかなる理由があろうとも即座に凍結する。
- バジェットが回復するまで、全エンジニアリソースを「信頼性向上(技術的負債の返済)」のタスクのみに強制アサインするというビジネスルールを、例外なく適用する。