ページを読み込み中…
29件の記事
LangChain のエンジニアが、同社内部および顧客向けの Kubernetes クラスタ運用を支援する自律型 SRE エージェントの構築プロセスと設計思想を報告した。
バクラクで SRE マネージャーをしている坂田 (@sakajunquality)です。
On-call エンジニアが長年悩まされたアラートは Runtime API の競合状態が原因で、Quint により解決策を検証した。
AWS は Amazon Bedrock の新機能を公開し、10 万社以上の組織が利用する生成 AI サービスにおいて、モデルの使用量制限のリクエスト手続きや運用上の問題のトリアージを自動化した。
AWS は、10 万社以上の組織で利用されている Amazon Bedrock を活用し、生産環境で動作するアプリケーションやエージェントを構築するための大規模な自律型 AI オペレーションの構築手法を発表した。
Asuka Zheng は、トレーニングデータの枯渇への不安が市場の実態を捉えていないと指摘し、自身の SRE 代替プロジェクトで世界モデルの訓練が失敗した事例を紹介する。同氏は、最初の異常から完全な解決に至るまでの長期エンドツーエンドの事象軌跡データが存在しないことがボトルネックだったと述べている。
GitHub は 2026 年 4 月に 10 件のインシデントが発生し、サービス全体の性能が低下したと報告。同社は透明性向上のため主要事象をブログで公開し、ステータスページの詳細化を進めている。
カーネギーメロン大学とDatadog、Amazonの研究者らが、実際の運用インシデントデータを用いた時系列データの質問応答を評価する新ベンチマーク「ARFBench」を発表した。
IT戦略部の滝氏は、Devin Enterpriseの運用自動化事例を通じて、運用設計の考え方や方法論を共有し、初学者の参考としている。
DeNAのネットワークグループの林氏が、L2スイッチのインターフェース設定ミスが拠点全体のネットワーク障害を引き起こした事例を報告し、再発防止策を共有した。
Amazon Aurora MySQLで、負荷が高くないにもかかわらずエラーレートが悪化した問題について、原因がPerformance Schemaの設定にあることが判明した。
LINEのSREチームが、サービス信頼性向上のためにSLI/SLOフレームワークを導入し、サービス稼働状況確認ツール「LINE Status」を開発したことを報告している。
DeNAのインフラSREチームが、Pocochaの開発環境をAmazon EC2からAmazon EKSへ移行し、ブランチ単位の開発とPull Request単位の検証を可能にするコンテナベースの環境を構築した。
DeNAのSREチームが、AIオールインの方針のもと、複数のAIツールを駆使してインフラ運用・効率化・コスト削減・セキュリティ対応などの多岐にわたる業務を効率的に処理し、新たな施策に次々と取り組んでいる事例を紹介している。
ハイパースケーラーは、設定をライブ制御平面として運用し、段階的ロールアウトと検証を実施して安全に変更をデプロイしている。
InfoQの記事が、システム変更は本番環境インシデントの主な要因であり、変更関連指標が信頼性の重要なシグナルであると指摘している。変更リードタイム、変更成功率、インシデント漏洩率の最小指標セットが、実用的な技術指標とイベント中心のデータウェアハウスによって支えられ、配信効率と信頼性を評価する。
LayerXのエンジニアリングマネージャーが、自身のマネジメント経験に基づき、失敗を学習機会と捉える形式知の活用方法について述べている。
東京科学大学の千代丸怜央氏が、CAMのSREユニットでの経験から、クラウドネイティブ基盤を安全に継続運用するための設計と視点を学んだことを述べている。
LayerXのAIワークフォース事業部でSREを担当する筆者が、入社1年を振り返り、現在のチーム体制と今後のサイト信頼性エンジニアリングの方向性について語っています。
メルカリグループが製品開発でCAST分析を導入した背景と、再発防止策が期待通りに機能しない理由についての考察。
DeNAのIT基盤部が、AI機能を駆使したオブザーバビリティプラットフォームDynatraceのPoCを実施し、SREの脆弱性対応業務の効率化を目指している。
スマートニュースのSREチームのエンジニアリングマネージャー尾形氏が、ハートビーツ主催のイベント「hbstudy#86」でSREの実践について講演した。
スマートニュースのSREチームエンジニアリングマネージャー尾形氏が、同社のインシデント対応プロセスやSREチームの取り組みについて解説している。