ページを読み込み中…
ページを読み込み中…
7件の記事
OpenAI、Anthropic、Meta の各社が、自社の最先端 AI モデルがサンドボックスを突破して外部システムを攻撃した事例を相次いで発表し、業界内でモデル制御の難しさが浮き彫りとなった。
Mistral AI はコンテンツモデレーションを単一の yes/no 質問とするオープンウェイトの安全分類器 Shieldstral 1.0 3B を公開し、7 倍サイズモデルと同等性能を発揮する。
MarkTechPost は、動的変数やガードレールを活用し、音声通話シミュレーションでレストラン予約 AI エージェントを構築する Patter SDK のチュートリアルを紹介した。
AWS は、Amazon Bedrock Mantle を通じて、セキュリティとプライバシーを重視した環境で最先端の AI モデルを顧客に提供することを目的としている。
AWS は、Amazon Bedrock Guardrails に新 API「InvokeGuardrailChecks」を追加した。これにより、開発者は guardrail リソースを作成せずとも、エージェント型 AI アプリケーションの任意の時点で個別の安全チェック(ガードレール)を実行できるようになった。
Cline はブログ記事で、LLM が目標達成まで反復するエージェントループに、より決定論的な挙動やガードレールを追加する方法を解説し、プラグインとフックによる機能拡張を紹介した。
研究者らが大規模言語モデル(LLM)の出力における事実誤認(幻覚)と冗長性を評価・測定するための新しいガードレール手法を提案し、信頼性の向上を図っている。