Weaviate、検索モードに試行時計算量制御機能を追加
本文の状態
日本語全文を表示中
詳細モードで約13分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Weaviate Blog
Weaviate は検索モードに「effort」パラメータを追加し、推論時の計算リソースをユーザーが手動で制御可能にしたことで、精度とレイテンシのトレードオフを最適化できる機能をリリースした。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月12日 01:07
AI深層分析
キーポイント
推論時計算のリソース制御機能の実装
Weaviate の Query Agent Search Mode に「effort」パラメータが追加され、ユーザーは各リクエストごとに medium、high、ultrahigh の 3 つの計算量レベルを選択できるようになった。
ベンチマークにおける精度向上の実証
BRIGHT Biology ベンチマークにおいて、ultrahigh effort モードは Hybrid Search 単体と比較して nDCG@10 が 13.0 から 57.5 に大幅に向上し、推論深度の効果が数値で裏付けられた。
クエリ分解と再ランクの最適化メカニズム
計算量を増やすことでエージェントがクエリの分解をより深く検討し、結果の再ランク処理も徹底されるため、複雑な推論が必要な検索タスクに特に有効である。
精度と速度のトレードオフ管理
開発者は回答の重要性に応じて計算リソースを上げ、レイテンシが重要なケースでは下げることが可能となり、アプリケーションごとに最適な設定を動的に変更できる。
Search Mode はすべてのベンチマークで Hybrid Search を上回る
8 つのベンチマーク全体を通じて、Search Mode のあらゆる試行レベルが Hybrid Search よりも高いパフォーマンスを示し、より高い努力(effort)ほど平均精度が向上する。
重要な引用
Spend more compute on a problem at inference, get a better result.
At higher effort, the agent thinks longer about how to decompose queries and reranks results more thoroughly.
Turn it up when the answer matters, and turn it down when latency does!
Across all eight benchmarks, the pattern is consistent: every effort tier of Search Mode outperforms Hybrid Search, and higher effort delivers higher accuracy on average.
編集コメントを表示
編集コメント
検索精度と応答速度のバランスをユーザーが細かく制御できる機能は、実運用における RAG システムの信頼性向上に直結する重要な進展である。特に複雑な推論が必要なドメインでは、計算リソースの投入量によって結果の質が劇的に変わるため、開発者は用途に応じた設定選択が求められるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

推論時に計算リソースを投入する「テストタイム・コンピュートのスケーリング」は、ファウンデーションモデルの時代における最も明確な成功事例の一つです。問題に対してより多くの計算資源を費やすことで、結果が向上します。検索においても例外ではありません。
Query Agent の Search Mode に新設された effort パラメータを使えば、この計算リソースの投入量を自在に制御できます。推論集約型の検索ベンチマークである BRIGHT Biology において、ハイブリッド検索のみを使った場合の nDCG@10 が 13.0 だったところを、最高レベルの effort を持つ Search Mode に切り替えることで、57.5 へと劇的に引き上げることができました。
アプリケーションごとに、精度とレイテンシのトレードオフ曲線上で異なる位置に存在します。weaviate-agents 1.8.0 および agents-typescript-client 1.7.0 で利用可能な effort パラメータを使えば、リクエストごとに Query Agent が各検索に投入する作業量を細かく指定できます。
Python
JS/TS
from weaviate.agents.query import QueryAgent
qa = QueryAgent(
client=client,
collections=["IRPAPERS"]
)
response = qa.search(
"What are Listwise Rerankers?",
effort="ultrahigh"
)import { QueryAgent } from "weaviate-agents";
const qa = new QueryAgent(client, {
collections: ["IRPAPERS"],
});
const response = await qa.search("What are Setwise Rerankers?", {
effort: "ultrahigh",
});Search Mode には、クエリ作成と結果の再ランク付けという 2 つの処理段階において計算資源を投入する「ミディアム」「ハイ」「ウルトラハイ」の 3 つのエフォートティア(努力レベル)が用意されています。エフォートが高いほど、エージェントはクエリの分解方法や結果の再ランク付けにより時間をかけ、より深く検討します。一方、エフォートが低い場合は、その深さを一部犠牲にして速度とコストを優先します。答えの重要性に応じてリソースを増減させ、レイテンシが問題になる場面では調整しましょう。
ベンチマーク
以下の表は、Search Mode のミディアム、ハイ、ウルトラハイの 3 つのエフォートティアと、Weaviate の Hybrid Search を 8 つのベンチマークで比較した結果です。対象となったのは BRIGHT、IRPAPERS、WixQA からそれぞれ 5 つずつのサブセットと、OBLIQ-Bench の一部です。これらのベンチマークを選定したのは、推論を要するタスクやドメイン固有の検索課題を明確に示しているためです。
手法
前回の Search Mode ベンチマーク記事と同様に、比較対象は Weaviate の Hybrid Search です。これは BM25 と Snowflake Arctic 2.0 エンベディングを用いたベクトル検索を組み合わせたもので、さらに Reciprocal Rank Fusion (RRF) で融合されています。Search Mode は同じコレクションに対して 3 つのエフォートティアそれぞれで実行されます。Search Mode に用いるモデルには確率的な要素が含まれるため、各設定を 3 回試行し、その平均値と標準偏差を報告します。一方、Hybrid Search は固定されたコレクションではほぼ決定論的な挙動を示すため、単一の試行結果のみを記載しています。
指標の用語解説
Gold Document(ゴールドドキュメント): IR ベンチマークにおいて、「ゴールドドキュメント」とは、特定のクエリに対してラベル付けされた関連ドキュメント、あるいは複数の関連ドキュメントを指します。
Success@K は、取得した K ドキュメントがすべて「正解ドキュメント(gold document)」であるかどうかを測定する指標です。通常、1 クエリに対して複数の正解ドキュメントが存在する場合に対応するため、K=1 の設定で Success を報告することが一般的です。
Recall@K は、上位 K 件の結果の中に、どの程度の数の正解ドキュメントが含まれているかを測定します。
nDCG@K(normalized Discounted Cumulative Gain の略)は、関連するドキュメントが取得されているかどうかだけでなく、その順序も考慮します。この指標の強みは、単なる「関連・非関連」の二値評価ではなく、段階的な関連性を捉え、上位に最良の結果を配置したシステムを高く評価できる点にあります。
すべての指標において、数値が高いほど性能が良いことを示します。各指標は情報検索の異なる側面を強調しており、これらを組み合わせることでより包括的な評価が可能になります。
ベンチマーク用語集
BRIGHT: ICLR 2025 で紹介されたベンチマークです。StackExchange の投稿からサンプリングした、長く記述的なクエリを用いて推論を要する検索タスクを検証します。正解ドキュメントは、承認された回答や高評価を得た回答で言及されている Web ページです。対象分野として、生物学、地球科学、経済学、心理学、ロボティクスの 5 つのサブセットを使用しています。
IRPAPERS: 情報検索論文を対象としたベンチマークです。ドメイン固有の検索研究や、テキストベースと画像ベースのシステムを比較するために、2026 年初頭に公開されました。ここでは、テキスト転写結果に対する評価値を報告します。
WixQA: Wix.com の AI リサーチチームが 2025 年 5 月にリリースしたベンチマークです。専門家が作成した 200 件の顧客問い合わせを用いて、ドメイン固有の技術サポート検索を検証します。各クエリには、Wix のサポートスペシャリストが作成した正解ドキュメントが対応付けられています。
OBLIQ-Bench:MIT の研究者が 2026 年 5 月に導入した OBLIQ-Bench は、文書の表面に明記されていない「潜在的な」または「間接的な」関連性を問うクエリを対象としています。このベンチマークでは、米国会議の聴聞記録からなるサブセットを使用しており、213,650 の聴聞記録テキストに対して 254 の「言葉が口元にありながら出てこない」ようなクエリ(tip-of-the-tongue queries)が含まれています。

8 つのベンチマークすべてで、一貫した傾向が確認されました。Search Mode のすべての努力レベル(effort tier)は Hybrid Search を上回っており、より高い努力レベルほど平均的な精度が高くなります。
この差の大きさは問題の種類によって異なります。多段階推論を必要とする BRIGHT では、各レベル間の差が明確に現れます。特に Ultrahigh effort を適用すると、Biology 分野では nDCG@10 が 13.0 から 57.5 に、Psychology 分野では 22.2 から 54.4 に向上し、努力レベルを上げるごとに有意な精度の改善が得られます。
一方、IRPAPERS や WixQA のように、特定のドメインに特化しているものの推論負荷は比較的低いベンチマークでは、この差は縮小します。ここでは Medium effort を採用するだけで Hybrid Search に対する利点の大部分をすでに獲得できており、さらに高いレベルへの移行で得られる追加効果は限定的です。
Search Mode の推論パイプラインは確率的であるため、個々のデータセットでは隣接するコスト階層が結果を争うことがあります。例えば BRIGHT Economics では、中程度の努力で最高レベルの努力を上回っています。しかし、ベンチマークと試行全体で平均化すると、この順序は維持され、より高い努力が一貫して精度向上をもたらします。
標準偏差はシステムごとに 3 回の試行から計算されており、実行間の一貫性により、これらの改善が単一のサンプルの偶然によるものではなく、堅牢なものであるという確信を持っています。
BRIGHT

BRIGHT の各サブセットは、努力に対する報酬の与え方が異なります。生物学と心理学では、努力レベルを一段階上げるごとに明確な精度向上が得られ、特に最高レベル(ultrahigh)の努力では、Hybrid Search の nDCG@10 が生物学において約 4 倍に達します。一方、地球科学では異なる結果が見られます。ここでは中程度の努力ですでに Hybrid Search ベースラインを 3 倍上回っており、それ以上のコスト階層はさらに小さな改善をもたらすのみです。
ロボット工学が最も顕著なケースです。ここでは中程度と高レベルの努力では Hybrid Search をわずかに上回るだけですが、最高レベルの努力では両者を大きく引き離し、Success@1 を中程度の 25.7 から高レベルの 45.9 に引き上げます。ロボット工学は 5 つのサブセットの中で最も長いクエリを持ち、平均して 819 トークンに達します。これは、最も困難なクエリにおいてこそ、追加の計算コストが最大の効果を発揮することを示唆しています。
IRPAPERS

BRIGHT と比較すると、IRPAPERS では試行コストの段階間の差が非常に小さくなっています。中程度のコストでもハイブリッド検索よりも大幅な性能向上を達成しており、高コストや超高コストを追加しても、その上乗せ効果は数ポイント程度に留まります。
WixQA

IRPAPERS で見られたパターンがここでも繰り返されています。Search Mode のどのコスト段階も、ハイブリッド検索を大きく上回っており、各段階間の差は依然として小さいままです。実務的な観点では、中程度のコストで十分であり、Search Mode は顧客の質問の約 3 分の 2 で、Wix のサポート担当者がランク 1 に提示するドキュメントを返すことができます。一方、ハイブリッド検索ではその割合は 5 分の 2 です。BRIGHT に比べてクエリが短く、多段階推論をあまり必要としないこうしたベンチマークにおいては、中程度のコストですべての性能向上をほぼ達成できていると考えられます。レイテンシに敏感なアプリケーションやコスト削減を優先する場合は、最も安価なコスト段階で十分な場合があるか、一度テストしてみる価値があります。
OBLIQ-Bench

今回の分析では、これらのスコアが最も低い絶対値を示しています。ハイブリッド検索はほぼ底辺に留まり、12 件に満たないクエリで上位 20 件以内に正解の文書が見つかる程度です。一方、Search Mode(検索モード)はこの状況を劇的に変えます。
最大限のリソース投入(Ultrahigh effort)では、Success@1 が 24.4 に達し、ハイブリッド検索と比較して約 7 倍の改善となります。これは各指標において明確に層別化された結果が得られた唯一のベンチマークです。リソース投入レベルを一段階上げるごとに実質的な性能向上が見られ、BRIGHT の分析で示されたパターンが再確認されました。つまり、最も困難な問題ほど、多くの計算資源を投じることで報われるのです。
Search Mode(検索モード)とは何か?
Query Agent は Weaviate においてデータへのアクセスを提供するエージェント型インターフェースです。手動で検索クエリやフィルター、集計処理を記述する必要はありません。自然言語で「何を得たいか」を説明するだけで、Query Agent が Weaviate のコレクションからどのようにしてその情報を取得するかを自動的に判断します。
この機能は 3 つのモードで提供されます。
- Ask Mode(質問モード):データに基づいて生成された回答で質問に答えます。
- Search Mode(検索モード):文書自体を返却します。
- Suggest Queries Mode(クエリ提案モード):ユーザーがコレクションで何ができるか探索できるよう、推奨されるクエリを提示します。
Search Mode は、ランク付けされた検索結果を前提とし、若干の遅延を受け入れられるあらゆるパイプラインにとって、即座に導入可能なアップグレードです。RAG システムやエージェント型ワークフロー、あるいは単なる検索バーなど、幅広いユースケースに対応可能です。
これまでのベンチマークは、Search Mode が関連文書をどれだけ見つけられるかに焦点を当てていましたが、その能力はそれだけではありません。Query Agent はコレクションのスキーマを理解しているため、自然言語を構造化されたクエリに変換できます。
例えば、「70 ドル以下のヴィンテージシューズを探して」というクエリを入力すると、Search Mode は「70 ドル以下」を構造化されたフィルターとして認識します。価格プロパティに対して厳格な制約を適用し、条件を満たす結果の中からヴィンテージシューズを検索するのです。これにより、意味的な理解と構造的な制約を一つのシステムで組み合わせることが可能になります。
結論
ベンチマークの結果は、Search Mode でより多くのリソース(計算量)を投入することで得られるメリットを示しています。検索タスクの難易度が高まるほど、精度の向上が顕著になるのです。ただし、その品質を得るためには、レイテンシとコストとのトレードオフが発生します。
「正しい結果」を提示することが不可欠なアプリケーション——エージェントワークフロー、深掘り調査、あるいは高リスクな質問応答など——においては、新しいリソース投入レベルでの実験をお勧めします。一方、レイテンシが敏感に問題となる場合は、ミディアムレベルの Search Mode または Weaviate のハイブリッド検索が依然として最適な選択肢となります。
すべての結果は、オープンソースのクエリエージェントベンチマークツールで確認・再現可能です。このツールでは 22 のベンチマークをサポートしており、BEIR、LoTTe、EnronQA、FreshStack などの追加ベンチマークも用意されています。これらの比較を拡張したい場合にも役立ちます。さらに、Weaviate に保存された独自の検索評価データに対して、リソース投入レベルの切り替えによる比較実験を実行することもできます。
お読みいただきありがとうございます!
構築を始めましょうか?
クイックスタートチュートリアルをチェックするか、無料の Weaviate Cloud アカウントを登録しましょう。
GitHub
フォーラム
X (Twitter)
ブログ投稿を見逃したくないですか?
週刊ニュースレターに登録して最新情報をキャッチアップ!
送信することで、利用規約およびプライバシーポリシーに同意したことになります。
原文を表示

Scaling test-time compute has become one of the clearest successes of the foundation model era. Spend more compute on a problem at inference, get a better result. Retrieval is no exception. The new effort parameter in the Query Agent’s Search Mode now lets you control this. On BRIGHT Biology, one of the hardest reasoning-intensive retrieval benchmarks, ultrahigh effort Search Mode lifts nDCG@10 to 57.5 compared to 13.0 with Hybrid Search alone.
Different applications sit at different points on the accuracy / latency tradeoff curve. Available in weaviate-agents 1.8.0 and agents-typescript-client 1.7.0, effort lets you choose per request how much work the Query Agent invests in each search.
Python
JS/TS
from weaviate.agents.query import QueryAgent
qa = QueryAgent(
client=client,
collections=["IRPAPERS"]
)
response = qa.search(
"What are Listwise Rerankers?",
effort="ultrahigh"
)
import { QueryAgent } from "weaviate-agents";
const qa = new QueryAgent(client, {
collections: ["IRPAPERS"],
});
const response = await qa.search("What are Setwise Rerankers?", {
effort: "ultrahigh",
});
Search Mode’s three effort tiers: medium, high, and ultrahigh scale computation at the two stages where Search Mode does its work: query writing and reranking. At higher effort, the agent thinks longer about how to decompose queries and reranks results more thoroughly. At lower effort, it trades some of that depth for speed and cost. Turn it up when the answer matters, and turn it down when latency does!
Benchmarks
The following table compares our medium, high, and ultrahigh effort tiers in Search Mode against Weaviate’s Hybrid Search across 8 benchmarks: 5 subsets from BRIGHT, IRPAPERS, WixQA, and a subset from OBLIQ-Bench. We chose these benchmarks because they illustrate reasoning-intensive and domain-specific retrieval problems.
Methodology
As in our first Search Mode Benchmarking blog, we compare against Weaviate's Hybrid Search, combining BM25 with vector search over Snowflake Arctic 2.0 embeddings, fused with Reciprocal Rank Fusion (RRF). We then run Search Mode at each of the three effort tiers on the same collections. To account for the stochasticity of the models used in Search Mode, every Search Mode configuration is run for 3 trials, and we report the mean and standard deviation across trials. Hybrid Search is nearly deterministic given a fixed collection, so we report a single run.
Metrics Glossary
Gold Document: In IR benchmarks, the "gold document" is the labeled relevant document, or documents, for a given query.
Success@K: Measures whether or not the K retrieved documents are gold documents. We typically report Success when setting K = 1 to account for multiple gold documents per query.
Recall@K: Measures how many of the gold documents are in the top K results.
nDCG@K: Short for normalized Discounted Cumulative Gain, nDCG considers not only whether relevant documents are retrieved, but also how they are ordered. Its strength lies in capturing graded relevance rather than binary relevance, and rewarding systems that place the best results higher in the list.
For all metrics, higher values indicate better performance. Each metric emphasizes a different aspect of information retrieval, and together they provide a fuller picture.
Benchmarks Glossary
BRIGHT: Featured in ICLR 2025, BRIGHT tests reasoning-intensive retrieval with long, descriptive queries sampled from StackExchange posts. The gold documents are web pages cited in accepted or highly upvoted answers. We use 5 subsets: Biology, Earth Science, Economics, Psychology, and Robotics.
IRPAPERS: Our benchmark of Information Retrieval papers, published at the start of 2026 to study domain-specific retrieval and compare text- and image-based systems. We report results on the text transcriptions.
WixQA: Released by the Wix.com AI Research team in May 2025, WixQA tests domain-specific technical support retrieval with 200 expert-written customer queries, each paired with gold documents authored by Wix support specialists.
OBLIQ-Bench: Introduced by MIT researchers in May 2026, OBLIQ-Bench targets queries where relevance is latent, or oblique, rather than stated in the document's surface text. We use the Congress Hearings subset with 254 tip-of-the-tongue queries over 213,650 congressional hearing passages.

Across all eight benchmarks, the pattern is consistent: every effort tier of Search Mode outperforms Hybrid Search, and higher effort delivers higher accuracy on average. The size of the gap between tiers depends on the problem. On BRIGHT, where queries demand multi-step reasoning, the tiers separate sharply. Ultrahigh effort lifts nDCG@10 from 13.0 to 57.5 on Biology and from 22.2 to 54.4 on Psychology, with each step up in effort buying meaningful additional accuracy. On domain-specific, but less reasoning-intensive benchmarks like IRPAPERS and WixQA, the gap shrinks. Here medium effort already captures most of the gain over Hybrid Search, and higher tiers add smaller increments on top.
Because Search Mode’s inference pipeline is stochastic, adjacent tiers can overlap on individual datasets. For example, on BRIGHT Economics, medium effort edges out high. Averaged across benchmarks and trials, the ordering holds and higher effort consistently delivers higher accuracy. Standard deviations are computed across three trials per system, and the consistency across runs gives us confidence these gains are robust rather than artifacts of a single sample.
BRIGHT

The BRIGHT subsets reward effort differently. On Biology and Psychology, each step up in effort buys a meaningful gain, with ultrahigh effort roughly quadrupling Hybrid Search's nDCG@10 on Biology. Earth Science tells a different story, where medium effort already triples the Hybrid Search baseline and the higher tiers add smaller refinements on top. Robotics is the most striking case where medium and high effort improve on Hybrid Search only modestly, but ultrahigh effort jumps well past both, lifting Success@1 from 25.7 at medium to 45.9 at high. Robotics also has by far the longest queries of the five subsets, averaging 819 tokens, which suggests the hardest queries are exactly where the extra computation pays off most.
IRPAPERS

Compared to BRIGHT, the effort tiers sit much closer together on IRPAPERS. Medium effort already captures most of the gain over Hybrid Search, with high and ultrahigh adding only a couple of points on top.
WixQA

The pattern from IRPAPERS repeats here. Every Search Mode effort tier clears Hybrid Search by a wide margin, while the gaps between effort tiers stay small. In practical terms, even at medium effort, Search Mode returns the document a Wix support specialist would hand you at rank 1 for about two out of three customer questions, compared to two out of five with Hybrid Search. On benchmarks like these, where queries are shorter and demand less multi-step reasoning than BRIGHT, medium effort seems to capture most of the available gain. For latency-sensitive applications or to save cost, it may be worth testing whether the cheapest tier is already enough.
OBLIQ-Bench

These are the lowest absolute scores in this analysis. Hybrid Search essentially hits the floor, surfacing the gold passage in its top 20 results for fewer than 1 in 12 queries. Search Mode changes the picture substantially. Ultrahigh effort reaches 24.4 Success@1, roughly a 7x improvement over Hybrid Search, and this is the one benchmark where the tiers stay cleanly separated on every metric. Each step up in effort buys a real gain, reinforcing the pattern from BRIGHT that the hardest problems reward the most computation.
What is Search Mode?
The Query Agent is Weaviate’s agentic interface to your data. Instead of writing search queries, filters, and aggregations by hand, you describe what you want in natural language and the Query Agent figures out how to get it from your Weaviate collections. It comes in three modes: Ask Mode, which answers questions with generated responses grounded in your data, Search Mode, which returns the documents themselves, and Suggest Queries Mode, which proposes queries to help users explore what their collections can answer.
Search Mode is a drop-in upgrade for any pipeline that expects ranked search results and can tolerate additional latency, whether that’s a RAG system, an agentic workflow, or even a search bar.
The benchmarks so far have tested how well Search Mode finds relevant documents, but it can do more. Because the Query Agent understands your collection schemas, it can translate natural language into structured queries. For example, given a query such as, "Find me some vintage shoes under $70", Search Mode recognizes "under $70" as a structured filter. It applies a hard constraint on the price property, and searches for vintage shoes among the results that qualify. This lets you combine semantic meaning and structured constraints with one system.
Conclusion
Our benchmarks show what higher effort in Search Mode buys: consistent accuracy gains that grow with the difficulty of the retrieval problem. Additional effort trades latency and cost for that quality. If your application depends on surfacing the right result, such as agentic workflows, deep research, or high-stakes question answering, we recommend experimenting with the new effort tiers. If you are latency-sensitive, medium effort Search Mode or Weaviate's Hybrid Search remains a great fit.
All results can be found or reproduced with our open-source query-agent-benchmarking tool. This tool supports 22 benchmarks in total, further including benchmarks such as BEIR, LoTTe, EnronQA, and FreshStack if you would like to extend these comparisons. The tool further supports running the effort sweep comparison on your own search evals stored in Weaviate.
Thank you for reading!
Ready to start building?
Check out the Quickstart tutorial, or sign up for a free Weaviate Cloud account.
GitHub
Forum
X (Twitter)
Don't want to miss another blog post?
Sign up for our bi-weekly newsletter to stay updated!
By submitting, I agree to the Terms of Service and Privacy Policy.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み