ページを読み込み中…
ページを読み込み中…
25件の記事
アリババの「Qwen3.8 Max」が人工知能評価指数で Claude Opus 4.8 と同等のスコアを記録したが、Kimi K3 はさらに高い得点を得ており、コストは 25% 低い。
Apple Machine Learning は画像理解におけるハルシネーション課題に対し、プリファレンス・アライメントの影響を MLLM で包括的に研究した。
KDnuggets が、言語モデルの幻覚現象を検出・評価するための手法「GraphEval」について紹介している。
Arena Blog は、ファクトアレーナ(Arena)の文脈において、AI の回答や生成物の事実性をどのように検証・評価するかに関する手法と基準を明らかにした。
ブルース・シュナイアーは、ドイツの裁判所がグーグルの AI 概要における誤りについて同社に責任を課した判決を引用し、AI エージェントは導入する個人または組織の代理人であり、その結果に対する責任も負うべきだと論じています。