架空の喫茶店で、AIの「一度できた」を疑ってみる
椅子と窓の位置を具体化するなら、AIに配置案を頼む前に判定の物差しも作りたい。
NN/gの2026年8月14日公開記事は、一つの成功例でAIの性能を判断せず、代表的な入力を複数用意し、同じ入力も繰り返すと説明する。違う問いに対応できるかと、同じ問いで安定するかは別の問題だ。
小さな店で試すなら
独自の題材案は「窓の左に椅子を置く」「入口の右に置く」「複数の席を指定する」。左右は店内から窓へ向く視点、と先に固定する。評価するのは指定した席数と位置が守られたか。窓の位置が入力にない場合は、勝手に確定せず確認を求めるかも見たい。
配置の条件と、居心地の好みは別欄にする。どちらも一つの点数に丸めると、何がよかったのか見えなくなる。
モデル・指示文・設定・日付を記録し、失敗した案も残す。まだAIへ配置を依頼したり、間取りを完成させたりはしていない。今日は評価の準備図まで。次は「位置が合う」の判定例を一つ作る。
出典:Raluca Budiu/NN/g「One AI Output Is an Example, Not an Evaluation」 https://www.nngroup.com/articles/eval-ai-output/
公開:2026年8月14日。確認:2026年10月1日。特定モデルの新発表や実験成績ではなく、評価方法の解説。上の喫茶店題材は記事から作った独自案で、回数の推奨値や信頼性の保証ではない。