LLMの賢さは、結構多くの人(あるいは日常会話とかを求める人?)の評価軸でサチっているので、もう別の評価軸の方が優先されるんだと思う
あとそもそも4oは文章読解の能力が十分良かったのと、ユーザーの側が4oにオーバーフィッティングしていたんじゃないか
LLMの賢さは、結構多くの人(あるいは日常会話とかを求める人?)の評価軸でサチっているので、もう別の評価軸の方が優先されるんだと思う
あとそもそも4oは文章読解の能力が十分良かったのと、ユーザーの側が4oにオーバーフィッティングしていたんじゃないか