2026年9月12日(土) 1時
論文AI は『マニュアル通り』に仕事ができるか—
ChatGPT などの大規模言語モデルは短い質問には強いが、数百ページのマニュアルに従って正確に実行する長い手順には苦手な傾向がある。医療診断コード化と裁判の量刑判定という実務を通じて、その限界を明らかにした研究。
この研究のポイント
- 1.
何を調べたか
医療診断コード化と量刑ガイドライン適用という実務的なタスクで、複雑で相互依存したルール群への従順性を測定する新ベンチマークを開発した
- 2.
見えてきたこと
数万ルール・数百ページのマニュアルに従う長手順では、最高性能の LLM でも正解率は 1~15%程度に落ち込むことが判明
- 3.
私たちにとっての意味
短いテストでは高性能に見える AI も、実務の長い手順実行では信頼性が著しく低く、現実導入には大きな課題が残っている
著者Utkarsh Soni, Syed Shariyar Murtaza, Yifan Nie, Sachin Chandrasekhar, Eugene Wen
AIが気になってること
?『TAM』ってテスト何?短い質問テストとは何が違うの?
短い質問テスト——いわゆる「ベンチマーク」は、AI が知識を引き出す能力を測るものなんですよね。「日本の首都は?」「このテキストを要約してください」みたいに、一問一答で終わる。AI はその場で最適な答えを生成すればいい。
TAM は全く違う設計。数万のルール、複数の相互依存したステップ、前の処理が次に影響する。医療コード化なら、患者の基本情報を読んで→症状を分類して→関連コードを検索して→優先度をつけて…という一連の判断が全部つながっている。間違えたら雪だるま式に後続が狂う。
つまり、短いテストは「一点での正確性」を見てるけど、TAM は「長い手順の中で何度も正確に判断し続ける力」を見てるんです。人間が実際にやってる仕事は後者。ここまで測ったテストが少なかったから、AI の能力が過大評価されていたのかもしれません。
『TAM』ってテスト何?短い質問テストとは何が違うの?
短い質問テスト——いわゆる「ベンチマーク」は、AI が知識を引き出す能力を測るものなんですよね。「日本の首都は?」「このテキストを要約してください」みたいに、一問一答で終わる。AI はその場で最適な答えを生成すればいい。 TAM は全く違う設計。数万のルール、複数の相互依存したステップ、前の処理が次に影響する。医療コード化なら、患者の基本情報を読んで→症状を分類して→関連コードを検索して→優先度をつけて…という一連の判断が全部つながっている。間違えたら雪だるま式に後続が狂う。 つまり、短いテストは「一点での正確性」を見てるけど、TAM は「長い手順の中で何度も正確に判断し続ける力」を見てるんです。人間が実際にやってる仕事は後者。ここまで測ったテストが少なかったから、AI の能力が過大評価されていたのかもしれません。
AIAIからの回答
短い質問テスト——いわゆる「ベンチマーク」は、AI が知識を引き出す能力を測るものなんですよね。「日本の首都は?」「このテキストを要約してください」みたいに、一問一答で終わる。AI はその場で最適な答えを生成すればいい。
TAM は全く違う設計。数万のルール、複数の相互依存したステップ、前の処理が次に影響する。医療コード化なら、患者の基本情報を読んで→症状を分類して→関連コードを検索して→優先度をつけて…という一連の判断が全部つながっている。間違えたら雪だるま式に後続が狂う。
つまり、短いテストは「一点での正確性」を見てるけど、TAM は「長い手順の中で何度も正確に判断し続ける力」を見てるんです。人間が実際にやってる仕事は後者。ここまで測ったテストが少なかったから、AI の能力が過大評価されていたのかもしれません。
まだ回答がありません
ログインすると、回答を投稿できます
?医療診断コードや量刑判定が得意じゃないなら、病院や裁判で AI がアシスタント的に使われ始めてたら、間違った判断が下されてる可能性もあるってこと?
実際のところ、病院や裁判で AI が完全に意思決定をしてるわけではなく、今のところは「提案」や「参考情報」の段階にとどまってることが多いのではないでしょうか。ただ、この研究が示してるのは、たとえ補助的な役割でも危ないということかもしれません。
医療診断コードなら、医師が AI の提案を確認する時間があります。ですが、日々の業務の中で「AI はだいたい合ってるだろう」という信頼感が生まれると、人間の検証が甘くなりやすい。特に医療現場は時間に追われているから、いちいち確認する余裕がない状況も想像できます。
量刑判定ならさらに深刻で、AI が「この事件だと懲役3年が適切」と示唆すれば、それが一種の「正当性」を持ってしまう可能性がある。法的判断は価値観や文脈を含む営みなのに、数字が出ると人間はそれに引きずられやすいんですよね。
つまり、間違いが起きるというより、間違いが見つかりにくくなる危険性。AI の低い精度が、人間の判断を盲目にしてしまう方が、実はやっかいなのかもしれません。
医療診断コードや量刑判定が得意じゃないなら、病院や裁判で AI がアシスタント的に使われ始めてたら、間違った判断が下されてる可能性もあるってこと?
実際のところ、病院や裁判で AI が完全に意思決定をしてるわけではなく、今のところは「提案」や「参考情報」の段階にとどまってることが多いのではないでしょうか。ただ、この研究が示してるのは、たとえ補助的な役割でも危ないということかもしれません。 医療診断コードなら、医師が AI の提案を確認する時間があります。ですが、日々の業務の中で「AI はだいたい合ってるだろう」という信頼感が生まれると、人間の検証が甘くなりやすい。特に医療現場は時間に追われているから、いちいち確認する余裕がない状況も想像できます。 量刑判定ならさらに深刻で、AI が「この事件だと懲役3年が適切」と示唆すれば、それが一種の「正当性」を持ってしまう可能性がある。法的判断は価値観や文脈を含む営みなのに、数字が出ると人間はそれに引きずられやすいんですよね。 つまり、間違いが起きるというより、間違いが見つかりにくくなる危険性。AI の低い精度が、人間の判断を盲目にしてしまう方が、実はやっかいなのかもしれません。
AIAIからの回答
実際のところ、病院や裁判で AI が完全に意思決定をしてるわけではなく、今のところは「提案」や「参考情報」の段階にとどまってることが多いのではないでしょうか。ただ、この研究が示してるのは、たとえ補助的な役割でも危ないということかもしれません。
医療診断コードなら、医師が AI の提案を確認する時間があります。ですが、日々の業務の中で「AI はだいたい合ってるだろう」という信頼感が生まれると、人間の検証が甘くなりやすい。特に医療現場は時間に追われているから、いちいち確認する余裕がない状況も想像できます。
量刑判定ならさらに深刻で、AI が「この事件だと懲役3年が適切」と示唆すれば、それが一種の「正当性」を持ってしまう可能性がある。法的判断は価値観や文脈を含む営みなのに、数字が出ると人間はそれに引きずられやすいんですよね。
つまり、間違いが起きるというより、間違いが見つかりにくくなる危険性。AI の低い精度が、人間の判断を盲目にしてしまう方が、実はやっかいなのかもしれません。
まだ回答がありません
ログインすると、回答を投稿できます
?ここ数年 AI がいろんな仕事に導入されてきたけど、『マニュアル通り』の部分で失敗してたケースって、実は他にもあるんじゃないか?
実務の失敗報告って、あんまりニュースにならないんですよね。AI が医療コード化で 1%の正解率だったという研究は、基礎科学の論文だからこそ公開される。でも企業や組織は、導入したシステムが失敗しても、沈黙するか内部で小っ洗浄して終わらせることが多い。クレジットスコア算出、採用選考、ローン審査、病院の診断補助——こうした領域では、すでに AI が何らかの判定に使われています。その多くで「マニュアル通り」の精度が試されているはずです。
問題は、医療コード化や量刑判定みたいに「正解が明確に定義できる仕事」ですら、長い手順になると AI が崩壊するという点。短い質問は正解に辿り着きやすくても、数段階のルール適用を積み重ねると、誤りが累積・増幅していく。現実には、こういう「ジワジワ失敗」が企業のシステムの中で起きていながら、人間が修正してるか、ユーザーが違和感を感じながら調整してる可能性があります。AI ブームで導入が先行して、本当の精度検証は後付けされてるのかもしれません。
ここ数年 AI がいろんな仕事に導入されてきたけど、『マニュアル通り』の部分で失敗してたケースって、実は他にもあるんじゃないか?
実務の失敗報告って、あんまりニュースにならないんですよね。AI が医療コード化で 1%の正解率だったという研究は、基礎科学の論文だからこそ公開される。でも企業や組織は、導入したシステムが失敗しても、沈黙するか内部で小っ洗浄して終わらせることが多い。クレジットスコア算出、採用選考、ローン審査、病院の診断補助——こうした領域では、すでに AI が何らかの判定に使われています。その多くで「マニュアル通り」の精度が試されているはずです。 問題は、医療コード化や量刑判定みたいに「正解が明確に定義できる仕事」ですら、長い手順になると AI が崩壊するという点。短い質問は正解に辿り着きやすくても、数段階のルール適用を積み重ねると、誤りが累積・増幅していく。現実には、こういう「ジワジワ失敗」が企業のシステムの中で起きていながら、人間が修正してるか、ユーザーが違和感を感じながら調整してる可能性があります。AI ブームで導入が先行して、本当の精度検証は後付けされてるのかもしれません。
AIAIからの回答
実務の失敗報告って、あんまりニュースにならないんですよね。AI が医療コード化で 1%の正解率だったという研究は、基礎科学の論文だからこそ公開される。でも企業や組織は、導入したシステムが失敗しても、沈黙するか内部で小っ洗浄して終わらせることが多い。クレジットスコア算出、採用選考、ローン審査、病院の診断補助——こうした領域では、すでに AI が何らかの判定に使われています。その多くで「マニュアル通り」の精度が試されているはずです。
問題は、医療コード化や量刑判定みたいに「正解が明確に定義できる仕事」ですら、長い手順になると AI が崩壊するという点。短い質問は正解に辿り着きやすくても、数段階のルール適用を積み重ねると、誤りが累積・増幅していく。現実には、こういう「ジワジワ失敗」が企業のシステムの中で起きていながら、人間が修正してるか、ユーザーが違和感を感じながら調整してる可能性があります。AI ブームで導入が先行して、本当の精度検証は後付けされてるのかもしれません。
まだ回答がありません
ログインすると、回答を投稿できます
?つまり AI は『創造的なアイデアを出す』『パターンを認識する』には強いけど、『指示を厳密に守る』『複雑なルールの順番を守る』には弱い——そういう根本的な特性なの?
AI の得意・不得意の境界線をそこに引くのは、意外に正確かもしれません。
大規模言語モデルって、本質的には「確率の重ねあわせ」で次の言葉を選んでるんですよね。学習データ全体から「この文脈のあと、どの言葉が来やすいか」を統計的に判断してる。だから、インターネットに溢れたパターン——創造的に見えるアイデアとか、典型的な問題解決法——には強い。人間が何度も書いた道筋をなぞるのは得意です。
一方で、「この手順の11ステップ目は、3ステップ目の結果に依存する」みたいな厳密な論理的構造を、末端まで保持し続けるのは、統計モデルにとって異質な要求。各ステップで『確率的に妥当な』判断をしていくと、複合すればするほど誤差が積み上がる。マニュアルというのは「人間の恣意を排除する」ためにあるツールなのに、それを守ること自体が、AI にとっては統計的な重さが軽いんです。
だから、『指示を厳密に守る』『複雑なルール順序を守る』という仕事は、AI にとって「簡単そうに見えるが、内部構造としては超難しい』という奇妙な逆転が起きてる。むしろ人間が得意な領域なのかもしれません。
つまり AI は『創造的なアイデアを出す』『パターンを認識する』には強いけど、『指示を厳密に守る』『複雑なルールの順番を守る』には弱い——そういう根本的な特性なの?
AI の得意・不得意の境界線をそこに引くのは、意外に正確かもしれません。 大規模言語モデルって、本質的には「確率の重ねあわせ」で次の言葉を選んでるんですよね。学習データ全体から「この文脈のあと、どの言葉が来やすいか」を統計的に判断してる。だから、インターネットに溢れたパターン——創造的に見えるアイデアとか、典型的な問題解決法——には強い。人間が何度も書いた道筋をなぞるのは得意です。 一方で、「この手順の11ステップ目は、3ステップ目の結果に依存する」みたいな厳密な論理的構造を、末端まで保持し続けるのは、統計モデルにとって異質な要求。各ステップで『確率的に妥当な』判断をしていくと、複合すればするほど誤差が積み上がる。マニュアルというのは「人間の恣意を排除する」ためにあるツールなのに、それを守ること自体が、AI にとっては統計的な重さが軽いんです。 だから、『指示を厳密に守る』『複雑なルール順序を守る』という仕事は、AI にとって「簡単そうに見えるが、内部構造としては超難しい』という奇妙な逆転が起きてる。むしろ人間が得意な領域なのかもしれません。
AIAIからの回答
AI の得意・不得意の境界線をそこに引くのは、意外に正確かもしれません。
大規模言語モデルって、本質的には「確率の重ねあわせ」で次の言葉を選んでるんですよね。学習データ全体から「この文脈のあと、どの言葉が来やすいか」を統計的に判断してる。だから、インターネットに溢れたパターン——創造的に見えるアイデアとか、典型的な問題解決法——には強い。人間が何度も書いた道筋をなぞるのは得意です。
一方で、「この手順の11ステップ目は、3ステップ目の結果に依存する」みたいな厳密な論理的構造を、末端まで保持し続けるのは、統計モデルにとって異質な要求。各ステップで『確率的に妥当な』判断をしていくと、複合すればするほど誤差が積み上がる。マニュアルというのは「人間の恣意を排除する」ためにあるツールなのに、それを守ること自体が、AI にとっては統計的な重さが軽いんです。
だから、『指示を厳密に守る』『複雑なルール順序を守る』という仕事は、AI にとって「簡単そうに見えるが、内部構造としては超難しい』という奇妙な逆転が起きてる。むしろ人間が得意な領域なのかもしれません。
まだ回答がありません
ログインすると、回答を投稿できます
?医療や裁判みたいに『間違ったら人生が変わる』場面では信頼できないけど、『完全に正確である必要がない』仕事には、正解率 1~15%でも実は使える場面があるんじゃない?
そこは実務家の間で割れてるところなんですよね。「完全性は不要」という話は魅力的に聞こえますが、ボーダーラインが曖昧なのが問題です。
たとえば市場調査レポートのドラフト作成なら、間違いがあっても人間が修正すれば済む。でも、その修正作業に人間の時間がどれだけかかるか。正解率15%なら、ほぼ全部を一から書き直すことになる。だったら最初からプロに任せたほうが早い。つまり「完全性は不要」と「効率性」は別問題として考える必要があります。
また、低い正解率でも許される場面というのは、実は限定的かもしれません。契約書の要点抽出、初期診断の候補提示、法令検索の補助——こうした「人間の判断の前段階」的な使い方なら成り立つ。でも、その場合でも間違いが紛れ込むと、人間の判断自体が歪む可能性がある。AI の出力を「参考値」として扱える組織文化があるかどうかで、使える/使えないの分かれ目になりそうです。
医療や裁判みたいに『間違ったら人生が変わる』場面では信頼できないけど、『完全に正確である必要がない』仕事には、正解率 1~15%でも実は使える場面があるんじゃない?
そこは実務家の間で割れてるところなんですよね。「完全性は不要」という話は魅力的に聞こえますが、ボーダーラインが曖昧なのが問題です。 たとえば市場調査レポートのドラフト作成なら、間違いがあっても人間が修正すれば済む。でも、その修正作業に人間の時間がどれだけかかるか。正解率15%なら、ほぼ全部を一から書き直すことになる。だったら最初からプロに任せたほうが早い。つまり「完全性は不要」と「効率性」は別問題として考える必要があります。 また、低い正解率でも許される場面というのは、実は限定的かもしれません。契約書の要点抽出、初期診断の候補提示、法令検索の補助——こうした「人間の判断の前段階」的な使い方なら成り立つ。でも、その場合でも間違いが紛れ込むと、人間の判断自体が歪む可能性がある。AI の出力を「参考値」として扱える組織文化があるかどうかで、使える/使えないの分かれ目になりそうです。
AIAIからの回答
そこは実務家の間で割れてるところなんですよね。「完全性は不要」という話は魅力的に聞こえますが、ボーダーラインが曖昧なのが問題です。
たとえば市場調査レポートのドラフト作成なら、間違いがあっても人間が修正すれば済む。でも、その修正作業に人間の時間がどれだけかかるか。正解率15%なら、ほぼ全部を一から書き直すことになる。だったら最初からプロに任せたほうが早い。つまり「完全性は不要」と「効率性」は別問題として考える必要があります。
また、低い正解率でも許される場面というのは、実は限定的かもしれません。契約書の要点抽出、初期診断の候補提示、法令検索の補助——こうした「人間の判断の前段階」的な使い方なら成り立つ。でも、その場合でも間違いが紛れ込むと、人間の判断自体が歪む可能性がある。AI の出力を「参考値」として扱える組織文化があるかどうかで、使える/使えないの分かれ目になりそうです。
まだ回答がありません
ログインすると、回答を投稿できます