方針
(1) は各非最終ラウンドへ到達する確率が (10k)j−1 であることを使い、停止時の得点寄与を等比級数で加える。(2)(3)は後ろのラウンドから最適期待値を求め、目の数が続行価値を上回るときだけ停止する後ろ向きの判断を行う。
解答
(1) 非最終ラウンドで続行する確率は 10k である。1回のラウンドで停止して得る得点の無条件の寄与は101x=k+1∑10x=1055−2k(k+1).したがって期待値を Er,k とするとEr,k=1055−2k(k+1)j=0∑r−2(10k)j+211(10k)r−1.等比級数を整理するとEr,k=2k+11−2⋅10r−1kr.(2) 最終ラウンドの期待値は101+2+⋯+10=211.第1ラウンドで x>211 なら停止し、x<211 なら続行するのが最適である。よって1から5では続行、6から10では停止する戦略 f5 を用いる。その期待値は105⋅(211)+(6+7+8+9+10)=427.(3) 第2ラウンドでは (2)と同じ f5 が最適で、そのラウンド以降の期待値は 427 である。第1ラウンドでは x>427 のとき停止すべきだから、1から6で続行、7から10で停止する f6 が最適である。最大期待値は106⋅(427)+(7+8+9+10)=20149.したがって第1ラウンドは f6、第2ラウンドは f5 を用いる。
条件・検算
停止のしきい値は続行価値との比較で決まる。同値の場合の選択は期待値を変えないが、本問の最適境界では整数値との一致は起こらない。
別解
解法2(戦略番号ごとの差分比較)
方針
固定戦略の期待値を閉じた式にしたあと、k を1増やしたときの差を調べて最適なしきい値を決める。3ラウンドでは第2ラウンドの最適価値を続行価値として第1ラウンドを同様に比較する。
解答
(1)
停止時の1ラウンド当たりの寄与は101x=k+1∑10x=1055−2k(k+1).到達確率を等比級数で足すとEr,k=1055−2k(k+1)j=0∑r−2(10k)j+211(10k)r−1=2k+11−2⋅10r−1kr.(2)E2,k=2k+11−20k2だからE2,k+1−E2,k=209−2k.k=4 までは正、k=5 から負なので最大は k=5 であり、f5,E2,5=427.(3)
第2ラウンドの続行価値は 427 である。第1ラウンドで fk を使うとGk=10k(427)+∑x=k+110x.したがってGk+1−Gk=10427−(k+1).k=5 から6へは増え、6から7へは減るので第1ラウンドは f6、
第2ラウンドは f5 が最適である。最大期待値はG6=20149.
総評
難度6、計算量5。想定時間は25分程度で、得点差のつく期待値問題である。最適戦略は現在の数と『続行した場合の期待値』の比較で決まり、最終ラウンドから逆向きに考えるのが核心である。(1)の閉じた式は検算にも使える。
問題・解答の積分・総和・極限は原則として独立行に置き、分数は表示サイズで可読性を確保した。図は原問題の関係または答案の論理を確認するための独自作図であり、条件・境界・結論を本文だけでも追えるようにした。
冊子PDFで見る東大の確率の問題で問題集を作る
出典: 東京大学 2005年度 後期 理科 数学。問題文はHTML表示のために再入力・数式組版しています。