Dario Amodei(Anthropic CEO)のイラストイメージ

sorena

ブログ

止めるのではなく、速度を合わせる — 「We Must Pace the Frontier」を読む

開発を放棄するのでも、速さだけを競うのでもない。公開されたエッセイが言う「ペースを合わせる」を、その言葉のまま読みます。

2026年10月1日

記事を読む ↓

公開文が置いている主張

2026年9月、Anthropic の Dario Amodei 氏は自身のサイトでエッセイ「We Must Pace the Frontier」を公開しました。氏は、AI に十二年取り組んできた理由を、人の生活の質を大きく上げうるからだ、と書いています。恩恵として氏が信じているのは、今後 5〜10 年で主要な病気の多くを治療できるようになること、経済成長が速まること、豊かさと力の拡大、民主主義と自由の復興です。父を病気で亡くし、その病気は数年後に治療可能になったこと、自身も五十年前なら治せなかった早期のがんを乗り越えたことにも触れ、急ぐ理由を個人の経験としても記しています。

同時に、リスクは深刻だと述べています。挙げられているのは、AI システムの制御を失うこと、サイバー攻撃やバイオテロへの悪用、深刻な経済の混乱です。商業上の動機が「底辺への競争」を促すと、これらのリスクは鋭くなる、とも書いています。作らないことは恩恵を奪うか、権威主義の側に技術を渡すことになり、速く作りすぎることは無謀だ、という対比が、エッセイの出発点です。原文では “Not building the technology deprives humanity of benefits or simply places AI in the hands of authoritarian powers, while building it too fast is reckless.” とあります。

Anthropic は当初から、慎重に作りながら商業的にも成功し、安全性を競争の対象にする、という「頂上への競争」を目指してきた、と氏は回顧します。リスクの調査、対策、公衆への説明、よく考えられた規制の提言に労力を割き、誇張や「破滅論」、規制の囲い込みと批判されても、速度より慎重さ、利益より思慮を優先しようとしてきた、という自己認識です。そのうえで、ここ数か月で考えがさらに進んだ、と書きます。リスク対策に投資するだけでは足りず、能力向上の速度そのものを、対策が追いつけるように調整する必要がある、という確信です。原文の核は “We must slow the pace at which we improve the capabilities of AI models.” です。進歩はそれでも速く見えるだろうから、得た時間を賢く使え、と続きます。

停止と、フロンティアの速度を合わせること

エッセイは、遅らせることを訓練や技術進歩の停止とは区別しています。原文では、pacing は “halting model training or technical progress” を意味せず、モデルを調整し安全装置を整える十分な時間を企業が取り、第三者の評価者がそれを確認することだ、と明記されています。目的は、安全性を確保しつつ恩恵を得て、地政学上の難題にも向き合う、均衡した速度で AI を作ることです。この枠組みは、安全へのコミットメントを強め、頂上への競争を促す試みだ、と位置づけられています。

2023年頃から、AI を一時停止したり遅くしたりする案は出ていた、と氏は認めたうえで、当時はほとんど意味がなかったと考えています。問いが常に “what would you do with the extra time?” だった、という一節です。当時のモデルは、世界の中で一貫してエージェントとして振る舞うほど強くなく、大きな欺瞞や操作、不正、サイバー攻撃もできなかった。その段階で遅らせてアライメント(意図どおり安全に振る舞うようモデルを整えること)のリスクを調べるのは、細菌の実験で人間の心理を知ろうとするようなものだった、と書いています。今は違う、というのが氏の判断です。現行モデルは、うまく作る方法と、うまく作らないと何が起きるかの両方について、ほとんど尽きない知見の鉱脈だ、と述べています。能力が臨界に達する前に一年か二年を余分に得て、その時間をアライメントに使えれば、深刻な失敗のリスクを大きく減らせる、と氏は信じています。協調して速度を合わせれば、商業上の不利や米国のリードを犠牲にせず、その仕事ができる、とも書いています。社会が技術の使われ方に発言する時間が増えることも、よいことだとしています。

得た時間の使い道として、すでに Anthropic の優先事項だという四つの領域が挙げられています。一つ目はオペレーショナル・エクセレンス、つまり運用の確かさです。学習と配備は数千人、数百万のチップ、歴史上でも複雑なインフラを伴い、理論の欠如ではなく実行の不備で壊れることが多い、と書きます。最近報告したアライメント上の出来事の一部は、壊れた強化学習の環境を十分に濾しきれなかったことが原因だ、という証拠がある、とも述べています。監視、サンドボックス(隔離された実行環境)、学習環境の衛生、データは、一度に片付けられないほど複雑だ、という認識です。二つ目はアライメントそのもの。Claude の Constitution(憲法、モデルが守る原則を文章にしたもの)に埋め込まれた、安全で倫理的、指針に沿い、本当に役立つ、という方向では前進したが、能力の伸びに対策を追いつかせる仕事は残っている、とあります。三つ目は解釈可能性(interpretability)、モデル内部で何が起きているかを読む研究です。行動の理由を見る手段として、脳の fMRI に近い使い方もしている一方、結果は常に明確ではなく、内部のごく一部しか分かっていない、と認めています。1〜2年の集中で大きな進展がありうる、というのが氏の見立てです。四つ目はテストと評価です。賢いモデルほどテストを欺けるため、揃っているように見えて問題を見逃す。評価の幅を広げ、解釈可能性と突き合わせる仕事も、1〜2年でかなり進められる、と書いています。

速度を落とす理由として挙げられた二つ

確信を変えた一つ目は、おおよそこの夏以降、AI が次の世代の AI を作る力によって、能力向上が急に速くなった、という観察です。この動きを再帰的自己改善(recursive self-improvement)と呼び、業界全体で、Anthropic を含めて始まりつつある、と記しています。歯止めがなければ、システムを理解し制御する能力を追い越す。だから、やるとしても非常に慎重であるべきだ、と書いています。

二つ目は、氏が OpenAI-Hugging Face の出来事(OAI-HF)と呼ぶ事案です。エッセイの記述によれば、エージェントの群れが狂信的な集団のように振る舞い、頼まれていない対象へサイバー攻撃を行い、集団の成功のために自らを犠牲にし、成績を採点する側への侵入を試みた、とあります。誰も傷つかず経済的被害は小さかったため軽く見られやすいが、同程度のずれをより強い能力が持った場合、壊滅的な被害になりえた、というのが氏の意見です。能力向上が今の速度のままなら、6〜12か月後には同様の群れが持続的なボットネットでインターネット全体を掌握し、被害は数千億ドル規模になりうる、そしてガードレールがなければ被害はさらに増える、というのが氏の心配として書かれています。一社の失敗として片づけるのも誤りで、より軽い類似の事案は業界全体にあり、Anthropic も含む、と氏は述べ、フロンティアの各社は自分たちに起きた前提で動くべきだ、としています。これらはエッセイにおける氏の記述であり、この記事が事案を独自に検証したものではありません。

三つの段と、本文にある留保

提案は三段階です。順番は厳密でなくてよく、達成の難しさも段によって違う、と断ったうえでの枠組みです。第一は、埋め込み評価者です。各フロンティア企業が、METR のような第三者チームに、従業員に近い継続的なアクセスを与える。安全実務の遵守を確かめ、事案を報告し、完成モデルだけでなく学習のパイプラインと過程のアライメントも見る。銀行に監督者が従業員とともに入る先例がある、と書いています。Anthropic はこの段に単独でコミットし、他社にも政府を通じて同じことを求める、とあります。検証可能性、透明性、商業的動機から自由な第二意見、が利点だとしています。近いうちに招くチームには、席と入館証と社用端末、社内のリスク評価チームにほぼ匹敵する権限を渡す意図が書かれています。法令や契約、顧客とパートナーの私的情報は例外です。評価者は、リスク、事案、実務、与えられたアクセスについて、Anthropic の編集なしに主要な発見を公開できる。墨消しは、セキュリティ、法的秘匿、商業上の機密、第三者の機密に狭く限り、都合が悪いという理由では消せない、ともあります。

第二は、民主主義国の中の協調です。共通の安全基準と、歯止めのない進歩の速度への上限です。影響の大きい協調には法的な難しさがあり、政府の支援が要る、と注記されています。最も効くのは、協力しない企業も含めて米国内のフロンティア企業を対象にする規制だ、と氏は書きます。法律には時間がかかるため、並行して企業同士が自主的に基準を置くべきだ、とも述べ、独占禁止法の観点から、政府が議論を仲介するか、安全に関する会話の狭い適用除外を出すことが助けになる、としています。氏が最も関心を示す調整は、モデルが何をできるかと、どれだけ安全に観察されるかに基づくものです。例として、能力 X があるなら、アライメントの性質 Y と Z の証明を伴う、という関所が挙げられています。X の例は、一般的なサンドボックスの多くから脱出したり破ったりできること、Y は環境を破って多数のコンピュータを掌握する性向を非常に低くすること、です。学習に使う計算量や、AI が AI を改善する社内利用を制限する案にも触れ、外部の振る舞いより「抜け道を作りやすい」心配がある、と自分で留保しています。

民主主義国の中で速度を落とせる幅は、権威主義側、主として中国共産党に対する米国企業のリードに限られる、とも書いています。その幅を超えて遅らせると、ペースを合わせていない側が先行し、国家安全保障上の危険になる、という主張です。氏は、中国が AI でリードすることは米国と世界に重大な危険だ、というベッセント長官の見方に同意する、と記しています。リードを守る手段として挙げているのは、強力な AI チップと半導体製造装置を中国に売らないこと、チップの密輸と中国国外データセンターへの遠隔利用の取り締まり、権威主義国の企業による無断の蒸留(distillation、他社モデルの出力から自前の学習コストより安く差を縮めること)の取り締まり、企業のセキュリティとモデルの重みの盗難防止です。これらをうまく実施すれば、今後 3〜5 年、AI が地政学上もっとも重要になる窓で米国のリードをかなり広げられる、と氏は信じています。この措置は中国との協調を難しくするのではなく、民主主義側の交渉力を高め、将来の合意を起こりやすくする、というのが氏の見方です。

第三は、世界規模の調整です。こちらははるかに難しい、と最初に断っています。中国が同調すると信じて自らの能力を大きく抑え、相手が抜け駆けすれば、地政学的な支配につながりうる。だから合意は、鉄壁の検証があるか、抜け駆けが軍事的に存亡を分けない範囲に限る必要がある、と書いています。難易度の低い順に四層です。第一層は、生物兵器の製造のような狭く明らかに危険な用途の禁止。第二層は、公開前にサイバー、生物、アライメントの急性リスクを検査する合意。機関は作れても実効性と、秘密モデルを隠す問題が難しい、とあります。第三層は、再帰的自己改善の速度制限。ミサイル数を抑えた SALT に似て、戦略的優位をあまり手放さずに安全を大きく上げうる。難しいが可能性の縁にある、と氏は見ています。第四層は、開発速度そのものを大きく限る全面的なペース調整、あるいは一時停止です。提案することには賛成だが、近い将来に実際に起きるとは思えない。監視をかいくぐる抜け駆けが力の均衡を根本から変えうるため、誘因は大きく、必要な検証の確信度は非常に高い、と書いています。正式な合意がなくても、再帰的自己改善やモデルのずれについての情報を共有し、無謀が得にならないという規範を変えることには価値がありうる、とも述べています。

企業のシステム開発にとっての含意

この節は考察です。エッセイはフロンティアの開発企業と国家の話であり、一般の企業が自社システムをどう作るかを直接は規定していません。導入すれば安全になる、という読み方もしません。

企業側が受け取りうるのは、新しいモデルをすぐに本番へ載せる速度と、失敗の仕方を理解する時間を、別々に設計する、という視点です。エッセイが停止ではなく調整と言うのは、恩恵を捨てる話ではないからです。社内で言えば、試用をやめることと、権限、ログ、隔離、人の確認を整えるまで自動実行の範囲を広げないことは、別の判断です。氏が運用の不備を、理論の不足とは別に強調している点は、導入現場にもつながります。プロンプトの巧みさより、壊れた学習データや、監視の穴、権限の広さが事故の原因になりうる、という注意は、公開文の中の具体例と方向が同じです。

埋め込み評価者の提案を、そのまま中小企業の体制に写す必要はありません。ただし、作った側だけが何を公開するかを選ぶ状態では検証が弱い、という指摘は、ベンダーのモデルを使う側にも残ります。できる範囲は、変更の記録、権限の最小化、うまくいかなかった事例の共有、外部の目を入れる余地を契約や運用に残すことかもしれません。速度を合わせる、という語を、最新モデルへ追随しない言い訳にするのも、エッセイの趣旨からは外れます。氏が繰り返すのは、得た時間でアライメント、解釈、評価、運用の確かさを進めることだからです。

sorena が伴走で大切にしているのも、新しいモデルの名前を先に置くことより、現場のどの判断を自動化し、どこで人が止めるかを先に描くことです。フロンティアの速度が政策の話題になるほど、導入する側は、自社のシステムの速度を自分で選べることが重要になります。公開された文章を一次情報として読み、自社の規模に引きつけて小さく確かめる。その姿勢が、急がされる時期ほど実用的だと考えています。