先日、道内のある会社で更新の判断を相談されました。一年前に生成AIのツールを全社に入れた会社です。「使えなかったわけではないんですよ」と役員の方は言いました。「試した部署からは、そこそこ使えると返ってきた。そこから先の話にならなくて」

このあと役員の方が口にした一言が、私にはいちばん重く聞こえました。経営会議で効果を聞かれて、うまく答えられなかった、と。

更新時期を迎えてこの状態にある会社は、いま相当多いはずです。そして振り返ってみると、つまずいた原因はほぼ例外なく、ツールの選定やプロンプトの書き方よりもっと手前、AIを触り始めるより前の段階にありました。

この記事では、着手前に決めておくべき三つのことを整理してみます。前の記事では「何を渡すか」を書きました。今回はその手前、何を決めてから渡すか、という話です。

目次

  1. 「成果が出ない」の中身は三つに分かれる
  2. 導入の前に決まってしまう三つのこと
  3. 対象は、業務ではなく判断の単位まで落とす
  4. 「精度100%でないと使えない」で検討は止まる
  5. 兼務の一人に預けた仕組みは、だいたい半年で止まる
  6. 前工程に、どれだけ時間をかけるか
  7. 北海道の中小企業では、どこが詰まるか
  8. 最後に

1. 「成果が出ない」の中身は三つに分かれる

成果が出ない、という言葉の中身を分解すると、だいたい三つのどれかです。

ひとつめは、使われなかった。アカウントは配ったが、ログインしたのは初月だけ。それきり。ふたつめは、使われたが業務が変わらなかった。文章作成や要約には使われている。しかし業務フロー自体は以前のままなので、一回あたり数分ずつ浮いたはずの時間が、どこにも積み上がっていきません。みっつめは、業務は変わったが説明できない。実感としては楽になった。ただ数字で示せないので、次の投資を決める会議に持っていっても判断の材料として扱ってもらえない。

いちばん多いのはふたつめです。そしてこれは、世界的にも同じ傾向が出ています。

マッキンゼー・アンド・カンパニーは、生成AIの用途を横断型と業務特化型に分けて整理しています。全社員向けのチャットや汎用のコパイロットといった横断型は広く導入された一方、効果が出るのは部門固有の業務に食い込んだ特化型のほうで、そちらはパイロットの段階から先に進まないことが多い、という指摘です。

Seizing the agentic AI advantage(McKinsey & Company)
https://www.mckinsey.com/capabilities/quantumblack/our-insights/seizing-the-agentic-ai-advantage

横断型は導入が簡単です。配れば終わる。だから多くの会社が最初にそれをやります。ところが効果は薄く広く散らばるため集計ができず、「全社で月何時間浮いたか」を後から測ろうとしても、そもそも誰も記録を取っていなかった、ということになる。

一方、特化型は導入が難しい。業務に入り込む必要があるからです。しかし効果ははっきり出ます。測れる場所を狙っているからです。

つまり多くの会社は、効果が薄いほうだけをやった状態で一年を終えている。これは失敗というより、順番の問題だと思っています。

2. 導入の前に決まってしまう三つのこと

MITの研究プロジェクト「NANDA」が2025年に公表したレポートは、300件を超える公開事例の調査、52件の構造化インタビュー、153件の経営層アンケートを土台にしています。結論は厳しい。95%の組織がリターンを得ていない。業務フローに組み込まれてスケールしているのは5%にとどまる。

The GenAI Divide: STATE OF AI IN BUSINESS 2025(MIT Project NANDA, 2025)
https://www.artificialintelligence-news.com/wp-content/uploads/2025/08/ai_report_2025.pdf

同レポートは分断の要因をモデルの性能に求めていません。挙げているのは学習と業務への統合であり、そのうえで「作り始める前に成果の定義がないこと」を失敗要因としてはっきり名指ししています。

この「作り始める前」を実務で具体化すると、決めるべきことは三つに絞れます。どの業務のどの判断を扱うのかという対象。どうなったら成功と見なすのかという基準。そして誰がこの仕組みを持ち続けるのかという持ち主。この三つです。技術検討に入る前にこれが紙に書けているかどうかで、その後の進み方がまったく変わります。逆に言えば、三つが埋まっていない状態で技術の話を始めると、議論はいくらでも発散していきます。

3. 対象は、業務ではなく判断の単位まで落とす

最もよく見る失敗が、対象の粒度が粗いことです。

「営業事務を効率化したい」。これは対象ではありません。願望です。この粒度のまま検討を始めると、要件が固まらないまま時間だけが過ぎていきます。

たとえば見積作成を効率化したいという話であれば、その業務の中に何種類の判断が含まれているのかを、担当者と一緒に一つずつ洗い出していきます。過去の類似案件を探す判断。どの単価表を使うかの判断。値引き幅を決める判断。承認者を誰にするかの判断。このうちAIに渡せるのは過去案件の検索あたりで、値引き幅の決定は渡せない。単価表の選択は、どの条件のときにどの表を使うかというルールさえ書ければ渡せる部類に入ります。

ここまで分解すると、話の粒度が変わります。「見積作成の効率化」が「過去案件の検索と要約を自動化する」になる。実装できますし、効果も測れます。

判断を洗い出すとき、担当者に「どんな作業をしていますか」と聞いても出てきません。手が覚えている作業は、本人にとって当たり前すぎるからです。有効なのは「この仕事で、迷うのはどこですか」という聞き方で、迷いが発生する場所には必ず判断があり、迷うということはその判断の基準がまだ明文化されていないという証拠でもあります。さらに「迷ったとき、誰に聞きますか」「その人は何を見て決めていますか」と辿っていくと、判断基準が組織のどこに溜まっているかが見えてきます。たいていは一人か二人のベテランの頭の中です。

なお、どこから手をつけるかについて、前述のMITのレポートは顧客と接する業務より先にバックオフィスから着手すべきだと述べています。直感には反するかもしれません。AI活用というと問い合わせ対応や接客を思い浮かべる方が多いからです。しかし顧客に接する業務は間違えたときの損失が大きく、やり直しがききません。最初の一件で失敗すると、社内の空気が一年戻ります。

4. 「精度100%でないと使えない」で検討は止まる

対象が決まったら、次は合格ラインです。ここで止まる会社がかなりあります。

原因はほぼ一つ。現状の精度を測っていない。

「AIの精度が99%でないと業務に使えません」という発言は、検討の場でよく出ます。もっともに聞こえます。この発言が出たときに私が必ず聞き返している質問が、一つだけあります。いま、人がやっているときの精度は何%ですか、と。

答えられる会社は、ほとんどありません。そして実際に測ってみると、人間の作業も100%ではないことが分かります。転記ミスは起きるし、見落としもある。繁忙期は落ちます。比べる相手は100%ではなく、いまのやり方です。この基準に置き換えるだけで、判断できるようになります。

効果の見積もり方にも注意が要ります。マッキンゼーはコールセンター業務を例に、既存の業務フローを変えず特定の工程にAIを足すだけの場合は時間の削減が20〜40%程度、滞留案件の削減が30〜50%程度だとしています。では、AIが自律的に動く前提で業務プロセスそのものを設計し直した場合はどうか。最大8割の案件を自動で解決し、解決までの時間は60〜90%削減しうる、と。

この差は技術の差ではありません。いまのやり方を残したままAIを足すのか、いまのやり方を変えるのか、という差です。前者でも2〜4割は減ります。それで十分な場合も多い。しかし、経営が期待している数字が後者の水準なのに実行しているのが前者だとすれば、そのギャップは最初から埋まりません。

5. 兼務の一人に預けた仕組みは、だいたい半年で止まる

三つめが、最も軽視されていて、しかし結果を最も左右します。持ち主です。

導入したAIの仕組みには、必ず持ち主が要ります。運用していれば、うまく動かないケースが必ず出るからです。想定外の書式のファイルが来た。表現が変わって精度が落ちた。新しい商品が増えたのでルールを足す必要が出た。このとき直せる人がいないと、現場は静かに使うのをやめます。文句は出ません。元のやり方に戻るだけです。

多くの会社で、この持ち主は情報システム担当の兼務か、比較的ITに強い若手に落ち着きます。そして、その人の本業が忙しくなった瞬間に止まる。だいたい半年です。

誤解されがちですが、持ち主に求められるのは技術力ではありません。業務を知っていること、月に数時間でいいので業務時間として正式に時間が確保されていること、そして詰まったときに聞ける相手がいること。この三つです。「空いた時間でやっといて」は確保ではありません。それは放置です。

私たちが伴走という形を取っているのは、三つめを担うためです。前の二つは外部が肩代わりできません。業務を知っているのは社内の人だけですし、時間を確保する決定ができるのは経営だけです。

もう一点、現実的な話を。持ち主は一人だと危ういので、可能なら二人置くことをお勧めしています。理由は単純で、異動と退職があるからです。二人目は同じ熟練度である必要はなく、何をどう設定してあるかを説明できる程度で十分。月に1回、二人で30分だけ設定の中身を確認し合う時間があれば、少なくとも中身が誰にも分からなくなる事態は避けられます。

6. 前工程に、どれだけ時間をかけるか

「三つを決めるのに、どのくらいかかりますか」とよく聞かれます。

対象業務が一つであれば、関係者へのヒアリングと整理で2〜4週間が目安です。長い。そう感じられるかもしれません。もっとも、ここを2週間に圧縮したために、実装フェーズに入ってから3か月分の手戻りが発生し、結局トータルでは遅くなってしまった、という話は珍しくありません。

判断の目安として、三つの問いにそれぞれ紙1枚で答えられる状態を作ることをお勧めしています。この仕組みが扱うのはどの業務のどの判断か、渡さない判断はどれか。現状の処理時間と精度はどれくらいで、導入後の合格ラインはどこか。誰が持ち主で、月何時間を使い、詰まったときに誰に相談するか。紙3枚です。書ければ着手して問題ありません。

副産物もあります。社内の議論が具体的になることです。前工程を飛ばした会社の会議では「AIって結局どうなんですか」「もう少し様子を見ましょうか」という会話になり、誰も反対していないのに何も決まりません。判断する材料がないからです。三つが紙になっていると「対象は受注データの突合。合格ラインは現状の処理時間を半分にすること。持ち主は業務部の◯◯さんで月4時間」という具体に変わり、反対意見も具体的に出てきます。反対意見が具体的に出るのは、良い状態です。

7. 北海道の中小企業では、どこが詰まるか

道内の中小企業に当てはめると、三つの埋まり方に特徴が出ます。

対象は、むしろ絞りやすい。従業員30〜80名規模の会社では業務が細分化されていないので、「あの作業」と言えば全員に通じます。大企業のように関係部署を集めて業務の定義から擦り合わせる工程が、まるごと要りません。

難しいのは基準です。現状の処理時間を記録している会社が、ほとんどない。「たぶん一日2時間くらい」という感覚値しか出てこないため、導入後も「速くなった気はする」で終わってしまいます。道内で支援に入るとき、最初の2週間でやることの半分は現状を測る作業です。ストップウォッチを使う、というくらい原始的な工程で、正直あまり格好よくはありません。それでも、ここを飛ばすと後から効果を語れない。

最も詰まるのが持ち主です。人を増やせない前提があるので、誰が持つかは誰の仕事を減らすかとセットになります。月4時間を確保するために、その人の別の業務をどこかで削る。社長にしかできない調整です。

帯広のある農業法人では、ここで一度止まりました。担当候補の社員が繁忙期に入ると手が空かず、春から秋まで何も進まない。翌年、社長が「冬の4か月だけ、この人を事務から外す」と決めて再開したところ、そこからは一気に進んだと聞いています。止まっていたのは技術の問題ではありませんでした。北海道には季節の繁閑がはっきりした業種が多いので、持ち主の時間を年間で均等に確保しようとするより、閑散期にまとめて寄せてしまうほうが前へ進みます。

裏を返せば、社長が「この期間、◯◯さんのこの業務を外す」と一言決めれば、そこから先は進む。意思決定の層が薄いことは、この局面では利点です。

8. 最後に

成果が出ないとき、原因をツールやモデルに求めたくなります。無理もありません。実際、ツールを乗り換える会社も多い。しかし、乗り換えても同じ結果になるケースをたびたび見ています。

対象が決まっていない。基準が決まっていない。持ち主がいない。この状態でツールだけ乗り換えても、次に出てくるのは同じ報告書です。

逆に三つが書けていれば、ツールは後から選べます。技術は半年で入れ替わりますが、「自社のこの業務のこの判断を、この基準で、この人が持つ」という記述は、技術が入れ替わっても手元に残り続けます。

冒頭の役員の方には、更新を一度止めて前工程からやり直すことを提案しました。遠回りに見えるかもしれません。それでも、一年前に導入したものが期待外れだったとしても、その経験は無駄になっていないと思います。何が足りなかったかが分かった。これは前進です。

Blakistonでは、北海道の企業のAI活用について、業務の棚卸しから定着までのご相談を承っています。