2023年の終わりごろ、北海道のある会社の社長から「全社員にChatGPTのアカウントを配った」と聞きました。先進的だと思いました。その2年後、同じ社長に使われ方を尋ねたところ、「使っている人間は3人くらいですかね」という返事でした。

珍しい話ではありません。似た話をいくつも聞いています。ツールは入っている。担当者も困っていない。経営者は「うちはもうAIを入れている」と言える。それなのに業務の形は、配る前と何ひとつ変わっていない。

この2年で、ここを抜け出した会社とそうでない会社の差が、かなりはっきり見えるようになってきました。そして差を作ったのは、使っているAIの賢さではなかった、というのが私の見立てです。

この記事では、最近よく聞くようになった「AIエージェント」という言葉が実際に何を指しているのかを整理したうえで、チャット止まりの会社と業務が動き出した会社で何が違っていたのかを、公開されている調査をもとに考えてみます。

目次

  1. 導入率8割、収益貢献はほぼゼロという奇妙な状態
  2. チャットとエージェントの間にあるもの
  3. 動き出した会社は、作業ではなく段取りを渡していた
  4. 渡していい仕事を見分ける三つの条件
  5. 止まる会社が信じている三つのこと
  6. 北海道の会社は、どこで止まっているか
  7. 最後に

1. 導入率8割、収益貢献はほぼゼロという奇妙な状態

最初に、少し気が楽になる数字を置いておきます。成果が出ていないのは、おそらくあなたの会社だけではありません。

マッキンゼー・アンド・カンパニーの調査によれば、8割近い企業が何らかの形で生成AIを導入している一方、8割を超える企業が「収益への目立った貢献はない」と答えています。同社はこの状態を gen AI paradox と呼んでいます。導入はした、ただし儲かってはいない、という状態が世界中で同時に起きているわけです。

The state of AI in 2025: Agents, innovation, and transformation(McKinsey & Company)
https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai

MITの研究プロジェクト「NANDA」が2025年に公表したレポートは、もう少し厳しい言い方をしています。企業の生成AI投資は300億〜400億ドルに達しているのに、95%の組織がリターンを得られていない。業務フローに本当に組み込まれてスケールしている企業は5%にとどまる、と。

The GenAI Divide: STATE OF AI IN BUSINESS 2025(MIT Project NANDA, 2025)
https://www.artificialintelligence-news.com/wp-content/uploads/2025/08/ai_report_2025.pdf

この数字を見て「やはりAIは過大評価だった」と結論を出したくなる気持ちは分かります。もっとも、同じレポートはその5%が数百万ドル規模の価値を引き出していることも併記していて、そこを読み飛ばすと話を見誤る。できている会社は、すでにできているのです。

そして私がいちばん面白いと思ったのは、5%と95%を分けたものは何だったのか、という部分です。レポートは、分断を生んでいるのは学習と業務への統合であって、モデルの品質ではないと明言しています。つまり、両者が使っているAIはほとんど同じものだということになります。

2. チャットとエージェントの間にあるもの

「AIエージェント」という言葉が、この一年で急に増えました。定義が固まりきっていないぶん、売り手によって指すものがばらつきます。商談の場で同じ言葉を使いながら、お互い違うものを思い浮かべている、という場面に何度か出くわしました。

私たちが日常的に使っているAIチャットは、基本的に受け身です。聞かれたことに答える。文章を書く。指示がなければ何も起きません。

一方、エージェントと呼ばれるものには自律性と目標志向があります。目標を与えると人の介入を最小限にして自分で動き、答えを返して終わりにせず、目的が達成されるところまでを見て段取りを組み、必要な道具を使い、手順を進めていきます。「この資料を要約して」がチャットの仕事だとすれば、「競合3社の直近の動きを調べて、来月の営業会議用に論点を3つ立てて」がエージェントの仕事になります。後者には、調べる順番を決め、情報を取りに行き、足りなければ追加で調べ、最後に形にまとめる、という段取りが丸ごと含まれています。

この「段取りをするAI」は、技術的にはさらに二つに分かれます。AI開発企業のAnthropicは、あらかじめ人間が定義した処理の道筋に沿ってAIと外部ツールが連携するものをワークフロー、AI自身がプロセスとツールの使い方を動的に決めるものをエージェントと呼び分けています。手順書どおりに走るのがワークフロー、手順そのものを自分で考えるのがエージェント、と言い換えてもいいと思います。

Building effective agents(Anthropic)
https://www.anthropic.com/engineering/building-effective-agents

誤解されやすいのは、エージェントのほうが上位だという思い込みです。上下ではありません。「せっかくやるならエージェントで」という発想は、たいてい遠回りになります。毎回同じ順番で処理してほしい、記録が残ってほしい、監査に耐えてほしい。そういう業務にはワークフローが向いていて、自分で考えるAIを置く理由がありません。毎回違う動き方をされると、むしろ困ります。逆に、正解が一つに決まらず状況によって進め方が変わる業務では、エージェントの柔軟さが意味を持ってきます。

ちなみにAnthropic自身も、可能なかぎりシンプルな解を探し、必要になったときにだけ複雑さを足すべきだと書いています。開発している当事者がそう言っているという事実は、それなりに重く受け止めていいところだと思っています。

もう一点、検討段階で聞いておいたほうがいい話があります。エージェントは運用コストがかかります。Anthropicは自社のリサーチ機能を複数のAIが分担して動く構成で作った経緯を公開していて、性能は上がったものの消費するトークン量は通常のチャットの約15倍に達したと報告しています。自律的に動くというのは、人が見ていないところで何度も考えるということなので、当然そうなります。

How we built our multi-agent research system(Anthropic)
https://www.anthropic.com/engineering/multi-agent-research-system

やめましょうという話ではありません。人が3時間かけていた調査が20分で終わるなら、多少の利用料は誤差です。問題は順番で、単価が15倍になっても割に合う業務かどうかを着手前に一度考えておかないと、全社に開放した翌月の請求書で止まることになります。

3. 動き出した会社は、作業ではなく段取りを渡していた

ここからが本題です。

チャット止まりの会社と業務が動き出した会社。両者の違いをひとことで言うなら、渡したものが作業だったか段取りだったか、という差だと感じています。

チャット止まりの会社は、AIに作業を渡しています。「このメールの文面を整えて」「この議事録を要約して」。これは確かに便利で、一回あたり数分は浮きます。しかし、浮いた数分は業務フローのどこにも蓄積しません。作業の前後、つまり誰がいつそれを始めるか、終わったものをどこに置くか、次に誰が見るか、という部分は人間が手で運んでいるままだからです。

業務が動き出した会社は、段取りごと渡しています。「月初に前月の受注データを集めて、前年同月と比較して、差が大きい品目について理由の候補を挙げ、指定のフォーマットにまとめる」。ここまで渡すと、人間の作業は出てきたものを読んで判断するだけになります。

このとき、渡していないものがあります。判断です。「差が大きい品目について理由の候補を挙げる」までがAIの仕事で、「その理由を採用して手を打つかどうか」は人間の仕事。この線引きがはっきりしている会社ほど、現場が安心して使っています。逆に「AIが判断してくれる」という触れ込みで入れた仕組みは、現場が結果を信用できず、結局すべて人が見直すことになり、二重作業だけが残ります。

前章で触れたMITのレポートには、もうひとつ示唆的な数字があります。外部パートナーと組んだ導入は約3分の2が成功する一方、社内だけで作った場合の成功率は約3分の1にとどまる、というものです。内製は外部連携の2倍つまずきやすい、と読めます。

これは技術力の差だけではないだろう、というのが私の推測です。社内だけで進めると、「この業務のこの判断はAIに渡してはいけない」という線引きを、業務を熟知しているがゆえに曖昧にしてしまう。外から入る人間はそこを聞かざるを得ないので、結果的に線が引かれる。そういうことではないかと思っています。もっとも、これは調査から読み取った仮説であって、証明されたものではありません。

4. 渡していい仕事を見分ける三つの条件

では、どの仕事なら渡していいのか。私たちは三つの条件で判定することをお勧めしています。三つ揃っている業務から着手すると、まず失敗しません。

一つめは、言語化できるか。その仕事の手順と判断基準を、業務を知らない人に文章で説明できるかどうかです。ここで言う言語化は「請求書を処理する」といった粒度ではありません。「金額が10万円を超えたら部長承認に回す」「備考欄に納期の記載があれば、注文書の納期欄より優先する」。このレベルまで書けるか、という意味です。書けない部分は、ベテランの頭の中にある暗黙知です。

二つめは、間違いに気づけるか。AIが間違えたとき、それを間違いだと判別できるかどうか。ここが最も見落とされます。要約業務が典型例で、AIが作った要約が正しいかどうかを確かめるには結局もとの文章を読むしかなく、それでは時間は浮きません。一方、合計金額の転記なら元帳と突き合わせれば一瞬で分かります。照合できる相手がいる仕事は渡しやすい仕事だ、と覚えておくと選定が速くなります。

三つめは、やり直しがきくか。社内向けの資料作成は間違えても直せば済みますが、顧客への見積提示や在庫の自動発注はそうはいきません。最初の一歩は可逆な業務から選ぶ。慎重すぎるように見えるかもしれませんが、失敗を許容できる場所で経験を積んだほうが、結果的に早く進みます。

三つ揃わない業務を諦める必要はありません。条件のほうを作りにいきます。言語化できていないなら棚卸しから始める。検証できないなら、AIに確信が持てない箇所を自己申告させて、そこだけ人が見る仕組みにする。可逆でないなら、最終送信の前に人の承認を挟む。

この三条件は、検討会議でそのまま使えます。「これは言語化はできているけど、検証手段がないですね」という会話ができるようになると、議論が一気に具体的になります。

5. 止まる会社が信じている三つのこと

現場でよく見かける思い込みを、三つ挙げておきます。

ひとつめ。賢いモデルを選べば解決する、という考え方。モデル選定に時間をかける会社ほど進みが遅い、というのが実感です。前述のとおり、成果を分けているのはモデルの品質ではありません。同じモデルを使って、成果が出ている会社と出ていない会社が並存しています。モデルの性能は今後も上がり続けますが、性能が上がっても「自社の業務がどう流れているか」は誰も教えてくれません。そこは自社で書くしかない領域です。

ふたつめ。配れば誰かが使い方を見つける、という期待。全社にアカウントを配り、研修を一度やり、あとは現場の工夫に任せる。この進め方が機能するのは、もともとITリテラシーが高く業務の裁量も大きい組織に限られます。多くの会社では現場は自分の業務で手一杯で、「空いた時間に使い方を考えてください」は実質的に「やらなくていい」と同じ意味になります。

みっつめ。スモールスタートという言葉。方針としては正しいのですが、小さくしすぎると成果も小さすぎて次の判断材料になりません。月に2時間しか発生していない業務を自動化しても、浮くのは月2時間。経営会議で「で、いくら得したの」と聞かれて答えられず、結果として次の予算がつかない。選ぶべきは、頻度が高く、担当者が複数いて、手順がほぼ同じ業務です。一人が月1回やる仕事より、五人が週1回やる仕事のほうが、同じ労力で効果が20倍になります。

6. 北海道の会社は、どこで止まっているか

道内でこの手の相談を受けていると、止まっている場所がよく似ています。だいたい同じです。

いちばん多いのは、全社にアカウントを配ったところで終わっているケースです。本州の大企業と違い、配ったあとに使い方を整備する専任がいません。情報システムの担当者は基幹システムの保守で手一杯、現場は現場で人が足りない。そうして「配った」が「やった」に見えているうちに、半年が過ぎます。冒頭の社長の会社も、おそらくここです。

もうひとつ、道内特有だと感じるのが相談相手の少なさです。札幌はまだしも、旭川や釧路、帯広まで行くと、AIエージェントの導入について具体的に話せる相手が社外にほとんどいません。東京のベンダーに声をかけると、返ってくるのは大企業向けの体制論。情報だけが増え、判断は後ろへ倒れていく。

とはいえ、不利な点ばかりではないとも思っています。道内の中小企業は社長と現場の距離が近く、「この業務をAIに渡してみよう」と決めてから着手するまでが驚くほど速いことがある。旭川のある金属加工会社では、全社に配ってから3か月でログインしているのは2割でしたが、営業部の見積業務に絞って「過去の類似案件を探して仕様の差分を出す」という段取りだけを渡し直したところ、決めたのは朝の打ち合わせ、着手はその週でした。大企業なら稟議に二か月かかる判断です。速い。

北海道でAI活用を前に進める要点は、体制を整えることではなく、決めるのが速いという強みをそのまま最初の一業務に向けることではないかと考えています。配ってから考えるのをやめ、一業務を決めてから配る。順番を入れ替えるだけで、道内の中小企業は本州の大企業より速く動けます。

7. 最後に

AIエージェントは魔法の道具ではありません。段取りを渡せば動きますが、段取りが書かれていなければ何もできません。段取りを書くのは、いまのところ人間の仕事です。

逆に言えば、自社の業務がどう流れているのかを整理しておく作業は、技術がどれだけ進化しても無駄になりません。モデルは半年で入れ替わりますが、「自社の仕事はこう流れている」という記述は残ります。むしろモデルが賢くなるほど、その記述の価値は上がっていくはずです。

冒頭の社長とは、その後もう一度お会いしました。いまは受注データの集計だけをAIに渡していて、月に6時間ほど浮いたそうです。たった6時間、とも言えます。劇的ではありません。それでも、配った2年前より確実に前へ進んでいます。

チャットで止まっている状態は、失敗ではないと思います。次に何を渡すかを、まだ決めていないだけです。

Blakistonでは、北海道の企業のAI活用について、業務の棚卸しから定着までのご相談を承っています。