しばらくAIエージェントについて調べてきましたが、そのたびに同じ感想を抱きます。制御されたデモでは印象的に見えても、実際のワークフローに適用しようとするとすぐに崩れてしまうのです。
AIエージェントの作り方に関するチュートリアルのほとんどは、おもちゃのような例(PDFの要約、CSVに関する質問への回答)か、あまりに抽象的で実際のビジネスプロセスにどう適用すればいいのかわかりません。私のチームはかなり複雑な営業オペレーションワークフローを扱っており、データはCRM、いくつかの内部ツール、そして誰も適切に文書化したことのない手動の引き継ぎステップに分散しています。その一部でも処理できるエージェントのアイデアは魅力的ですが、十分な資金のあるエンタープライズパイロット以外では、その技術がまだそこまで達しているとは正直懐疑的です。
実際にノートブックに留まらない、本番稼働しているものをデプロイした人はいますか?具体的な情報が欲しいです:どのツールやプラットフォームを使ったか、実際にどのワークフローを引き継いだか、どこで壊れたり失望したか。誇大広告ではなく、実際にそのフラストレーションを経験し、何が現実かを教えてくれる人が欲しいのです。



ええ、実際にクライアント向けに本番環境でいくつか出荷した経験から言うと、デモと実際のワークフローの差は、ほぼデータの信頼性と判断境界にあり、AI自体にはありません。
デモがうまくいくのは、すべてがクリーンで範囲が限定されているからです。あなたの営業オペレーションワークフローには、CRMデータの乱雑さ、文書化されていない引き継ぎ、誰も書き留めていないエッジケースがあります。エージェントがそれに遭遇すると、先への道を幻覚するか、単に停止します。どちらも良くありません。
実際に効果があったのは、最も面倒な引き継ぎステップ、つまり誰かが手動で2つのツール間でコピーペーストしたり、週に30回同じメールを書いたりしているステップから始めることです。ワークフロー全体を自動化しようとしないでください。まずはその1つの部分を本番で確実に動作させることです。それにより、ロジックを文書化する必要も生じますが、おそらくチームにはそれが必要でしょう。
ツールに関しては、クライアントがセルフホストを希望する場合にはn8nをオーケストレーションに使用し、判断レイヤーにはOpenAIの関数呼び出しとカスタムロジックの組み合わせを使用しました。プラットフォームよりも、エージェントが独自に判断してよいことと、人間に戻す必要があることの境界をどれだけ明確に定義しているかの方が重要です。
問題が発生するのは、不完全な情報に基づく判断が必要な場合です。CRMレコードにフィールドが欠けていたり、2つのツールでデータが矛盾している場合、エージェントはそのケースを明示的に処理していなければ、自信を持って間違ったことをします。そして、すべてのケースを事前に処理することはできないので、本番で障害に遭遇することになります。それが現実です。
何かを構築する前にチームに問うべき質問は、新人がこのタスクを実行するための正確なルールを書き出せますか?もし答えがノーなら、エージェントはまだ問題ではなく、プロセスが問題です。