しばらくAIエージェントについて読んできましたが、そのたびに同じ感覚に陥ります。制御されたデモでは印象的に見えても、実際のワークフローに適用しようとすると崩れてしまうのです。
見つけたチュートリアルのほとんどは、おもちゃの例(このPDFを要約、CSVについて質問に答える)か、あまりに抽象的で実際のビジネスプロセスにどうマッピングすればいいかわかりません。私のチームは、CRM、いくつかの内部ツール、そして誰も適切に文書化していない手動の引き継ぎステップにデータが散らばった、かなり複雑な営業オペレーションワークフローを扱っています。その一部でも処理できるエージェントのアイデアは魅力的ですが、十分な資金のあるエンタープライズパイロット以外では、その技術はまだそこまで来ていないと正直疑っています。
実際にノートブックに住む概念実証ではなく、本番環境で動作するものをデプロイした人はいますか?具体的に知りたいです:どのツールやプラットフォームを使ったか、実際にどのワークフローを引き継いだか、どこで壊れたり失望したか。誇大広告ではなく、実際にそのフラストレーションを経験し、何が現実かを教えてくれる人が欲しいのです。



ええ、実際にクライアント向けに本番環境でいくつか導入した経験から言うと、正直な答えは、デモと実際のワークフローの差はほぼ完全にデータの信頼性と判断境界にあり、AI自体にはありません。
デモがうまくいくのは、すべてがクリーンで範囲が限定されているからです。あなたの営業運用ワークフローには、CRMデータの乱雑さ、文書化されていない引き継ぎ、誰も書き留めていないエッジケースがあります。エージェントがそれに遭遇すると、先への道を幻覚するか、単に停止します。どちらも良くありません。
実際にうまくいった方法は、1つの引き継ぎステップから始めることです。最も面倒なもの、つまり誰かが手動で2つのツール間でコピーペーストしていたり、週に30回同じメールを書いているようなものです。ワークフロー全体を自動化しようとしないでください。まずはその1つの部分を本番で確実に動作させることです。それにより、ロジックを文書化する必要も生まれ、おそらくチームにも必要だったものです。
ツールについては、クライアントがセルフホストを希望する場合にはn8nをオーケストレーションに使用し、判断レイヤーにはOpenAIの関数呼び出しとカスタムロジックを組み合わせて使用しています。プラットフォームよりも、エージェントが独自に判断してよいことと、人間に戻す必要があることの境界をどれだけ明確に定義しているかの方が重要です。
どこで壊れるかというと、不完全な情報に基づく判断が必要な場合です。CRMレコードにフィールドが欠けていたり、2つのツールでデータが矛盾している場合、エージェントはそのケースを明示的に処理していなければ、自信を持って間違ったことをします。そして、すべてのケースを事前に処理することはできないので、本番で失敗をキャッチすることになります。それが現実です。
何かを構築する前にチームに尋ねるべき質問は、このタスクを実行するために新入社員が従う正確なルールを書き出せますか?もし答えがノーなら、エージェントはまだ問題ではなく、プロセスが問題です。