Snorkel AIは、エージェントを訓練するための模擬職場を販売している。環境には企業の記録、ツール、規則が組み込まれ、エージェントの操作と結果が採点される。

9月22日、Snorkelは評価額35億ドルで3億5,000万ドルのシリーズEを調達したと発表した。新しいのは資金調達であり、製品の方向性ではない。Snorkelは2025年に環境構築の手法を説明しており、現在のData Seriesでは損害保険の引受業務と金融のシミュレーションを掲載している。この資金調達は、専門家の業務知識を訓練・評価基盤に変換する既存事業を後押しする。

大きな変化

  • 何が変わったか:訓練データの提供企業が、企業業務のシミュレーションを販売できるようになった。成功するには、利用可能なツールと記録を使って一連の業務を完了する必要がある。
  • なぜ重要か:環境を構築する人が、適切な業務の定義にも関わる。規定のしきい値、必須の承認、データベースの更新は、どの行動を評価し、どれを退けるかを決めるシグナルになる。そのため、専門領域の判断は最終確認だけでなく訓練にも入力される。
  • 今後の注目点:Snorkelはオープンベンチマーク向け助成を拡大すると述べている。商用環境では、ツール、規則、例外が購入企業の実務にどれほど近いかが重要だ。シミュレーション上の成功は、構築された業務の想定に照らして判定されるためだ。

模擬企業を構成するもの

静的なデータセットでは、質問と望ましい回答を対応させられる。環境には操作とその結果も加わる。エージェントはツールを選び、起きたことを確認して、次の行動を決める。データベースが更新されたり、模擬ユーザーが不足情報を補ったり、規則に基づいて担当者への引き継ぎが求められたりする。

Snorkelが8月に説明したエンタープライズ環境では、回答だけでなく、実行後のシステム状態、権限、承認、証拠を集める過程も評価するとしている。そのため、完了したと回答しても、基盤の記録が変わっていなければ失敗と判定されることがある。

現在のEnterprise Environments製品ページには、損害保険の引受業務と金融が提供中の環境として掲載され、それぞれに数千のタスクと模擬ユーザーが含まれる。これらは訓練用の成果物だ。

同じ成果物は、関連する二つの用途に使える。チームは反復可能なタスクでエージェントを評価できる。また、タスクと報酬シグナルを強化学習のループに組み込み、成功した行動が後続の行動に影響するよう訓練することもできる。

規則も製品の一部

Snorkelによると、専門家が業務フローと成功基準を定め、エンジニアがツールとデータを構築する。検証器が作業を採点し、オラクルエージェントが妥当な手順が存在するか確認する。

企業固有の規則に対応するには、エージェントは一般的な業界知識だけに頼らず、環境を調べなければならない。

環境の作成者は、どの例外を重視するか、何を完了とみなすか、どの別経路を許容するかを決める。購入側と専門家は、こうした選択が実際の業務を反映しているかを確かめる必要がある。

管理されたテストには境界がある

Snorkelの2025年の技術解説によると、環境では実際のシステムを代表するサービスやスキーマを使い、稼働中のシステムの代わりに合成データまたは匿名化データを用いる。この管理された条件により、顧客記録に触れずにタスクを繰り返し、データベースの変更を確認し、禁止された操作をテストできる。

この結果から分かるのは、組み込まれた業務フローに対する性能だ。Snorkelの公開ページは、タスクの構築と検証方法を説明しているが、商用シミュレーションのスコアと、実際の保険引受や金融業務における信頼性との関係を示す独立研究は掲載していない。本番で使えるかどうかは、シミュレーションが実際のツール、データ、例外的な状況を正確に捉えているかにも左右される。

今回の資金調達が支えるもの

Snorkelは当初、ラベル付きデータセットの開発システムとして始まった。現在は専門知識を環境、評価器、訓練タスクとして提供している。この転換によって、AIスタックに業務そのものを構築した要素が加わる。エージェントが適切に作業したかを判定する規則も含まれる。

専門家にとっては、タスクの定義と検証がモデル開発に近づく。購入側にとっては、仕様の品質も購入判断の一部になる。SnorkelはOpen Benchmarks Grantsプログラムを拡大すると発表しており、環境の構築と採点をより多く公開検証できる可能性がある。ただし、資金調達の発表では、次回の助成対象や条件は明らかにされていない。