100万トークンの文脈管理と並列サブエージェントを組み合わせ、長時間の作業を外部ツールや画面操作へつなぐマルチモーダルAIが利用可能になった。Muse Spark 1.1は開発者向けAPIの公開プレビューでも提供される。
エージェント型モデルを開発者向けAPIで提供
エージェント型タスク向けのマルチモーダル推論モデルMuse Spark 1.1は、計画や推論の出力を外部ツールとコンピューター上の操作へ接続する。開発元のMetaは、ツール利用、コンピューター操作、コーディング、マルチモーダル理解を強化したモデルとして公開した。
開発者向けには、Muse Spark 1.1へ接続できるMeta Model APIの公開プレビューが始まった。モデルを外部のアプリや開発環境へ組み込むための提供経路が、モデルの公開と同時に用意された。
新しいツールを計画へ組み込み並列に委任
利用対象には、ネイティブツール、MCPサーバー、カスタムスキルが含まれる。Metaによると、Muse Spark 1.1は事前の例を与えられていない新しいツールにもゼロショットで対応し、作業へ組み込むという。
実行時には、メインエージェントが必要な文脈を集めて計画を作り、処理を並列のサブエージェントへ委任する。各サブエージェントは割り当てられた役割と利用可能なツールに沿って処理し、上位の判断が必要になればメインエージェントへ戻す。
100万トークンから後続作業に必要な情報を保持
長時間の作業を支えるのが、100万トークンのコンテキストウィンドウである。Metaによると、Muse Spark 1.1はこの領域を能動的に管理し、以前の作業から必要な情報を取り出す。
情報量が増えた場合は、後続の作業に必要な重要手順を残すよう文脈を圧縮する。この管理は複数のアプリにまたがる操作にも使われ、長いセッション中に情報や要件が変化しても文脈を維持し、更新された条件へ適応するとMetaは説明している。
スクリプトと直接操作を処理ごとに選択
コンピューターを動かす際、Muse Spark 1.1はすべての手順を一回ずつ画面上で処理する設計ではない。自動化が速い処理ではスクリプトを作り、直接操作が簡単な処理ではインターフェースを使うよう訓練されている。
選んだ操作方法では、各段階に必要な複数のアクションをまとめて生成する。Metaが示した夕食会手配の実演では、モデルが注文中に生じた状況変化を検出し、利用者の介入なしに注文内容を更新した。
画面上の不具合をコード修正と検証へ接続
コーディングでは、複雑なコードを対象に、不具合の診断と修正、新機能の実装、大規模なコード移行に対応するとMetaは説明している。画面から取得した状態を、コードの調査や編集に引き渡せることが、この作業の前提となる。
MetaがOpenCode上で示した実演では、Muse Spark 1.1がWebアプリを構築し、画面を自動撮影して利用者から見える不具合を特定した。さらに、問題に関係するコードを追跡して修正し、変更後の状態を検証するまでを連続して実行した。
動画の視覚情報をブラウザー操作へ引き渡す
マルチモーダル処理は、操作対象となる視覚情報と音声を調べ、その詳細を作業の後段まで保持する。Metaによると、Muse Spark 1.1は保持した情報を、利用者に代わってコンピューターを操作する際の入力として使う。
Metaが示したFacebook Marketplaceへの出品実演では、スマートフォンで撮影した動画から利用可能な商品写真を抽出し、映っている商品について推論した。その出力をブラウザー操作へ引き渡し、利用者に代わって出品を作成した。