羽根ペンと伊万里の器の間で開いた MacBook Pro を操作する若い書記を、老いた親方が導く様子を描いた油彩画。

Model Train

Mac を使いこなすモデルを育てる

企業がいま使っている Mac ソフトウェアのためのデータセットと、それで学習させた Qwen3.5-9B モデル。

データセット
450 タスク、15,854 ステップ
ベースモデル
Qwen3.5-9B
アクションスコア
0.33 → 0.77

データ

macOS、動画編集、Blender、Godot で特によく視聴されている 175 本のチュートリアルを、450 のタスクに変えました。クリック、キー入力、ドラッグのひとつひとつに、その理由と画面上の正確な位置を添えています。

ラベルはモデルが作成し、抜き取りで検査しています。1,015 ステップの抜き取り検査では、クリックの約 90% が正しい対象に当たり、操作の約 70% が完全に正しいものでした。

モデル

画面を読めて、しかも Mac 1 台で動くことから Qwen3.5-9B を選び、このデータセットで LoRA アダプターを学習させました。

固定した 477 ステップのオフラインテストで、アクションスコアは 0.33 から 0.77 に上がりました。これは公式ベンチマークではなく自社のオフラインテストで、改善の一部は回答の形式を覚えたことによるものです。

次に取り組むこと

実際のタスクでのライブ評価。次の操作が一致するかだけでなく、成功、失敗からの立て直し、無駄な操作もすべて数えます。

どの依頼も、まずお話を伺うところから。

どんな業務か、どんなデータをお持ちか、どこで動かす必要があるかをお聞かせください。2 営業日以内にご返信します。

プロジェクトの相談biz@random-walk.co.jp