一幅油画:一位老师傅指导一名年轻书记员,书记员在羽毛笔和伊万里瓷杯之间操作一台打开的 MacBook Pro。

Model Train

教模型使用 Mac

一份面向企业当下所用 Mac 软件的数据集,以及在其上训练的 Qwen3.5-9B 模型。

数据集
450 个任务,15,854 个步骤
基础模型
Qwen3.5-9B
动作得分
0.33 → 0.77

数据

我们把 macOS、视频剪辑、Blender 和 Godot 方面观看次数最多的 175 个教程,变成了 450 个任务:每一次点击、按键和拖动,连同原因和屏幕上的准确位置。

标注由模型生成,并通过抽样审核。在对 1,015 个步骤的抽查中,约 90% 的点击落在正确目标上,约 70% 的操作完全正确。

模型

我们选择 Qwen3.5-9B,是因为它能读懂屏幕,又能在单台 Mac 上运行;然后在这份数据集上训练了一个 LoRA 适配器。

在一套固定的 477 步离线测试中,它的动作得分从 0.33 提高到 0.77。这是我们自己的离线测试,不是官方基准,其中一部分提升来自模型学会了答案格式。

下一步

在真实任务上做实时评估:成功率、出错后的恢复和多余的操作都要计入,而不只是看下一步动作是否一致。

每一件委托,都从一次谈话开始。

告诉我们要做的工作、你手里有哪些数据、模型需要在哪里运行。我们会在两个工作日内回复。

洽谈项目biz@random-walk.co.jp