
Model Train
教 模型 使用 Mac
一份面向企业当下所用 Mac 软件的数据集,以及在其上训练的 Qwen3.5-9B 模型。
- 数据集
- 450 个任务,15,854 个步骤
- 基础模型
- Qwen3.5-9B
- 动作得分
- 0.33 → 0.77
数据
我们把 macOS、视频剪辑、Blender 和 Godot 方面观看次数最多的 175 个教程,变成了 450 个任务:每一次点击、按键和拖动,连同原因和屏幕上的准确位置。
标注由模型生成,并通过抽样审核。在对 1,015 个步骤的抽查中,约 90% 的点击落在正确目标上,约 70% 的操作完全正确。
模型
我们选择 Qwen3.5-9B,是因为它能读懂屏幕,又能在单台 Mac 上运行;然后在这份数据集上训练了一个 LoRA 适配器。
在一套固定的 477 步离线测试中,它的动作得分从 0.33 提高到 0.77。这是我们自己的离线测试,不是官方基准,其中一部分提升来自模型学会了答案格式。
下一步
在真实任务上做实时评估:成功率、出错后的恢复和多余的操作都要计入,而不只是看下一步动作是否一致。