大模型再聪明也得刷题,OpenAI前研究员创业卖数据
据动察 Beating 监测,OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。
Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。
更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。
他的办法是生成接近真实科研的数据和问题,同时保留已知答案。模型可以自由探索,训练系统也能明确判断对错。
GeneBench-Pro 就采用了这套方法。该评测包含 129 项计算生物学任务,GPT-5.6 Sol Pro 的通过率只有 31.5%。
新公司还会制作培养皿、Western blot 等实验图像的训练数据,之后再扩展到化学、材料、医疗和办公室工作。
Ho 预计,前沿 AI 实验室未来将为精准训练数据投入超过 1000 亿美元。