结果边界
本控制台运行公开镜像测试。正式测试用例与逐条断言不公开,本地通过不代表正式评测成绩。
PRIVATE WORKBENCH
上传智能体,复现“生成—部署—Playwright”核心流程。
WORKSPACE / DYNAMIC EVALUATION
NEW RUN
RUN CONTRACT
RUN HISTORY
本控制台运行公开镜像测试。正式测试用例与逐条断言不公开,本地通过不代表正式评测成绩。
按顺序执行智能体、部署生成应用、启动 Playwright。生成项目必须包含 frontend/ 与 backend/。
使用 x86_64、Node 20.19.3、Playwright 1.57、单 Worker,并限制为 1 CPU 与 2 GB 内存。
正式分数同时取决于两个任务的综合通过率与模型开销。本地未接入官方 Meter,因此只展示通过率。
这里展示自建公开测试日志,便于调试。正式平台不会开放可能泄露隐藏测试的断言过程。
不要预置或硬编码任务答案,不要尝试推测、绕过隐藏测试或突破平台网络与资源限制。