乖宝 × 汉得 · 犬猫采食行为视频 AI 多模态分析 POC
远程离线 · 10 人天 · ¥50,000(含税 6%)· 文档 V1.0
7 标签 40 段 A 级盲测 答案隔离 非生产承诺

任务发布首页

把合同交付整理成可执行任务包:需求(PRD)、实施路径、前端原型、验收门槛。左侧切换模块;清单可勾选,状态保存在本机浏览器。

P0→评分
四阶段门禁推进
FR × 14
研发功能需求
G0–G6
前置门槛后才谈通过

本期一句话目标

在固定场地 / 主机位 / 食物区域 / 单猫离线视频上,验证自动预标注、4Hz 时间事件、证据留存与人工复核链路;A 级盲测达标则 POC 通过,仅代表可继续工程化,不代表生产能力已验证。

In Scope

  • 7 标签 + T0 / 采食起止 / 有效区间 / 抬头 / 总时长
  • 输入检查、难度分级、版本冻结、盲测批处理
  • 证据包 + 评估报告 + 数据管理/单视频验证前端

Out of Scope

  • 犬类、多猫身份、尾巴/声音/健康异常等
  • 实时流、高并发、生产系统集成与 SLA
  • 跨场地/机位/品种总体准确率外推

建议阅读顺序

1) PRD → 2) 执行计划 → 3) 前端原型 → 4) 验收门槛 → 5) Kickoff 勾选开工

PRD · 研发需求

研发向产品需求摘要。完整 Word 版可另发;此处突出可开发条目。

成功标准

G0–G6 全满足,且 7 标签 / 采食时序 / 抬头 / 证据达到数值门槛 → 结论「通过」。另有「不通过」「测试无效」。

功能需求

ID功能要点优先级
FR-01输入检查规格/完整性/越界标记P0
FR-02难度分级预测前冻结 A/B/C,禁止回改P0
FR-03T0鼻部首次进入食物观察区首帧P0
FR-044Hz 时序0.25s;候选窗须带时间戳证据P0
FR-05采食区间开始/结束或右截断/区间/总时长P0
FR-06抬头事件列表+次数;IoU≥0.5 匹配P0
FR-077 标签缺证据不得默认补齐P0
FR-08无法观察显式原因,禁止静默默认值P0
FR-09证据生成视频/机位/起止/片段或帧P0
FR-10离线批处理冻结版本跑 40 段,失败也留痕P0
FR-11版本冻结模型/代码/提示词/环境哈希P0
FR-12自动评分按合同门槛出结论材料P0
FR-13前端界面数据管理 + 单视频验证P0
FR-14评估报告分层统计、限制、下阶段建议P0

事件定义(实现口径)

T0 / 采食 / 抬头 / 总时长
  • T0:食物放置完成且猫鼻部第一次进入预先标定食物观察区域的首帧。
  • 有效采食开始:到达食物区后持续明确的食物导向采食。
  • 有效采食结束:末次明确采食后 20s 未恢复;不足 20s 则右截断/无法观察。
  • 抬头:抬头前有有效采食;离区 ≥2s;之后恢复有效采食。
  • 总时长:各有效区间之和,禁止首末跨度代替。

最小输出 schema(单视频)

{ "video_id": "V-0017", "labels": ["平静进食", "抬头"], "T0": "00:00:08.000", "feed_start": "00:00:12.250", "feed_end_or_right_truncated": "00:00:48.000", "feed_intervals": [{"start":"...","end":"..."}], "headup_events": [{"start":"...","end":"..."}], "headup_count": 2, "feed_total_duration_s": 29.5, "unobservable": null, "evidence": [{ "target": "headup#1", "t_start": "...", "t_end": "...", "uri": "..." }] }

执行计划 · 阶段门禁

按合同服务环节推进。阶段输出签字/电子签后进入下一阶段;书面报告默认 5 个工作日答复。

阶段关键动作输出建议人天
P0 就绪视频/真值/GPU 检查;4Hz 试跑;越界清单输入检查、覆盖矩阵、环境预检2
P1 冻结8–12 校准视频确认定义与参数;冻结版本哈希冻结配置包2
P2 盲测40 段同版本批处理;答案隔离结构化结果、日志、证据3
评分评审对照裁决真值评分;报告与建议评分、裁决记录、总结报告2+1

环境基线(甲方提供 GPU 权限)

GPU:H100/H800/A800 ≥80GB(优先 H100)
CPU≥16 核(荐32)· 内存≥96GB · NVMe≥3.84TB
Linux · vLLM 0.20.x · CUDA 12.9+
单 VLM 并发;SAM/第二模型/回归串行

盲测前必须校准回归并冻结实机快照。A800 等无法复现 NVFP4 时,改用等效可运行配置并回归通过后再盲测。

分工

角色职责
甲方标签/口径确认;校准+40A 盲测+标定+裁决真值;真值隔离;争议复核
乙方执行环境预检、4Hz、冻结、批处理、证据与报告;如实记录失败/无法观察
双方临界定义与匹配争议;确认 POC 结论

前端原型 · 可点选预览

合同交付:视频数据管理 + 单视频标注/结果验证。以下为交互示意(非生产代码)。

采食行为 POCfreeze: — · 隔离: ON
工作台数据集任务报告
校准
10/12
盲测
40/40 齐套
G 门槛
G0 进行中
待办:GPU 预检未完成 · 标签「拒绝进食」正例仅 6/8 · 2 段完整性失败

MVP 完成定义

  • 可导入校准/盲测并出覆盖矩阵与越界列表
  • 单视频多轨道 + 结果 Tabs + 证据跳转
  • Runs 跟踪 40/40;冻结前真值对算法角色隐藏
  • 可导出分层统计报告

验收门槛与指标

前置门槛 G0–G6

ID门槛通过条件
G0启动校准集、40A、真值裁决、GPU 预检、4Hz、版本冻结完成
G1合格集40 段 A 级满足输入与构成
G2覆盖每标签≥8正/负;抬头事件≥20;≥36正常结束+4右截断
G3隔离预测冻结前算法执行未读真值
G4记录40/40 有结果(含失败)
G5证据100% 预测事件有完整证据
G6有效输出≥32/40 可评分核心结果

核心指标(摘要)

7 标签
每标签 P/R/F1≥0.80;Macro-F1≥0.80;集合/数量一致≥32/40;MAE≤0.5
采食时序
开始±3s≥32/40;结束±3s≥29/36;总时长阈值≥29/36;右截断4/4
抬头
P/R/F1≥0.80;边界中位≤0.5s,P90≤1.0s;次数全对≥32/40;IoU≥0.5
结论
通过 / 不通过 / 测试无效(覆盖或隔离不满足)

交付清单

    Kickoff 检查清单

    勾选进度保存在本机 localStorage,刷新不丢失。

    完成度:0%