需求澄清
把客户“想看一个整体倾向”转译为输入、处理、输出与验收。证据:企业年报文本分析。
四类能力分别对应真实交付、评测任务与受控工作流中的项目证据。
把客户“想看一个整体倾向”转译为输入、处理、输出与验收。证据:企业年报文本分析。
明确模型、规则、界面与人工复核各自负责什么。证据:费用预检与 Text2SQL。
将依赖缺失、工具失败和结果不可验证纳入方案。证据:客户环境适配与模型评测。
以客户独立使用、结构化导出和验收结果确认完成范围。证据:真实付费交付。
付费外部委托|客户独立运行成功|明确验收并付款|客户资料保密
客户需要从若干上市公司年报中筛选指定主题语句并识别情感态度,但没有指定技术实现。我负责把重复性文本处理收束为可批量输入、可结构化导出、可由非技术用户独立操作的桌面交付。
课程模拟|规则审核前的证据检查|评测不达门槛,停止扩围
FLAG,并给出人工补证动作。FLAG 的处理规则。我把范围限定为规则审核前的证据检查;证据缺失或冲突进入人工补证。30 条样本的决策准确率为 63.33%,低于自定 80% 门槛,因此停止扩围并保留人工复核。
FLAG → 人工补证或核实三类项目分别保留自己的验证状态,用于补充任务评测、受控工作流与公开发布证据。
任务:在 OpenClaw 与 Hermes 两种执行环境下,对 5 个代号模型执行 3 类复合任务,检查工具调用、文件处理、代码执行、数据分析与产物保存。
任务:将自然语言查询拆成意图澄清、Schema 检索、SQL 生成、预校验、人工审批、执行、重试与审计。
任务:将营养咨询拆为用户档案、目标计算、每日记录、进度看板、场景建议与周期复盘,覆盖 12+ 健康管理场景。
三条原则分别约束交付范围、失败处理和完成标准。
从输入、处理、输出与验收开始,用最小版本验证链路,再按真实需求扩展。
依赖缺失、工具失败、结果不可验证都需要明确的处理方式和责任边界。
运行结果、操作指南与客户验收比“功能已做出”更接近真实交付标准。
我希望参与 AI 方案的需求澄清、方案拆解、运行验证与交付闭环,让业务目标能够落到可运行、可验收的结果。