案例 方法 服务 ← 主站 联系
FDE — FORWARD DEPLOYED ENGINEER · INDEPENDENT

把 AI 从 Demo
搬进生产线。

独立 FDE,一人负责,无中间层。
交付可运行、可量化、可维护的 AI 系统——
方法论全部来自公开研究,结果全部接受 benchmark 检验。

202/202
50 任务 agentic benchmark,子任务全通过
96 : 76
消融实验:演绎式规则生成 > 归纳式规则学习
25.9%
维度直查路由带来的推理深度提升
6/7
BSD 研究中强共振假设的后续验证存活率
1,682
单次研究战役的工具调用次数(43 runs / 302 skills)
13
Zenodo 预印本,方法论全部公开
01

案例
证据,不是承诺

01

用多模型 AI 系统做数学发现

领域:计算数论(BSD 猜想)· 角色:研究系统的设计者与指挥者

问题

BSD 猜想是千禧年难题之一。在 Cremona 数据库的海量
椭圆曲线上,需要同时做大规模计算、模式发现和假设证伪——
任何单一模型都无法独立完成。

做法

43 次运行、302 个 Skill、1,682 次工具调用。
探索模式下多模型发散共振产生假设(13 条标注),
确定性计算完成证伪。共振最强的假设 6/7 存活。
一个决定性事实由确定性模式发现后,探索模式生成解释,
43 小时内写出三篇论文。

可验证的结果

8 篇计算数论论文发表于 Zenodo;
完整方法论另写成纵向案例研究(Part 4),
包括 AI 起草层的全部捏造记录——公开,不是回避。

这证明的

在「答案不存在于任何训练数据」的问题上,
这套系统能产出经受住验证的新知识。
你的业务问题,大概率比 BSD 猜想容易。

02

eVoiceClaw:从零到四条产品线的全栈交付

领域:消费级 AI 产品 · 角色:唯一开发者

交付物

交付物:eVoiceClaw——iOS 18 语音助手(Swift 5.9),多提供商可切换
(Claude / OpenAI / Gemini / 自建 CrewAI 后端),多 Agent 协同;
Desktop——多 Agent 协同工作台,维度直查路由的生产实现;
Pro——完全本地化的专业知识库(本地模型 + 向量检索 + 本地 TTS),
面向医生、工程师等数据敏感职业;
Cerebellum——端侧「小脑」模型,负责语义路由、隐私感知、
安全审查,让数据不出设备。

这证明的

不是只会写论文的研究者。
从 Swift 前端到 Python 后端到 Agent 编排到端侧模型,
全链路一个人交付过——你的项目里没有我没见过的层。

03

用 Benchmark 替代「凭感觉」

领域:AI 系统评估 · 角色:评估体系设计者

做法

自建 50 任务多维度 Agent 评估数据集,覆盖代码构建、
信息检索、多步推理。支持多模型横向对比、路由策略
AB 测试、双模式(确定性/探索性)独立评估。

可验证的结果

同一系统在不同编排策略下的表现差异可量化——
演绎式规则生成 96/100,归纳式规则学习 76/100。
「让合适的模型做合适的事」不是口号,
是每次都有数字支撑的决策。

这证明的

我给你做的每个选型建议,
都会附带可复现的测量方法,而不是「我的经验是」。

02

怎么合作
每一步都可验收

01

Benchmark 先行

动手之前,先为你的场景建立评估基线。
什么叫「做好了」,用你认可的数据定义,写进方案。
避免项目结束时用感觉验收。

02

里程碑交付

按周推进,每个里程碑有可运行的交付物。
任何阶段不满意,已交付的部分归你,文档齐全。

03

研究级严谨

每个架构决策说明理由和边界。
不说「充分证明」这种话——说「消融实验 96:76,
加之跨项目一致的工程经验」。你知道每个结论的证据强度。

03

服务与价格

01

Agent 落地 Sprint

嵌入你的团队,找到最高价值的 AI 应用场景,
从 PoC 做到生产级 Agent 系统。

交付:任务规划与工具调用设计 / Agent 运行时框架 /
评估体系与测试集 / 上线监控方案与文档

¥50,000 – 150,000 / 项目 · 周期 4–12 周
02

多模型协同架构

评估你的模型策略,设计路由、编排、fallback 架构。
让合适的模型做合适的事——成本和能力的最优分配。

交付:模型路由与调度策略 / 协同推理管道 /
成本优化方案 / 性能基准测试报告

¥30,000 – 80,000 / 项目 · 周期 3–8 周
03

AI 能力 Benchmark

为你的业务场景定制评估体系,量化多个模型的
真实能力边界,给出选型建议。

交付:场景化评估体系 / 测试集构建与运行 /
多模型横向比较报告 / 选型建议

¥20,000 – 50,000 / 项目 · 周期 2–5 周
04

联系
通常在 24 小时内回复

01

发邮件描述需求:项目背景、预期目标、时间窗口

02

30 分钟初步对齐:确认技术路径与项目范围

03

方案与报价:明确的技术方案、验收基线、费用结构

04

签约启动:里程碑推进,每阶段可交付验收

邮件主题注明「RRLab 咨询」可加速。