← Thoughts

交通大模型与智能体:技术问题与实践思考

2026-07-30

这轮面试由 P9 面试官进行,重点大概率不是考察某个孤立的算法知识点,而是判断候选人是否达到 P7 的要求:能否独立定义问题、做出关键技术决策、推动复杂项目落地,并对最终结果负责。

结合岗位描述和个人经历,需要重点准备大模型后训练、智能体架构、交通场景迁移、评估体系以及项目主导能力。简历中比较容易被挑战的部分包括:直接从事大模型的年限、强化学习的实际深度、智能体是否真正落地,以及推荐经验如何迁移到交通预测。

需要重点防守的四个问题

第一是大模型经验年限。不回避直接经验不足三年的事实,重点说明传统推荐积累如何迁移,以及近一年已经做到了什么深度。

第二是智能体成熟度。准确区分原型、离线验证、灰度和正式上线,避免把探索项目包装成成熟系统。

第三是强化学习深度。必须讲清数据、采样、奖励、训练稳定性、指标贡献和失败实验,不能只说使用了 GRPO。

第四是交通预测经验。不假装已经精通,而是展现清晰的迁移框架、合理的技术边界,以及快速补齐时空建模的能力。

可能的面试流程

这轮面试可能包括:五分钟自我介绍;二十到三十分钟深挖大模型排序或智能体;十五分钟开放系统设计;十分钟讨论 P7 职责、失败案例和求职动机;最后是反问环节。

与其准备大量浅层答案,更重要的是准备三条可以连续追问二十分钟的项目主线:大模型排序的数据、监督微调、强化学习、部署与评测;旅行规划智能体的需求、架构、工具、评测与真实成熟度;交通推荐体系的场景抽象、统一框架、关键取舍与业务收益。

其中最值得优先准备的是大模型排序。它同时覆盖岗位要求中的后训练、强化学习、评估体系和工程落地,也是面试官最容易判断真实技术深度的项目。

15 个问题的详细参考回答

下面的回答不是需要逐字背诵的标准答案,而是用于建立表达主线。面试时应先给结论,再根据面试官的追问展开数据、模型和工程细节。

1. 为什么你适合这个岗位?

我认为自己的匹配点主要有三个。

第一,我过去四年多一直在真实交通业务中做算法。虽然业务载体是机票、火车票和跨行业交通推荐,但核心问题同样包含用户意图理解、时空信息建模、动态供给、多目标决策和严格的线上时延约束。这让我对交通场景的复杂性、数据特点和工程落地有比较完整的认识。

第二,我具备从传统模型到大模型的完整技术迁移经历。前期主要负责召回、排序、多目标学习和时序行为建模,近一年进一步完成了大模型排序的数据构造、监督微调、强化学习、离线评测和线上部署链路,也探索了智能摘要和旅行规划智能体。这与岗位要求的大模型后训练、智能体和评估体系比较一致。

第三,我不仅做单点模型,也长期负责体系建设。我习惯先从业务现象中抽象问题,再建设数据、模型、评测和部署链路,并对最终业务结果负责。高德这个岗位希望用大模型重构交通算法研发范式,我过去将业务问题沉淀为通用能力的工作方式,可以比较自然地迁移过来。

我也清楚自己的短板:直接从事交通流预测和路网时空建模的经验还不够深。但我不会把已有推荐方法简单平移,而是会先理解高德现有预测体系和数据结构,再寻找大模型真正能够提供增量的环节。

2. 你的大模型经验不足三年,为什么能够胜任?

如果只计算直接使用大语言模型的时间,我的核心项目确实主要集中在近一年,这一点我不会回避。但岗位需要的不只是调用模型,还包括数据构造、训练目标设计、强化学习、评估、部署和业务闭环,而这些能力与我之前四年的搜索推荐工作具有很强的连续性。

例如,监督微调数据构造对应推荐中的样本与标签设计;强化学习的多目标奖励对应排序中的点击、支付和多样性优化;大模型上线仍然需要处理推理时延、资源消耗、灰度发布和效果归因。这些并不是近一年才开始积累的。

近一年我已经实际跑通了从数据、监督微调、GRPO 强化学习到部署评测的链路,而不只是停留在提示词调用层面。我认为自己的优势不是大模型工作年限本身,而是能够把大模型技术快速放入真实工业系统中,判断它在哪些地方有价值、哪些地方不适合,以及怎样以可控成本获得线上收益。

3. 你在大模型排序项目中具体负责了什么?

这个项目的背景是,传统排序模型在常规查询上效率很高,但面对复杂自然语言需求时存在三个不足。第一,用户意图通常需要人工拆成特征,难以覆盖“带老人、不要太赶、预算适中”这类复合约束;第二,传统模型更擅长对候选独立打分,对候选之间的语义比较和列表整体关系建模不足;第三,点击和支付信号比较稀疏,还受到曝光位置与原始排序影响,单一行为标签不能完整表达真实偏好。

因此,我们没有让大模型替换召回和初排,而是选择生成式重排。传统链路先筛出有限候选,大模型统一读取用户分层、长短期行为、当前查询和候选信息,先理解意图和约束,再直接生成候选顺序。这样既利用大模型的语义理解和比较能力,也把推理规模控制在可上线范围内。

数据是我首先推动重构的部分。我们重新构造猪搜全域物料,补充查询和度假商品,并重做真实标签。标签不只看点击,而是综合支付、点击、原始排序、意图匹配和多样性:支付提供强业务信号,点击扩大监督覆盖,原始排序保留基本质量,意图匹配和多样性用于避免模型只学习热门结果。我们还加入用户分层和七维候选意图匹配,让模型知道不同用户在当前查询下究竟关注候选的哪些属性。

训练分成监督微调和强化学习两个阶段。监督微调首先教会模型任务本身,包括如何读取输入、如何进行结构化意图分析、如何比较候选,以及如何稳定输出合法排序。它解决的是“会不会做、格式是否稳定”的问题。强化学习则不再要求模型逐字模仿标准答案,而是根据排序结果直接优化业务目标,解决“怎样排得更好”的问题。

强化学习采用 GRPO。对于同一个输入采样多组排序结果,通过组内相对奖励计算优势。奖励以排序质量和支付价值为核心,同时加入格式、完整性和重复项约束,可以概括为:

\[R=\lambda_1R_{NDCG}+\lambda_2R_{PayNDCG} +\lambda_3R_{format}+\lambda_4R_{complete}-\lambda_5R_{repeat}\]

其中,$R_{NDCG}$ 衡量高相关候选是否排在前面,$R_{PayNDCG}$ 强调支付价值,其他奖励保证输出可解析、候选不遗漏也不重复。训练中还需要关注奖励投机,例如模型通过缩短输出、遗漏难排候选或者利用格式漏洞获得高分,因此奖励提升必须与独立评测集上的排序指标同步验证。

指标提升可以对应到三轮主要改动。初始前十命中率约为 80%;加入用户分层和七维候选意图匹配后提升到 83.5%;将监督微调和强化学习数据从约九千条扩大到两万条后提升到 84.7%;引入结构化思维链并修复 Qwen3 与 Qwen3.5 思考格式对应的奖励后,小模型进一步提升到 86.2%。四十亿参数模型可以达到约 87%,说明模型容量确实有帮助,但它的单次推理耗时超过 100 毫秒,相对小模型不到一个百分点的增益不足以覆盖线上延迟和资源成本,因此没有直接作为主力模型上线。后续方向是将大模型的软标签、思维链和排序能力蒸馏到小模型。

在个人贡献上,我主导的是问题定义、整体技术路线、数据与标签重构、监督微调和 GRPO 实验主线、多目标奖励与评测方案,以及最终的模型选型和效果成本判断。数据生产链路、训练平台、线上部署和部分模型对比实验由算法与工程同学协作完成。面试时我会进一步按照真实分工说明具体模块,尤其不会把团队共同完成的平台和部署工作全部算成个人贡献。

4. 为什么使用大模型排序,传统模型解决不了吗?

传统模型并不是解决不了排序问题,而是在特定问题上存在能力边界。它非常擅长处理大规模结构化特征、稳定模式和高并发预测,因此召回、初排和大量常规流量仍然应该由传统模型承担。

大模型的增量主要出现在复杂语义和候选比较上。例如,用户搜索“适合带老人、不要太赶、预算适中、最好周末出发”,这里同时包含人群、节奏、预算和时间约束。传统模型通常需要提前把这些意图设计成特征,大模型则能够直接理解自然语言,并将用户需求与候选商品说明放到统一语义空间中比较。

所以我的设计不是用大模型替换整条排序链路,而是采用分层架构:传统模型完成高效召回和初步筛选,大模型只对有限候选进行意图匹配、复杂关系判断和重排。是否使用大模型,最终仍然取决于它带来的效果增量能否覆盖额外时延和资源成本。

5. 监督微调数据是如何构造的?

我会先明确一个训练样本要教会模型什么。输入主要包括用户分层信息、长短期行为、当前查询和候选商品;输出不是简单生成一个商品编号,而是按照统一格式完成意图理解、候选比较和排序。

标签构造不能只看点击,因为点击容易受到曝光位置影响,也不一定代表最终价值。我们综合使用支付、点击、原始排序、意图匹配和多样性信息构造真实标签,其中支付代表更强反馈,点击提供更高覆盖,原始排序用于保留基本业务质量,意图匹配和多样性则避免结果只集中在单一品类。

为降低位置偏差,可以在训练样本中打乱候选顺序,并检查模型是否对输入位置敏感。为避免数据泄漏,训练集和评测集需要按照用户、查询或时间进行隔离,尤其不能让同一条查询及其近似候选同时出现在训练和测试中。

数据扩量也不是简单复制样本。需要扩大查询类型、用户层级和商品覆盖,并对模型生成或规则构造的数据做质量过滤。数据从约九千条扩大到两万条后指标继续提升,说明此前的一个主要瓶颈确实是覆盖不足,而不只是模型容量不足。

6. 为什么选择 GRPO,奖励函数如何设计?

选择 GRPO 的主要原因,是排序任务可以针对同一输入采样多个输出,再利用组内相对表现计算优势,不需要额外训练一个与大模型同规模的价值模型,训练链路相对简洁、资源成本也更可控。

在排序任务中,奖励不能只判断输出格式是否正确,还要衡量排序质量。我们的奖励主线包括归一化折损累计增益和支付加权的归一化折损累计增益:前者衡量高相关候选是否排在前面,后者进一步强调真实业务价值。此外,还需要加入格式合法性、候选完整性和重复项惩罚,避免模型通过输出不合法结果获得虚假高分。

多目标奖励可以表示为:

\[R=\lambda_1R_{rank}+\lambda_2R_{pay}+\lambda_3R_{format}-\lambda_4R_{repeat}\]

权重不能只靠主观设置,需要结合离线指标、不同查询类型和线上目标做敏感性实验。训练中重点关注奖励持续上升但真实排序指标不升的奖励投机,以及输出趋同、长度异常和训练不稳定等问题。

GRPO 相对监督微调的价值,是让模型从“模仿标准答案”进一步转向“直接优化排序目标”。但面试时必须根据真实实验说明它的独立增益;如果某项消融尚未完成,就应明确说明,而不是把所有提升都归因于强化学习。

7. 结构化思维链为什么能提升排序效果?

排序不是简单生成一个分数,它隐含了需求解析、属性提取、约束匹配和候选比较等多个步骤。自由生成思维过程容易出现格式漂移和无效冗余,因此我们更关注结构化思维链。

一个典型过程可以拆成四步:先提取用户的硬约束和软偏好;再提取候选商品的关键属性;然后判断每个候选满足或违反了哪些约束;最后进行候选间比较并输出排序。固定结构能够把复杂任务拆开,也方便针对中间步骤构造训练数据和奖励。

它带来的风险是增加输出长度、推理时延和幻觉。因此需要通过消融实验区分“推理结构有效”与“单纯输出更长”,并检查每个中间字段的事实一致性。上线时可以减少可见推理文本,或者将完整思维链主要用于训练和蒸馏,让小模型学习其决策结构,而不是始终生成冗长解释。

8. 更大模型效果更好,为什么最终仍选择小模型?

工业系统不能只比较离线效果。实验中更大模型的核心指标约为 87%,小模型经过优化后约为 86.2%,绝对差距有限;但大模型单次推理耗时超过 100 毫秒,对在线重排的端到端时延、吞吐量和资源成本影响明显。

如果为了不到一个百分点的离线提升,让系统延迟显著增加,甚至影响可用性和流量覆盖,整体收益可能是负的。因此当前选择小模型,不是认为大模型没有价值,而是把大模型作为教师和能力上限。

后续可以利用大模型生成更高质量的软标签和结构化思维链,再通过知识蒸馏将复杂意图理解和排序能力迁移到小模型。最终决策标准是单位成本带来的业务增益,而不是模型规模或单一离线指标。

9. 旅行规划智能体具体做到了什么程度?

我会先如实说明项目成熟度。当前工作重点是验证交通旅行规划智能体的核心链路,而不是把探索项目描述成已经全面上线的成熟产品。

系统从用户自然语言需求出发,先解析出发地、目的地、日期、预算、时长和偏好等约束;然后进行意图路由,调用机票、火车票等不同数据源召回候选;接着处理时间衔接、预算冲突和跨品类组合,再由大模型进行方案比较与重排,最终输出可执行的行程建议并衔接预订入口。

核心难点不在于让模型生成一段行程文本,而在于保证约束满足、工具结果可信和计划可执行。价格与库存属于动态信息,必须来自实时工具,不能依赖模型记忆;遇到约束冲突或信息不足时,需要向用户确认,而不是自行猜测。

评估上应分别看意图解析准确率、工具调用成功率、约束满足率、方案可执行率、端到端完成率、时延和成本。具体哪些能力已经离线验证、哪些进入灰度、哪些尚未接入正式业务,需要按照真实状态回答。

10. 如果让你设计一个交通智能体,你会怎么做?

以“明早从望京到首都机场,避开拥堵并且不能迟到”为例,我会把系统设计成确定性工作流与大模型决策结合的架构。

第一步由大模型解析硬约束和软偏好,包括起终点、最晚到达时间、交通方式、成本和风险偏好。第二步调用地图、实时路况、天气、交通事件和公共交通时刻等工具,所有动态事实都以工具结果为准。

第三步由专门的路径与时间预测模型生成候选方案,而不是让语言模型凭空生成路线。第四步由大模型解释候选差异、识别约束冲突并进行多目标比较,例如在预计时间、波动风险、换乘次数和费用之间权衡。

执行阶段需要持续监听路况变化。当预计到达时间超过安全阈值时触发重新规划,并说明改变方案的原因。对于打车下单、改签等有真实成本的动作,需要用户确认。

系统还要具备超时、工具失败、无可行方案和模型输出不合法时的降级路径。评估不仅看回答是否合理,还要看预计到达时间误差、约束满足率、方案采纳率、重规划成功率、端到端时延和成本。

11. 如何建立智能体评估体系?

我会把评估拆成四层,因为只评最终答案很难定位问题。

第一层是模块评估,包括意图槽位准确率、工具选择准确率、参数合法率、事实一致性和记忆召回准确率。第二层是任务评估,包括任务完成率、硬约束满足率、规划质量、工具调用次数和失败恢复率。

第三层是系统评估,包括端到端时延、单任务成本、稳定性、并发能力和降级成功率。第四层是业务评估,包括用户采纳率、方案完成率、到达时间准确性、投诉率以及长期留存。

评测集应由真实流量、专家案例、线上失败样本和对抗样本共同构成,并覆盖工具超时、数据冲突、无可行路径、模糊表达和动态变化等边界情况。线上失败案例需要自动回流并完成分类,形成“发现问题—补充评测—修复模型—回归测试”的闭环。

对于开放式答案,模型评分只能作为辅助。关键的事实、约束和工具参数尽量使用规则或可执行程序验证,重要样本再引入人工评审,从而提高评估的稳定性和可解释性。

12. 如何将大模型用于交通预测和时空序列建模?

我不会默认大语言模型应该直接替代成熟的交通预测模型。路网速度、流量和到达时间预测,本质上仍然是高频数值时空序列问题,图网络、时序模型和专门的预测模型在精度和效率上更有优势。

大模型的价值主要有三类。第一,融合事故、施工、天气、活动和管制等非结构化信息,将其转化为预测模型可使用的事件特征。第二,辅助数据构造、异常归因、特征建议和实验分析,提高算法研发效率。第三,在预测结果之上完成复杂推理,例如解释拥堵原因、判断多个事件的影响范围,或者为业务系统选择合适的预测与规划工具。

一种可行架构是:底层时空模型负责稳定的数值预测,大模型负责事件理解、任务编排和结果解释,两者通过结构化接口连接。是否让大模型参与数值预测,需要通过严格基线比较,而不能因为大模型流行就替换已经成熟的模型。

13. LSTP 与高德交通场景有什么关系?

LSTP 是我从交通推荐用户行为中总结出的四类特点:长决策周期、行为稀疏、强时序性和周期性。它与高德交通存在联系,但需要重新定义,不能直接照搬。

在高德场景中,稀疏性可以对应低频用户、冷门道路和突发事件;强时序性对应早晚高峰、实时拥堵和事件传播;周期性对应工作日、周末、节假日和季节规律。长决策周期在导航场景未必始终成立,但在跨城出行、长期通勤习惯和出行前规划中仍有意义。

真正可迁移的不是四个词本身,而是工作方法:先从数据中识别场景区别于通用任务的关键规律,再让这些规律进入样本窗口、特征表达、模型结构和评估切片。进入高德后,我会重新分析路网和用户数据,验证哪些规律成立,再形成适合交通预测的新抽象。

14. 讲一个失败项目或错误技术判断。

可以选择大模型规模实验作为案例。项目早期容易形成“模型越大,复杂意图理解越强,线上效果也会越好”的预期。离线实验确实显示大模型指标更高,但进入部署评估后发现,单次推理超过 100 毫秒,资源消耗和在线覆盖成本明显增加,而相对小模型的指标增益不到一个百分点。

这个结果说明最初的判断过于关注模型能力上限,没有把线上约束足够早地纳入目标。后续我将技术路线从“直接上线更大模型”调整为“优化小模型并利用大模型蒸馏”,同时把时延、吞吐量和资源成本提前加入模型选型指标。

这次经历让我形成一个比较重要的原则:工业算法的最优解不是离线指标最高的模型,而是在效果、成本、稳定性和覆盖率约束下的整体最优。失败案例还可以换成自己更熟悉、细节更完整的真实项目,但必须能够讲清个人判断和纠偏过程。

15. 为什么认为自己具备 P7 的能力?

我不会简单用工作年限或论文数量证明职级,而是从承担问题的范围和方式来说明。

过去几年,我负责的不只是某一个排序模块,而是交通导购推荐体系的整体建设和演进,覆盖多个业务板块。工作包括业务问题定义、数据与样本体系、召回排序、多目标优化、线上部署和实验复盘。我也推动统一不同场景的特征、模型和评估能力,减少重复建设。

技术上,我从用户行为中提出 LSTP 场景框架,并据此指导模型迭代;业务上,推动机票、火车票和营销等多个场景取得稳定收益;沉淀上,将真实问题形成论文、专利和可复用框架。近一年又进一步跑通大模型排序的后训练和部署链路。

我理解 P7 的核心不是“能够独立写出更复杂的模型”,而是面对一个模糊且复杂的问题,能够确定目标、组织技术路径、做关键取舍、协调资源、控制风险并最终交付结果。从过去承担的工作范围来看,我已经在持续做这类事情;进入新岗位后,还需要通过交通大模型方向的实际结果继续证明这种能力。