← Thoughts

个人介绍

2026-07-27

面试官,你好,我叫黄茂雷,目前在阿里巴巴飞猪担任高级算法工程师,主要负责交通导购推荐排序算法体系建设。我本科毕业于山东大学软件工程专业,之后在中科院计算所攻读硕士,研究方向是计算机视觉。研究生期间,我加入飞猪实习,开始接触并负责推荐排序相关工作;毕业后正式加入团队,并沿着这一方向持续积累和拓展,到现在已经工作四年多。

过去几年,我主要负责飞猪交通导购推荐算法建设,覆盖机票、火车票、跨行业交通以及营销推荐等多个核心场景。主要承担了交通推荐体系的整体建设和演进工作。 在过去的工作期间,我的工作内容主要可以概括为两个方面。

第一是推荐体系建设与排序模型优化。基于对交通场景和用户行为的长期分析,首次提出了 LSTP 场景特性框架,即长决策周期、行为稀疏、强时序性与周期性,并以此指导样本构造、特征表达和模型目标设计。针对这些场景特点,以及价格和库存实时变化、多业务目标共存等问题,推动建立了一套统一的推荐排序框架,逐步统一了特征体系、排序模型与多目标优化能力,让机票、火车票和营销等多个业务能够共享核心算法能力。在这一框架下,主要围绕价格感知、长期行为建模和多目标学习等方向进行了较多探索,逐步将排序模型从传统方法升级到深度模型,并取得了稳定的线上收益。例如,核心推荐场景点击率提升超过 20%,转化率提升约 2.8%,整体推荐效率和业务指标都有明显改善。

第二是大模型推荐排序与智能体探索。近一年开始负责大模型搜索推荐相关工作,主要围绕智能摘要、大模型排序和旅行规划智能体展开。在智能摘要方面,通过优化多轮交互、地理位置理解和模型评测,将交通摘要可用率从约 60% 提升至 95% 以上;在大模型排序方面,完成了从数据构造、监督微调、强化学习到线上部署的完整链路,将核心指标从 80% 提升至 86.2%。同时也在探索模型蒸馏和旅游行业知识建模,希望进一步提升对用户出行需求和旅游商品的理解、排序与规划能力。

除了业务实践,我也持续进行技术总结与研究沉淀,目前以第一作者在 KDD、AAAI、SIGIR 等国际顶会发表了多篇论文。相关研究大多来源于真实业务场景:从实际问题中提炼共性挑战,形成具有一定通用性的算法方法,并最终应用到线上业务。我希望在解决具体问题的同时,也能沉淀出可复用、可推广的技术能力。

我觉得自己的特点主要有三点:第一,能够独立推进复杂项目并对结果负责;第二,注重业务价值与技术深度的结合,善于从实际问题中抽象出可复用的方法;第三,具备较强的学习和实践能力,从计算机视觉、传统推荐到大模型等不同方向,都能快速建立认知并推动成果落地。

面试问题准备

1. 你在交通推荐体系中的个人贡献是什么?

过去几年,我主要负责飞猪交通导购推荐算法体系的建设和演进,覆盖机票、火车票、跨行业交通和营销推荐等场景。我的工作不只是优化单个模型,而是从业务问题分析出发,持续推进数据和样本建设、召回排序优化、线上实验及效果复盘。比较核心的贡献包括推动多业务算法能力统一、提出 LSTP 场景框架,以及推动排序算法从规则和传统模型向深度模型、大模型排序演进。在这些项目中,我主要承担问题定义、方案设计、核心模型研发、实验分析和跨团队推进,并对最终结果负责。

2. 为什么提出 LSTP?它具体改变了哪些算法设计?

我们在分析交通场景用户行为时发现,传统电商推荐中的一些假设并不完全适用。交通消费具有决策周期长、有效行为稀疏、行为与出行时间强相关以及周期性明显等特点。例如,用户搜索机票后不一定立即支付,历史行为的价值也会随出行时间和场景变化。

基于这些现象,我将交通场景的特点归纳为 LSTP。它主要影响三个方面:样本层面重新考虑行为窗口、转化延迟和正负样本构造;特征层面强调行为时间、出行时间和当前查询之间的关系;模型层面引入长期行为建模、时序反馈校正和多目标学习。LSTP 不只是概念总结,也是一套指导交通推荐建模和迭代的方法框架。

3. 点击率提升 20%、转化率提升 2.8% 是如何验证的?

这两个指标来自不同业务场景,并不是同一个项目同时获得的收益。点击率提升超过 20%,主要来自核心推荐场景的全链路建设和排序模型升级;约 2.8% 的提升来自对应业务场景的模型优化。

效果主要通过线上分流实验验证。实验组和对照组采用随机流量,在完整实验周期内观察点击率、转化率、收入和用户体验等指标,同时检查不同人群、入口和场景下的稳定性。我们也会观察从曝光、点击到支付的完整漏斗,只有核心指标达到统计显著且护栏指标没有明显损失时,才会逐步扩大流量。

4. 统一推荐框架如何兼顾不同业务的共性和差异?

我的思路是统一底层能力,同时保留场景表达和目标配置的灵活性。不同交通业务在用户行为、查询意图、商品属性、样本构造和排序流程上存在大量共性,因此可以统一数据口径、基础特征、样本链路、模型训练和线上服务能力。

对于场景差异,则通过场景标识、场景特征、任务目标和可配置模块表达。例如,机票更关注价格、时刻和库存,火车票更关注车次、席别和中转关系,营销场景还需要兼顾收入和用户接受度。因此,这套框架是共享底层能力,再针对不同场景进行轻量定制。

5. 排序算法从传统模型到深度模型经历了什么过程?

整个过程是分阶段推进的。早期主要依赖人工规则和传统机器学习模型,优点是稳定、可解释,但难以充分建模用户、查询、商品和上下文之间的复杂关系。之后我们先统一数据和特征口径,建立可靠基线;再引入深度模型,加强长期行为、查询意图、价格和上下文建模;随后针对交通场景加入价格感知、转化延迟校正、多目标学习和序列建模等能力;目前则开始探索大模型排序。

每次升级都会先完成离线回放和分层诊断,再通过小流量实验逐步验证,同时关注效果、推理延迟、稳定性和资源消耗。

6. 为什么使用大模型做排序?

传统排序模型处理结构化特征和大规模在线预测的效率很高,但对复杂自然语言需求、模糊意图以及候选商品之间的语义关系理解相对有限。旅游用户的需求往往包含预算、时间、同行人和行程偏好等多重约束,大模型能够在统一的语义空间中理解用户、查询和候选商品,并进行更复杂的比较和推理。

我们并不是直接用大模型替换传统排序,而是让传统模型负责高并发下的召回和排序,再用经过优化的小模型处理意图理解、相关性判断和重排,在效果、延迟和成本之间取得平衡。

7. 核心指标从 80% 提升至 86.2%,主要来自哪些改动?

这部分提升来自数据、目标和推理方式的连续优化。首先重新构造训练数据,扩大查询和候选商品覆盖范围,并使标签综合考虑支付、点击、原始排序、意图匹配和多样性;加入用户分层和候选意图匹配后,指标从 80% 提升至 83.5%。随后扩大监督微调和强化学习的数据规模,进一步提升至 84.7%。最后引入结构化思维链并修复相应奖励问题,小模型指标提升至 86.2%。

更大模型的效果可以达到约 87%,但线上延迟和资源消耗较高,因此后续重点是将其中验证有效的能力蒸馏到小模型中。

8. 如何解决大模型的推理延迟和资源成本问题?

我主要从四个方面考虑:根据业务延迟要求选择合适的模型规模;通过传统召回和排序缩小候选范围;控制输入长度和输出格式,并优化批处理和推理链路;最后通过软标签或知识蒸馏,将大模型的意图理解和排序能力迁移到小模型中。判断标准不是追求单一离线指标最高,而是在效果、延迟、吞吐量和资源成本之间找到更适合线上业务的方案。

9. 智能摘要可用率如何定义?从 60% 提升到 95% 是怎么实现的?

智能摘要可用率主要衡量输出在事实准确性、位置理解、方案完整性和表达质量等方面是否满足业务展示要求。月初的主要问题集中在内容幻觉、位置理解不准确、方案描述不完整和多轮交互不稳定。

针对这些问题,我们先按照错误类型拆分评测结果,逐步明确评测集和指标口径;然后优化多轮交互流程和提示词,引入地理位置信息,并升级基础模型。经过多轮评测和针对性修复,整体可用率从约 60% 提升至 95% 以上。这个项目让我认识到,大模型业务优化需要将模型、数据、上下文、业务流程和评测体系结合起来。

10. 为什么考虑新的机会?下一份工作想获得什么?

我在飞猪工作四年多,从推荐排序实习生逐步成长为能够整体负责交通推荐算法体系的高级算法工程师,积累了从业务分析、算法建模到线上部署和实验评估的完整经验,也非常感谢团队提供的成长空间。

现在考虑新的机会,并不是因为对当前工作不认可,而是希望进入业务规模更大、技术问题更加复杂的环境。一方面,我希望继续深化在推荐、搜索和大模型方面的积累;另一方面,也希望承担更大的技术责任,负责更完整的算法方向,推动跨场景能力建设。我更关注岗位是否有真实、复杂的问题,能否通过技术产生明确的业务价值,以及自己是否有机会对最终结果负责。