北大 & 作业帮CIKM 2025 顶会:Interactive-T2S 框架攻克 Text-to-SQL 难题

markdown 随着 人工智能(AI)技术的飞速发展,Text-to-SQL技术作为连接自然语言与数据库的桥梁,正受到学术界和工业界的广泛关注。其目标是让用户能够通过简单的自然语言查询,直接从数据库中获取所需信息,无需掌握复杂的 SQL语法。近日,北京大学与作业帮团队在国际顶会 CIKM 2025上发表了题为“Interactive-T2S: Multi-Turn Interactions for Text-to-SQL with Large Language Models”的论文,提出了一种创新的 Interactive-T2S框架,旨在解决现有 Text-to-SQL 方法在处理复杂数据库和低资源环境下的难题。

Interactive-T2S 框架的核心突破

传统 Text-to-SQL方法面临诸多挑战。一方面,面对拥有大量列的“宽表”数据库时,模型需要处理的信息量巨大,导致查询效率低下。另一方面,低资源场景下,标注数据稀缺,限制了模型的泛化能力。此外,现有方法缺乏可解释性,难以追溯 SQL 生成逻辑。Interactive-T2S框架针对这些痛点,将大型语言模型(LLM)塑造成一个能够与数据库进行多轮交互的智能代理(Agent),通过“思考-行动-观察”的循环,逐步分解问题、搜集信息、构建并最终执行 SQL查询。

Interactive-T2S框架的核心在于其设计的四大工具:

  1. SearchColumn(语义找列):根据自然语言问题的语义,对数据库列名、描述进行向量化处理,并返回相关列及其统计特征。
  2. SearchValue(模糊找值):基于 BM25算法在数据库中搜索目标单元格值,解决实时更新数据的定位问题。
  3. FindShortestPath(表关联找路径):将数据库 schema视为无向图,计算两列间最短关联路径,简化多表关联逻辑。
  4. ExecuteSQL(实时执行验证):支持直接执行生成的 SQL并返回结果,为 LLM提供反馈以修正错误。

通过这四个工具,Interactive-T2S框架将 SQL生成拆解为“找列找值 - 表关联 - 执行验证”三步,避免了 LLM直接处理海量冗余信息,显著提高了效率。同时,框架仅需 2 个标注示例即可实现少样本学习,降低了对标注数据的依赖。

多轮交互与少样本学习的优势

Interactive-T2S框架遵循“问题拆解→信息定位→表关联→SQL 执行”的统一交互流程,每一步均需 LLM输出“思考过程 + 工具行动”,确保生成逻辑可追溯。实验结果表明,在 Spider、BIRD等多个数据集上,Interactive-T2S框架均取得了 SOTA性能。尤其在 BIRD-Dev数据集上,其执行准确率(EX)达 54.56%,显著优于现有方法。在宽表处理方面,Interactive-T2S在 Spider-Dev与 BIRD-Dev上的 prompt token消耗仅为其他方法的 22%-36%,效率优势明显。此外,在仅使用 2 个示例的少样本设置下,Interactive-T2S在同义词干扰等变体数据集上的 EX值分别达 78.7%、80.7%,展现出强大的泛化能力。

技术趋势与应用前景

Interactive-T2S框架的创新设计使其在多个领域具备落地潜力。在智能教育领域,教师可以通过自然语言查询“某知识点错题率 Top3 的班级”;在企业数据分析领域,市场人员可快速查询销售数据;在政务公开查询领域,市民可以通过自然语言获取精准结果。未来,研究团队将进一步优化工具的计算效率,并探索框架在多模态数据中的扩展能力,推动 Text-to-SQL技术向更复杂的真实场景渗透。随着 AI技术在数据库查询领域的深入应用,Interactive-T2S框架有望成为未来智能数据交互的重要基石。这项研究成果也为 AI在更广泛领域的应用,如 智能客服、数据分析自动化等,提供了新的思路。

这项由北京大学和作业帮团队联合推出的 Interactive-T2S框架,无疑为 Text-to-SQL领域注入了新的活力。你认为这种多轮交互的模式,在未来的人工智能应用中,还会带来哪些惊喜?欢迎在评论区留下你的看法。