一、项目前言
 
作为DBA或数据开发,日常总会被两件重复工作消耗大量时间:
 
1. 业务运营不懂SQL,反复来找你写简单统计查询;
2. 慢SQL人工分析EXPLAIN执行计划、设计索引,流程繁琐低效。
 
为此我建立了助手,基于openEuler系统、MySQL8.0数据库,对接腾讯云TokenHub大模型聚合平台,一套工具同时实现自然语言一键生成SQL查询、自动解析SQL执行计划输出调优方案,支持命令行+Streamlit网页双端使用,零基础业务人员也能自主查订单数据,解放运维重复劳动。

项目摘要:基于openEuler+MySQL8.0搭建NL2SQL智能助手,自然语言自动生成SQL,支持命令行与Web页面,完整部署源码实战。基于openEuler+MySQL8.0搭建NL2SQL智能助手,自然语言自动生成SQL,支持命令行与Web页面,完整部署源码实战。
 
二、项目整体架构与核心能力
 
2.1 技术架构分层
 
项目四层解耦架构,职责清晰易维护:

1. 接入交互层
- 命令行终端:openEuler服务器执行 python3 main.py 交互式菜单;
- Web可视化端:Streamlit搭建网页面板,浏览器直接访问,自带表格渲染、SQL复制、输入校验。
2. Python程序核心层(5个核心文件)
-  main.py :总调度入口,封装NL2SQL、SQL调优两大核心业务逻辑,命令行/网页共用底层函数;
-  mysql_client.py :MySQL统一封装,内置SQL安全拦截,仅允许SELECT只读操作,自动获取EXPLAIN执行计划;
-  prompts.py :统一管理大模型提示词模板,内置SQL提取工具,约束模型输出规范SQL;
-  web_main.py :前端页面代码,复用main底层逻辑,仅做交互美化;
-  .env :独立配置文件,数据库账号、大模型密钥统一存放,设置600权限杜绝明文泄露。

3. 底层数据持久层
openEuler虚拟机部署MySQL8.0.45,搭建电商订单测试表 order_info ,存储20条标准测试订单数据,作为唯一数据源。
4. AI大模型服务层
对接腾讯云TokenHub聚合平台,兼容OpenAI接口标准,无缝切换Qwen3.5-Plus、DeepSeek V4 Pro等模型,统一鉴权计费,无需对接多家厂商SDK。

2.2 核心功能亮点
 

功能1:自然语言转MySQL只读查询
 - 输入中文业务需求,AI自动生成规范SELECT语句,强制拦截INSERT/UPDATE/DELETE/ALTER等危险SQL;
- 自动执行查询,表格化展示结果,调用大模型输出通俗易懂的业务数据总结;
- 容错性强,空白输入、无匹配数据、超长复合需求均不会程序崩溃。
 功能2:SQL自动性能调优
 - 输入任意SELECT语句,程序自动抓取EXPLAIN执行计划;
- AI识别全表扫描、文件排序、无索引、临时表等性能瓶颈;
- 直接输出可落地的联合索引/覆盖索引建表语句、优化后SQL改写方案。
 2.3 非功能设计优势

1. 安全管控:数据库仅开放只读权限,密钥文件权限600,全程不打印账号密钥明文;
2. 兼容性:适配openEuler/RHEL系统,兼容MySQL8.0,支持主流开源大模型;
3. 低门槛部署:单人3个工作日即可完成环境搭建+全量开发,轻量化可直接落地企业内部。

三、全套环境部署实操(openEuler)

部署前提:自行建立系统openEuler或红帽9;注册腾讯云账号。

1. 关闭防火墙与SELinux,优化服务器安全基线

# 永久关闭SELinux
sed -i '7s/enforcing/disabled/' /etc/selinux/config
# 关闭并禁用防火墙
systemctl disable --now firewalld
# 配置阿里云时间同步
vim /etc/chrony.conf 

i进入插入模式,将以下代码写于将时间同步,便于后续操作。

server ntp.aliyun.com iburst
stratumweight 0
driftfile /var/lib/chrony/drift
rtcsync
makestep 10 3
bindcmdaddress 127.0.0.1
bindcmdaddress ::1
keyfile /etc/chrony.keys
commandkey 1
generatecommandkey
logchange 0.5
logdir /var/log/chrony
完成后esc进入末行模式,shift加冒号wq保存退出。
systemctl restart chronyd
chronyc sources
2. 安装系统编译依赖
dnf install -y gcc gcc-c++ make cmake zlib-devel openssl-devel ncurses-devel wget vim
3源码编译Python3.11.9
系统自带Python版本过低,采用源码编译独立安装,避免污染系统环境:
从python获取3.11.9源码包,使用Xftp 8上传至/usr/local/src,cd /usr/local/src
解压编译:tar -zxvf Python-3.11.9.tgz,cd Python-3.11.9
编译配置:./configure --prefix=/usr/local/python3.11 --enable-shared
多核编译安装 make -j$(nproc) && make install
配置动态链接库,解决libpython缺失报错 : echo "/usr/local/python3.11/lib" >
/etc/ld.so.conf.d/python311.conf
ldconfig
建立全局软链接,不覆盖系统自带Python3
ln -s /usr/local/python3.11/bin/python3.11 /usr/local/bin/python3
ln -s /usr/local/python3.11/bin/pip3.11 /usr/local/bin/pip3
bash #或者reboot重启
验证安装
python3 -V
pip3 -V
显示3.11.9即成功
校验SSL模块(AI接口必备)
python3 -c "import ssl; print(ssl.OPENSSL_VERSION)"
3.1 配置阿里pip源加速下载
mkdir ~/.pip
vim ~/.pip/pip.conf
[global]
index-url = http://mirrors.aliyun.com/pypi/simple/
[install]
trusted-host=mirrors.aliyun.com

# 安装项目依赖
pip3 install pymysql python-dotenv tabulate langchain langchain-openai streamlit

3.2 MySQL8.0.45部署与业务表初始化
 
1. 解压MySQL二进制包,创建mysql系统用户,后台启动服务并配置systemd托管;
2. 修改root密码为原生密码插件,适配Python连接;
3. 创建测试库 testdb 与订单业务表 order_info ,导入20条测试数据:

3.3 腾讯云TokenHub大模型配置
 
1. 注册腾讯云完成实名认证,进入TokenHub平台创建API Key:

选择创建密钥并复制。
2. 推荐选用无思考链模型:Qwen3.5-Plus、DeepSeek V4 Pro,避免模型冗余思考文本干扰SQL提取;新用户注册可获得百万tokens,便于操作与实验。


3. 编写 .env 配置文件,统一存放数据库、大模型密钥,加固文件权限防止泄露:

四、核心代码模块设计思路
 
4.1 mysql_client.py:数据库安全封装
 

核心设计点:
 
1. 内置SQL安全校验正则,拦截所有DML/DDL危险语句,仅放行SELECT;
2. 封装统一查询、EXPLAIN执行计划获取方法;
3. 自动捕获数据库连接、SQL语法异常,抛出友好提示;
4. 连接自动关闭,避免数据库连接泄漏。

vim /opt/mysql_ai_tools/mysql_client.py打开文件后将以下写入,方法同时间配置。

# -*- coding: utf-8 -*-
# 文件名:mysql_client.py
# 功能:MySQL8.0数据库统一封装类
# 作用:封装数据库连接、普通查询、EXPLAIN执行计划、SQL安全拦截,统一抛出友好异常,给上层业务调用
import pymysql
import os
import re
from dotenv import load_dotenv

# 加载项目根目录下.env文件的数据库配置
load_dotenv()

class Mysql80Client:
    # 数据库操作封装类,所有数据库相关操作统一在此管理
    def __init__(self):
        # 初始化时读取环境变量,参数缺失则设置兜底默认值,防止程序直接崩溃
        self.host = os.getenv("MYSQL_HOST", "127.0.0.1")
        self.port = int(os.getenv("MYSQL_PORT", "3306"))
        self.user = os.getenv("MYSQL_USER", "root")
        self.password = os.getenv("MYSQL_PASSWORD", "")
        self.database = os.getenv("MYSQL_DB", "testdb")
        # 数据库连接对象,初始为空
        self.conn = None
        # 实例创建后自动建立数据库连接
        self.connect()

    def connect(self):
        """创建数据库连接,捕获连接异常并抛出可读错误信息"""
        try:
            self.conn = pymysql.connect(
                host=self.host,
                port=self.port,
                user=self.user,
                password=self.password,
                database=self.database,
                charset='utf8mb4',  # 支持中文、emoji完整字符集
                cursorclass=pymysql.cursors.DictCursor  # 查询结果以字典返回,方便按字段取值
            )
        except pymysql.MySQLError as e:
            # MySQL专属连接错误,提示账号、地址、密码排查方向
            raise Exception(f"数据库连接失败,请检查地址/账号/密码:{e.args[1]}")
        except Exception as e:
            # 其余未知连接异常统一捕获
            raise Exception(f"数据库连接异常:{str(e)}")

    @staticmethod
    def _check_sql_safety(sql: str) -> None:
        """
        静态私有安全校验方法
        核心防护:拦截增删改、建表删表等危险操作,仅允许SELECT查询,防止AI生成危险SQL篡改数据
        """
        # 去除首尾空格并转为大写,统一匹配规则
        sql_trim = sql.strip().upper()
        # 危险操作关键字黑名单
        danger_keywords = ["INSERT", "UPDATE", "DELETE", "DROP", "ALTER", "CREATE", "TRUNCATE", "REPLACE"]
        for kw in danger_keywords:
            # 单词边界匹配,避免字段名包含关键字时误拦截
            if re.search(r'\b' + re.escape(kw) + r'\b', sql_trim):
                raise Exception(f"安全拦截:禁止执行 {kw} 类型语句,仅支持 SELECT 查询")

    def execute_query(self, sql: str):
        """
        执行普通SELECT查询
        :param sql: 待执行查询语句
        :return: (字段名列表, 全部数据行字典列表)
        """
        # 执行SQL前先做安全校验,拦截危险语句
        self._check_sql_safety(sql)
        try:
            # with自动管理游标,用完自动释放资源
            with self.conn.cursor() as cursor:
                cursor.execute(sql)
                # 提取查询结果表头字段
                columns = [desc[0] for desc in cursor.description]
                # 读取全部查询数据
                rows = cursor.fetchall()
                return columns, rows
        except pymysql.MySQLError as e:
            # 捕获SQL语法、表不存在等数据库执行错误
            raise Exception(f"SQL执行失败(错误码 {e.args[0]}):{e.args[1]}")
        except Exception as e:
            # 通用查询异常兜底
            raise Exception(f"查询异常:{str(e)}")

    def get_explain_plan(self, sql: str):
        """
        获取SQL执行计划EXPLAIN,用于性能调优分析
        :param sql: 待分析SELECT语句
        :return: (执行计划表头, 执行计划详情数据)
        """
        # 同样先校验SQL安全性
        self._check_sql_safety(sql)
        # 拼接EXPLAIN关键字,生成分析语句
        explain_sql = f"EXPLAIN {sql}"
        try:
            with self.conn.cursor() as cursor:
                cursor.execute(explain_sql)
                columns = [desc[0] for desc in cursor.description]
                rows = cursor.fetchall()
                return columns, rows
        except pymysql.MySQLError as e:
            raise Exception(f"获取执行计划失败:{e.args[1]}")
        except Exception as e:
            raise Exception(f"执行计划异常:{str(e)}")

    def close(self):
        """安全关闭数据库连接,释放资源,避免长时间占用连接池"""
        # 判断连接存在且未关闭才执行关闭操作
        if self.conn and not self.conn._closed:
            self.conn.close()


 
4.2 prompts.py:提示词工程解耦

 
1. 订单表结构全局统一维护,修改表结构只需改动一处;
2. 两套提示词模板:NL2SQL生成模板、SQL性能调优模板;
3. 内置三层SQL提取正则,兼容不同大模型输出格式,自动剥离纯SQL代码。

vim /opt/mysql_ai_tools/prompts.py打开后同上

# -*- coding: utf-8 -*-
# 文件名:prompts.py
# 功能:统一管理项目全部大模型提示词模板,附带SQL提取工具静态方法
# 作用:把AI提示词和业务代码解耦,统一约束模型输出格式,降低SQL解析报错概率
import re
class UnifiedPrompt:
"""
提示词统一管理类
优势:所有SQL生成、性能分析提示词集中存放,表结构仅维护一处,修改不用多处同步;
通过严格规则约束大模型输出,减少格式错乱、编造字段、危险SQL等幻觉问题
"""
# ===================== 全局共用数据表结构 =====================
# 只在此维护订单表字段,下方两套提示词会自动引用,改表结构只需改这里一处
TABLE_SCHEMA = """
表名: order_info (订单信息表)
字段说明:
- id: 订单ID (主键,INT类型)
- user_id: 用户ID (INT类型)
- order_name: 商品名称 (VARCHAR类型)
- pay_amount: 支付金额 (DECIMAL类型)- create_time: 下单时间 (DATETIME类型)
"""
# ===================== 模板1:自然语言转SQL专用提示词 =====================
NL_TO_SQL_PROMPT = f"""
你是严谨的 MySQL 8.0 数据库开发工程师。
【任务目标】
根据用户自然语言描述的业务需求,生成可直接执行、无语法错误的MySQL查询SQL。
【表结构参考】
{TABLE_SCHEMA}
【强制输出规则】
1. 只能生成 SELECT 查询语句,绝对不允许生成 INSERT/UPDATE/DELETE/DROP 等修改、删除数据的语
句。
2. 只能使用上面列出的5个字段,禁止自己编造不存在的字段名。
3. 查询字段可使用中文别名,格式固定为:字段 AS 别名。
4 SQL语法遵循MySQL8.0标准,所有关键字统一大写,方便程序解析。
5. 最终SQL必须包裹在 ```sql ``` Markdown代码块内,方便代码提取。
6. 禁止输出任何解释、说明文字,只返回纯SQL代码块,减少解析干扰。
7. 中文别名内部不能带空格,例:订单ID(正确)、订单 ID(错误),避免数据库语法报错。
【用户需求】
{{user_input}}
"""
# ===================== 模板2:SQL性能调优分析专用提示词 =====================
SQL_TUNE_PROMPT = f"""
你是资深 MySQL DBA 性能优化专家。
【任务目标】
根据原始SQL + EXPLAIN执行计划数据,定位查询性能问题并给出可直接落地的优化方案。
【表结构参考】
{TABLE_SCHEMA}
【待分析SQL】
{{sql_input}}
【执行计划数据】
{{explain_data}}
【输出要求】
1. 先点明核心性能问题:全表扫描、无索引、索引失效、扫描行数过多等。
2. 给出完整建索引SQL语句,可直接复制执行。
3. 若原SQL写法存在缺陷,提供改写后的完整优化SQL。
4. 内容简洁、分点罗列,不输出多余废话,便于用户快速阅读。
"""
@staticmethod
def extract_sql(response_text: str) -> str:
"""
静态工具方法:从大模型返回的完整文本里剥离出纯净SQL语句
三层匹配优先级,兼容不同大模型的输出格式,提升提取成功率
:param response_text: 大模型原始完整返回内容
:return: 清洗后的纯SQL字符串,提取失败返回空字符串
"""
# 空文本直接返回
if not response_text:
return ""
# 优先级1:匹配最标准markdown sql代码块(项目提示词强制要求的格式)
match = re.search(r"```sql\s*(.*?)\s*```", response_text, re.DOTALL |
re.IGNORECASE)
if match:
return match.group(1).strip()
# 优先级2:兼容自定义<sql>标签格式(备用兼容方案)
match = re.search(r"<sql>\s*(.*?)\s*</sql>", response_text, re.DOTALL |
re.IGNORECASE)
if match:
return match.group(1).strip()
# 优先级3:兜底匹配,直接抓取以SELECT开头、分号结尾的SQL片段
match = re.search(r"(SELECT\s+.*?;)", response_text, re.DOTALL | re.IGNORECASE)
if match:
return match.group(1).strip()
# 三层规则全部匹配不到,说明无有效SQL,返回空
return ""
# 全局单例实例,外部文件导入后直接调用 prompt_helper.方法名,无需重复实例化
prompt_helper = UnifiedPrompt()

 
4.3 main.py:业务核心调度层
 
1. 封装 nl2sql_query :自然语言生成SQL→执行查询→AI生成业务总结;
2. 封装 sql_tune_analyze :获取执行计划→AI分析性能瓶颈→输出索引与优化SQL;
3. 内置SQL清洗工具,统一修复中文标点、粘连关键字、别名空格等语法报错;
4. 提供命令行交互式菜单,独立运行即可使用全套功能。

vim /opt/mysql_ai_tools/main.py同上

# -*- coding: utf-8 -*-
# 文件名:main.py
# 功能:项目核心业务逻辑 + 终端交互式菜单入口
# 作用:统一封装大模型调用、SQL清洗、数据库交互两大核心业务,命令行/网页共用底层函数
import os
import re
import logging
from dotenv import load_dotenv
# 兼容OpenAI标准大模型接口(适配腾讯云TokenHub)
from langchain_openai import ChatOpenAI
# 导入数据库操作封装类
from mysql_client import Mysql80Client
# 表格格式化打印工具,美化终端输出查询结果
from tabulate import tabulate
# 导入提示词管理类与全局实例
from prompts import UnifiedPrompt, prompt_helper

# 加载.env文件里所有数据库、大模型配置
load_dotenv()

# 全局日志配置,替代print,记录运行时间、日志级别、报错信息,方便排障
logging.basicConfig(level=logging.INFO, format="%(asctime)s - %(levelname)s - %(message)s")
logger = logging.getLogger(__name__)


def check_config() -> None:
    """
    程序启动前置配置校验函数
    作用:提前检测.env必填参数是否存在,避免运行中途缺参数崩溃
    """
    # 大模型必填参数列表
    required_llm = ["LLM_API_KEY", "LLM_BASE_URL", "LLM_MODEL_NAME"]
    missing = [k for k in required_llm if not os.getenv(k)]
    if missing:
        raise ValueError(f"配置缺失:请在 .env 文件中填写 {', '.join(missing)}")

    # 数据库必填参数列表
    required_db = ["MYSQL_HOST", "MYSQL_USER", "MYSQL_DB"]
    missing_db = [k for k in required_db if not os.getenv(k)]
    if missing_db:
        raise ValueError(f"数据库配置缺失:请检查 {', '.join(missing_db)}")


def get_llm() -> ChatOpenAI:
    """
    初始化大模型客户端
    适配腾讯云TokenHub等全部兼容OpenAI接口规范的MaaS平台
    返回:可直接调用的大模型实例
    """
    # 从环境变量读取大模型连接信息
    api_key = os.getenv("LLM_API_KEY")
    base_url = os.getenv("LLM_BASE_URL")
    model_name = os.getenv("LLM_MODEL_NAME")
    # 温度不存在则默认0.1,数值越低输出越严谨稳定
    temperature = float(os.getenv("LLM_TEMPERATURE", 0.1))

    return ChatOpenAI(
        api_key=api_key,
        base_url=base_url,
        model=model_name,
        temperature=temperature
    )

def clean_sql_spacing(sql: str) -> str:
    """
    SQL标准化清洗工具函数(兜底修复各大模型输出格式)
    解决:中文空格别名、中文标点、特殊空白、关键字连写等语法报错问题
    入参:大模型原始SQL字符串
    返回:清洗后可直接执行的标准英文SQL
    """
    if not sql:
        return ""

    # 1. 统一替换各类中文全角空格、换行、制表符为普通半角空格
    special_spaces = [
        '\xa0', '\u200b', '\u200c', '\u200d', '\u200e', '\u200f',
        '\u3000', '\t', '\n', '\r'
    ]
    for sp in special_spaces:
        sql = sql.replace(sp, ' ')

    # 2. 删除不可见控制字符,防止解析异常
    sql = re.sub(r'[\x00-\x1f\x7f]', '', sql)

    # 3. 中文标点批量替换为英文标点(解决Qwen等模型输出中文逗号报错)
    sql = sql.replace(',', ',').replace(';', ';').replace('(', '(').replace(')', ')')

    # 4. 多个连续空格合并为单个,去除首尾多余空格
    sql = re.sub(r'\s+', ' ', sql).strip()

    # 5. 精准处理AS别名内部空格,只删别名里空格,保留AS与别名之间分隔空格
    def _clean_alias_space(match):
        prefix = match.group(1)  # 捕获AS关键字
        alias = match.group(2)   # 捕获后面全部别名文本
        alias_clean = re.sub(r'\s+', '', alias)
        return f"{prefix} {alias_clean}"

    # 匹配AS后别名,截止逗号、FROM、WHERE等关键字前停止匹配
    sql = re.sub(
        r'\b(AS)\s+(.+?)(?=\s*,\s*|\s+FROM\b|\s+WHERE\b|\s+ORDER\b|\s+GROUP\b|\s+LIMIT\b|\s*;)',
        _clean_alias_space,
        sql,
        flags=re.IGNORECASE
    )

    # 6. 自动给连写的关键字补空格(字段/中文+关键字粘连自动拆分)
    keywords_upper = [
        "SELECT", "FROM", "WHERE", "ORDER BY", "GROUP BY",
        "AND", "OR", "LIMIT", "DESC", "ASC", "AS",
        "INNER JOIN", "LEFT JOIN", "RIGHT JOIN", "ON",
        "INSERT INTO", "UPDATE", "SET", "DELETE FROM",
        "VALUES", "LIKE", "IN", "BETWEEN", "IS NULL",
        "COUNT", "SUM", "AVG", "MAX", "MIN", "OVER"
    ]
    for kw in keywords_upper:
        # 字母下划线+关键字粘连拆分,补充第三个参数sql
        pattern = r'([a-z_])(' + re.escape(kw) + r')'
        sql = re.sub(pattern, r'\1 \2', sql)
        # 中文文字+关键字粘连拆分,补充第三个参数sql
        pattern_cn = r'([\u4e00-\u9fa5])(' + re.escape(kw) + r')'
        sql = re.sub(pattern_cn, r'\1 \2', sql)

    # 7. 统一所有SQL关键字大写,格式标准化
    keywords_lower = [kw.lower() for kw in keywords_upper]
    for kw in keywords_lower:
        sql = re.sub(
            r'\b' + re.escape(kw) + r'\b',
            kw.upper(),
            sql,
            flags=re.IGNORECASE
        )

    # 最终再清理一遍多余空格
    sql = re.sub(r'\s+', ' ', sql).strip()
    return sql

def nl2sql_query(user_input: str) -> dict:
    """
    核心业务1:自然语言转SQL、执行查询、AI生成业务总结
    对外统一标准返回字典,终端/网页程序均可直接调用,无重复代码
    入参:用户自然语言查询需求
    返回:包含执行状态、SQL、字段、数据、AI总结、模型原始输出
    """
    # 初始化大模型、数据库客户端
    llm = get_llm()
    db = Mysql80Client()

    try:
        logger.info("正在生成SQL语句...")
        # 1. 加载NL2SQL提示词,填充用户需求传给大模型
        prompt = UnifiedPrompt.NL_TO_SQL_PROMPT.format(user_input=user_input)
        response = llm.invoke(prompt)
        raw_content = response.content.strip()

        # 2. 从模型返回文本提取纯净SQL,提取失败直接抛异常
        extracted_sql = prompt_helper.extract_sql(raw_content)
        if not extracted_sql:
            raise Exception("大模型未返回有效SQL,请重新描述需求")

        # 3. 清洗SQL修复各类格式问题
        clean_sql = clean_sql_spacing(extracted_sql)
        logger.info(f"生成SQL:{clean_sql}")

        # 4. 数据库执行查询,拿到表头与数据
        columns, rows = db.execute_query(clean_sql)

        # 5. 如果有数据,调用大模型生成业务解读总结
        summary = ""
        if rows:
            logger.info("正在生成数据总结...")
            summary_prompt = f"""
            以下是真实的SQL查询结果,请作为电商数据分析师给出简练的业务总结。
            SQL语句:{clean_sql}
            查询数据:{str(rows)}
            重点说明数据反映的业务含义,如有异常值请指出。
            """
            summary_resp = llm.invoke(summary_prompt)
            summary = summary_resp.content.strip()

        # 成功结果返回
        return {
            "success": True,
            "sql": clean_sql,
            "columns": columns,
            "rows": rows,
            "summary": summary,
            "raw_llm": raw_content
        }

    except Exception as e:
        # 捕获全流程所有异常,记录日志并返回错误信息
        logger.error(f"查询处理失败:{str(e)}")
        return {
            "success": False,
            "error": str(e),
            "raw_llm": raw_content if 'raw_content' in dir() else ""
        }
    finally:
        # 无论成功失败,都关闭数据库连接释放资源
        db.close()


def sql_tune_analyze(raw_sql: str) -> dict:
    """
    核心业务2:SQL性能调优分析
    流程:清洗SQL → 获取EXPLAIN执行计划 → AI分析给出优化方案
    入参:用户输入待优化SQL
    返回:执行状态、清洗后SQL、执行计划字段/内容、调优建议
    """
    llm = get_llm()
    db = Mysql80Client()

    try:
        # 先标准化清洗SQL
        clean_sql = clean_sql_spacing(raw_sql)
        logger.info("正在获取执行计划...")

        # 调用数据库封装方法获取EXPLAIN执行计划
        columns, plan_rows = db.get_explain_plan(clean_sql)

        # 填充调优提示词,传入SQL和执行计划让AI分析瓶颈
        logger.info("正在分析性能瓶颈...")
        prompt = UnifiedPrompt.SQL_TUNE_PROMPT.format(
            sql_input=clean_sql,
            explain_data=str(plan_rows)
        )
        response = llm.invoke(prompt)

        return {
            "success": True,
            "sql": clean_sql,
            "plan_columns": columns,
            "plan_rows": plan_rows,
            "suggestion": response.content.strip()
        }

    except Exception as e:
        logger.error(f"调优分析失败:{str(e)}")
        return {
            "success": False,
            "error": str(e)
        }
    finally:
        # 操作结束关闭数据库连接
        db.close()


def main_cli():
    """
    终端交互入口主函数
    提供循环菜单,支持用户选择查询/调优/退出,纯终端操作
    """
    # 程序启动先校验全部配置,失败直接退出菜单
    try:
        check_config()
    except ValueError as e:
        print(f"❌ {e}")
        return

    # 循环交互,不退出可持续多次使用
    while True:
        print("\n=============== InnoAI SQL 助手 ===============")
        print("1. 自然语言生成SQL,自动查询并AI总结数据")
        print("2. 输入SQL语句,AI分析执行计划并给出调优方案")
        print("0. 退出程序")

        choice = input("请输入功能序号: ").strip()

        # 功能1:自然语言查数据
        if choice == '1':
            query = input("请输入你的数据查询需求: ").strip()
            if not query:
                print("⚠️ 请输入有效需求")
                continue

            result = nl2sql_query(query)
            # 处理失败场景,打印错误与模型原始输出
            if not result["success"]:
                print(f"\n❌ 处理失败:{result['error']}")
                if result.get("raw_llm"):
                    print(f"大模型原始回复:\n{result['raw_llm']}")
                continue

            # 成功:打印SQL、格式化表格展示数据、输出业务总结
            print(f"\n✅ 生成SQL:")
            print(result["sql"])
            if result["rows"]:
                print(f"\n📊 查询结果(共 {len(result['rows'])} 条):")
                print(tabulate(result["rows"], headers="keys", tablefmt="pretty"))
                if result["summary"]:
                    print(f"\n💡 业务总结:\n{result['summary']}")
            else:
                print("\n⚠️ 未查询到匹配数据")

        # 功能2:SQL性能调优
        elif choice == '2':
            sql_input = input("\n请输入需要分析的 SQL 语句: ").strip()
            if not sql_input:
                print("⚠️ 请输入有效SQL")
                continue

            result = sql_tune_analyze(sql_input)
            if not result["success"]:
                print(f"\n❌ 分析失败:{result['error']}")
                continue

            # 打印执行计划表格和AI优化建议
            print(f"\n📊 执行计划详情:")
            print(tabulate(result["plan_rows"], headers="keys", tablefmt="pretty"))
            print(f"\n📈 调优建议:\n{result['suggestion']}")

        # 0 退出循环,结束程序
        elif choice == '0':
            print("程序已安全退出。")
            break
        # 无效数字输入提示
        else:
            print("无效输入,请重试。")

        print("\n" + "-" * 40)


# 程序入口:直接运行main.py则启动终端菜单
if __name__ == "__main__":
    main_cli()


 
4.4 web_main.py:Streamlit网页可视化
 

无需重写业务逻辑,全部复用main.py封装函数,仅做页面交互:
 
1. 侧边栏切换两大功能页面,展示当前调用大模型;
2. 输入前置校验:区分自然语言输入与SQL输入,防止混用;
3. 美化代码块、数据表格、提示弹窗,SQL代码一键复制;
4. 配置systemd实现后台常驻,服务器重启自动拉起Web服务:

使用python3.11的pip安装,否则会安装到默认的python3.9中
/usr/local/python3.11/bin/pip3 install langchain-openai streamlit pymysql python-dotenv sqlparse tabulate
检查
 /usr/local/python3.11/bin/python3 -c "import langchain_openai;print('3.11依赖全部正常')"

若配置成功将弹出3.11依赖全部正常。

vim /opt/mysql_ai_tools/web_main.py同上

# -*- coding: utf-8 -*-
# 文件名:web_main.py
# 功能:Streamlit网页可视化界面
# 说明:前端交互页面,完全复用main.py封装好的业务函数,无需重复编写AI、数据库逻辑
# 两大页面:自然语言查数据、SQL性能调优,做输入前置校验、美化结果展示
import streamlit as st
import os
import re
# 从核心主程序导入通用业务函数、配置校验方法
from main import check_config, nl2sql_query, sql_tune_analyze

# 全局页面基础配置:页面标题、页面宽度铺满屏幕
st.set_page_config(page_title="InnoAI SQL 助手", layout="wide")

# ====================== 全局CSS样式定制:优化字体、间距、按钮、代码块、表格展示 ======================
# 使用markdown注入前端样式,统一页面视觉效果,方便演示观看
st.markdown("""
<style>
/* 全局文字基础样式:统一字体、字号、行间距,适配Windows/Mac中文显示 */
html, body, [class*="css"]  {
    font-size: 15px;
    line-height: 1.6;
    font-family: -apple-system, BlinkMacSystemFont, "Segoe UI", "PingFang SC", "Microsoft YaHei", sans-serif;
}

/* 页面主体容器:左右留白收窄,太宽的数据表格阅读疲劳 */
.block-container {
    padding-top: 2.5rem;
    padding-bottom: 3rem;
    max-width: 1100px;
    margin: 0 auto;
}

/* 各级标题字号、粗细、边距统一优化 */
h1 {
    font-size: 2rem !important;
    font-weight: 600;
    margin-bottom: 1.8rem;
    letter-spacing: 0.5px;
}
h2, h3 {
    font-weight: 600;
    margin-top: 1.5rem;
    margin-bottom: 1rem;
}
h3 {
    font-size: 1.25rem !important;
}

/* 文本输入框标签样式美化 */
.stTextArea label p {
    font-size: 15px;
    font-weight: 500;
    color: #1f2937;
    margin-bottom: 0.5rem;
}
/* 输入框内部样式:字号、圆角、内边距 */
textarea {
    font-size: 15px !important;
    line-height: 1.6 !important;
    border-radius: 8px !important;
    padding: 12px 14px !important;
}

/* 全局操作按钮统一尺寸、圆角、内边距,视觉统一 */
.stButton > button {
    font-size: 15px !important;
    font-weight: 500;
    padding: 0.65rem 2.2rem !important;
    border-radius: 8px !important;
    min-width: 160px;
}

/* 左侧侧边栏样式调整 */
section[data-testid="stSidebar"] {
    font-size: 14.5px;
}
/* 侧边大标题禁止自动换行 */
section[data-testid="stSidebar"] h1 {
    font-size: 1.5rem !important;
    white-space: nowrap;
    margin-bottom: 1.2rem;
}
/* 侧边单选按钮间距放大 */
section[data-testid="stSidebar"] .stRadio > div {
    gap: 0.8rem;
}
/* 提示警告框字号统一 */
.stAlert {
    font-size: 14.5px;
    border-radius: 8px !important;
}

/* ========== 重点修复:代码块复制按钮失效问题 ========== */
.stCodeBlock {
    position: relative !important;
    border-radius: 8px !important;
}
/* 强制显示复制按钮,提高层级防止被遮挡 */
.stCodeBlock button {
    opacity: 1 !important;
    visibility: visible !important;
    pointer-events: auto !important;
    z-index: 999 !important;
    width: 36px;
    height: 36px;
    top: 10px;
    right: 10px;
    border-radius: 6px;
    background: #f3f4f6 !important;
    color: #374151 !important;
    border: 1px solid #e5e7eb !important;
}
/* 按钮悬浮变色提升交互感 */
.stCodeBlock button:hover {
    background: #e5e7eb !important;
}

/* SQL代码等宽字体优化,提升代码可读性 */
.stCodeBlock code, .stCodeBlock pre {
    font-size: 14.5px !important;
    line-height: 1.7 !important;
    font-family: "JetBrains Mono", Consolas, Monaco, monospace;
}

/* 数据表格单元格内边距放大,避免文字拥挤 */
.stDataFrame {
    font-size: 14.5px;
    border-radius: 8px;
    overflow: hidden;
}
.stDataFrame [data-testid="table"] td {
    padding: 10px 12px;
}
</style>
""", unsafe_allow_html=True)

# 全局一次性配置校验,会话缓存避免重复校验
# st.session_state:streamlit会话全局存储,页面刷新前一直生效
if "config_checked" not in st.session_state:
    try:
        # 调用main.py的配置校验函数,检测.env文件必填参数
        check_config()
        # 标记已校验,下次页面刷新不再重复执行
        st.session_state.config_checked = True
    except ValueError as e:
        # 配置缺失直接弹窗报错,终止页面加载
        st.error(f"配置错误:{e}")
        st.stop()

# ========== 左侧侧边栏区域:系统标题、当前模型展示、页面切换导航 ==========
with st.sidebar:
    st.title("🚀 InnoAI SQL 助手")
    # 读取环境变量,展示当前正在使用的大模型名称
    st.info(f"当前模型:{os.getenv('LLM_MODEL_NAME', '未知')}")
    # 单选框切换两大功能页面
    page = st.radio("功能导航", ["🔍 数据查询与总结", "⚙️ SQL 性能调优"])

# ====================== 页面1:自然语言转SQL查询页面 ======================
if page == "🔍 数据查询与总结":
    st.header("💬 自然语言转 SQL 查询")
    # 多行文本输入框,接收用户中文业务需求
    user_input = st.text_area("请输入你的业务查询需求:", height=150)

    # 点击提交按钮触发查询逻辑
    if st.button("🚀 生成并执行", type="primary"):
        input_trim = user_input.strip()
        # 校验1:输入为空拦截
        if not input_trim:
            st.warning("请输入有效的业务查询需求后再提交")
        
        # 校验2:禁止直接粘贴SQL,区分两个页面的使用场景
        elif re.match(r'(?i)^\s*SELECT\s+', input_trim):
            st.warning("此处请输入自然语言描述的查询需求(例如:查询用户 1001 的所有订单),请勿直接粘贴 SQL 语句。")
        
        # 输入校验全部通过,执行AI查询逻辑
        else:
            # 加载动画提示用户等待
            with st.spinner("AI 正在生成 SQL 并查询数据..."):
                # 调用main封装好的核心业务方法
                result = nl2sql_query(user_input)

                # 分支1:业务执行失败,展示错误信息
                if not result["success"]:
                    st.error(f"处理失败:{result['error']}")
                    # 折叠面板展示大模型原始返回内容,方便排错
                    if result.get("raw_llm"):
                        with st.expander("查看大模型原始回复"):
                            st.code(result["raw_llm"])
                # 分支2:执行成功,分层展示结果
                else:
                    st.success("SQL 生成并执行成功")
                    # 高亮展示生成后的标准SQL语句
                    st.code(result["sql"], language="sql")

                    # 存在查询数据则渲染表格
                    if result["rows"]:
                        st.dataframe(result["rows"], use_container_width=True)
                        # 存在AI业务总结则展示解读文本
                        if result["summary"]:
                            st.markdown("### 💡 业务总结")
                            st.info(result["summary"])
                    # 无匹配订单提示
                    else:
                        st.info("未查询到匹配的数据")

# ====================== 页面2:SQL性能调优分析页面 ======================
else:
    st.header("🔧 SQL 性能调优分析")
    # 输入框接收用户待优化SELECT语句
    raw_sql = st.text_area("请输入待分析的 SQL 语句:", height=200)

    # 点击分析按钮执行调优流程
    if st.button("📊 开始分析", type="primary"):
        input_trim = raw_sql.strip()
        # 校验1:空输入拦截
        if not input_trim:
            st.warning("请输入有效的 SQL 语句后再提交")
        
        # 校验2:必须是SELECT语句,禁止其他类型SQL
        elif not re.match(r'(?i)^\s*SELECT\s+', input_trim):
            st.warning("此处请输入待分析的 SELECT SQL 语句,请勿输入自然语言描述。如需自然语言转 SQL,请切换到「数据查询与总结」页面。")
        
        # 校验通过,执行调优分析
        else:
            with st.spinner("正在获取执行计划并分析..."):
                # 调用main封装的调优函数
                result = sql_tune_analyze(raw_sql)

                # 分析失败展示错误
                if not result["success"]:
                    st.error(f"分析失败:{result['error']}")
                # 分析成功,展示执行计划表格+AI优化建议
                else:
                    st.success("执行计划获取成功")
                    st.dataframe(result["plan_rows"], use_container_width=True)

                    st.markdown("### 💡 调优建议")
                    st.markdown(result["suggestion"])

5.1 自然语言生成SQL查询测试
 
输入需求: 1001、1002、1003 每个用户的订单总消费金额与订单笔数,按总消费从高到低排序 
 
1. AI自动生成合规SQL:
 
sql
  
SELECT user_id AS 用户ID, SUM(pay_amount) AS 总消费金额, COUNT(id) AS 订单笔数 
FROM order_info 
WHERE user_id IN (1001, 1002, 1003) 
GROUP BY user_id 
ORDER BY 总消费金额 DESC;
 
 
2. 程序执行SQL,表格返回统计数据;
3. 大模型输出业务解读:分层用户价值、消费行为分析,标记数据异常点。

 
5.2 SQL性能调优实测
 

将上面生成的统计SQL传入调优模块:
 
1. 自动抓取EXPLAIN执行计划,识别三大性能问题:全表扫描、临时表、文件排序;
2. 输出可直接执行的覆盖索引语句:
 
sql
  
ALTER TABLE order_info ADD INDEX idx_user_id_pay_amount (user_id, pay_amount);
 
 
3. 给出优化后SQL改写方案,消除分组排序带来的性能损耗。

 
六、项目落地价值与拓展方向
 
6.1 企业落地价值

 
1. 降低数据查询门槛:业务运营无需学习SQL,自主完成订单统计,减少DBA重复工单;
2. 自动化SQL性能优化:慢SQL一键分析,自动输出索引方案,缩短SQL调优耗时;
3. 数据安全可控:全局只读拦截,杜绝误删改业务数据,敏感配置与代码分离;
4. 轻量化低成本:单台低配虚拟机即可部署,复用现有MySQL服务器,无需额外硬件投入。
 
6.2 后续拓展优化方向
 
1. 增加用户登录鉴权,区分不同业务人员的数据访问权限;
2. 支持多业务表、多库切换,适配完整电商库(商品、用户、物流表);
3. 增加SQL执行结果导出Excel功能;
4. 接入本地开源大模型(Qwen、Llama),脱离公网API实现内网离线使用;
5. 增加慢SQL日志自动采集,定时批量分析全库低效查询。
 
七、总结
 
本项目将MySQL运维知识与大模型NL2SQL能力深度结合,基于openEuler国产操作系统搭建轻量化AI数据工具,同时提供命令行与Web双交互入口,完美解决中小企业数据查询、SQL性能调优两大高频痛点。整套项目从环境搭建、代码开发、功能测试到后台部署流程完整,适合DBA、后端开发、AI爱好者学习实践,也可直接改造落地企业内部数据自助平台。
附录:1 .习要点与应用场景。2软硬件环境qin
附表一:
知识点
应用场景
系统部署及初始化
生产级别系统部署及优化
MySQL 8.0 基础语法
约束 AI 生成规范 SQL,区分聚合、排序、模糊匹配语法
EXPLAIN 执行计划分析
识别全表扫描、文件排序、无索引等性能风险点
InnoDB 索引设计规范
指导大模型输出联合索引、覆盖索引优化语句
Python MySQL 连接(pymysql
封装统一数据库操作类,统一管理连接释放
Linux 文件权限管控
.env 密钥文件权限加固,防止敏感信息泄露

附表二:

类别
名称 /
版本 / 参数
用途
备注
硬件
环境
虚拟机
CPU2 核,内存
4GB,磁盘20GB
运行 Linux
MySQLPython
本地虚拟机或云 ECS 均可
软件
环境
操作系统
openEuler / RHEL9
项目底层运行系统
需配置外网访问API
MySQL
8.0.45
存储电商订单测试业
务数据
内置 order_info 订单表
Python
3.11.9(源码编译)
项目主开发语言
依赖 pymysqldotenv、openaitabulate
Shell
Bash
系统环境操作、编译
Python
系统默认自带
网络
环境
外网访问
可访问大模型 API
调用大模型接口
防火墙放行 443 端口或者关
账号
资源
创建平台
账号
完成实名认证
获取 API Key,调用
大模型
官网:https://cloud.tencen
t.com/

总体流程

项目环境搭建
部署 openEuler 服务器,关闭 SELinux、配置可用 yum 源,编译安装 Python3.11.9
安装 MySQL8.0.45,创建 testdb 库、order_info 订单业务表,导入20 条标准测试订单数据;
登录并开通腾讯云 TokenHub 大模型聚合平台,申请 API 密钥,领取免费额度,编写.env 配置文件并加固
文件权限;
安装项目全部 Python 依赖包,测试数据库连通性、大模型接口连通性。
脚本开发
mysql_client.py:封装 MySQL 连接、查询与执行计划获取,拦截危险 SQL 保障数据库安全。
prompts.py:统一存放生成 SQL、调优分析两套 AI 提示词,并提供提取纯净 SQL 的工具函数。
main.py:项目总调度,串联数据库、大模型、提示词,提供终端菜单交互,实现完整业务逻辑。
web_main.pyStreamlit 可视化网页界面,做输入校验、图形化展示结果,复用 main 核心逻辑。
.env:存放数据库、腾讯云 TokenHub 大模型密钥等配置,分离敏感信息与业务代码。
功能测试
多业务自然语言用例全覆盖测试,校验生成 SQL 安全、逻辑准确,模糊匹配无 bug
性能调优模块测试,校验 EXPLAIN 解析完整、输出索引与改写方案可直接执行;
边界场景测试:无匹配用户 / 商品、空白输入、超长复合需求,程序无崩溃报错;
安全测试:验证不会生成任何 DELETE/UPDATE/ALTER 等危险 SQL,密钥无明文打印。

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐