研究议程

研究

将 AI 能力视为全栈交付与认知加速问题。

技术是有用的仆人,却是危险的主人。

Christian Lous Lange

研究主张

AI 是人类认知的加速器,而不是替代品。

无论是 AI for Science 还是具身智能,最终目标都是拓展人类知识的边界,同时守护人的能动性。实现这一愿景,需要把抽象智能连接到可靠、低延迟的系统执行。

01

当前研究重点

四个相互连接的层次,推动智能从模型能力走向可信赖的现实成果。

01

基础模型与后训练

千亿参数 LLM 完成生产部署。

负责大模型后训练流程,将模型评测直接连接到真实工作流,重点降低幻觉,并在关键任务中实现确定、安全的系统执行。

  • 100B+ 参数
  • C-Eval #1 · 2023.09
  • MMBench #1 · 2024.04
  • 生产环境部署
02

推理系统与软硬件协同

TTFT / TPOT 降低 >50%;IPD 效率提升 100%+。

构建 PD 分离式推理架构,并研究自定义 Kernel 生成、激活剪枝与低比特量化,提升异构集群上的执行效率。

  • >50% TTFT / TPOT
  • 100%+ IPD 效率
  • MLSys Challenge #1 · 2026
  • PD 分离式推理
03

多模态 AI 与生产部署

20 亿参数以上 VLM,日均调用 10 万+。

将视觉语言智能嵌入工业与公共服务工作流,以可靠分流和系统化工程能力支撑大规模商业部署。

  • 2B+ 参数 VLM
  • 100K+ 调用 / 天
  • 95%+ 分流准确率
  • RMB 50M+ 收入 · 2025
04

基础方法与鲁棒性

50+ 论文与 150+ 专利。

研究覆盖随机 Bandit、零阶优化、图学习与噪声标签鲁棒性,并始终立足梯度噪声、弱监督和内存带宽等现实约束。

  • 50+ 论文
  • 150+ 专利
  • Bandit 与优化
  • 鲁棒学习

02

研究主线

从人的意图到可衡量的影响

  1. 01

    人的问题

    从重要的科学问题或真实业务问题出发。

  2. 02

    模型能力

    围绕实际工作流完成基础模型后训练与对齐。

  3. 03

    系统执行

    协同优化推理、Kernel 与硬件,实现可靠低延迟。

  4. 04

    真实反馈

    在生产环境衡量准确率、效率、安全与人的收益。

03

代表性研究工作

围绕高效注意力与无损、可验证解码的代表性研究。

在 Google Scholar 查看全部
CoRR2025

HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs

核心贡献: 通过卸载冗余注意力块解决长上下文内存瓶颈,在超长序列下保持系统吞吐。

KV Cache异构注意力长上下文
Expert Systems with Applications2025

BiTA: Bi-directional Tuning for Lossless Acceleration in Large Language Models

核心贡献: 通过双向调优加速推理且不降低输出质量,在速度与模型保真度之间取得平衡。

LLM 加速无损加速解码
ACL Findings2024

Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct Decoding

核心贡献: 将轻量验证器与并行 Token 生成结合,降低资源受限硬件上的端到端延迟。

并行解码验证自动纠错