Sitemap
A list of all the posts and pages found on the site. For you robots out there, there is an XML version available for digesting as well.
Pages
Posts
Habitat Engineering:AI时代,把判断力写进环境
Published:
当答案不再稀缺:AI时代,教育应该教什么?
Published:
🌐 An English version follows the Chinese version below.
Comprehensive LaTeX Template for Waseda University PhD Theses
Published:
Github: https://github.com/wanng-ide/phd_thesis_template_waseda_university
📚论文阅读
Published:
阅读的论文合集。
🤔一些思考
Published:
记录一些简单的思考💬。
Markdown Guide
Published:
📒 This page is from Academic Pages.
Academic Pages 简明双语指南
Published:
Quick Guide for Academic Pages (Chinese-English Bilingual)
从 视觉问答 Visual Question Answering(VQA)到 多模态表征 Multimodal representation learning 简单综述
Published:
文本主要是对VQA整个任务做一个综述。
portfolio
YUE开源音乐大模型
YuE: Scaling Open Foundation Models for Long-Form Music Generation

Open‑Sora
Open-Sora: Democratizing Efficient Video Production for All

最大的开源的交错图文对数据集:PIN
PIN(Paired and INterleaved multimodal documents)
封神榜开源体系
开源模型、开源框架、开源榜单

一些自动脚本
记录一些简单的脚本项目
MNBVC超大规模中文语料集
MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。数据均来源于互联网收集。

A.S.E(AICGSecEval)开源仓库级代码评测体系
仓库级 AI 生成代码安全评测基准与框架(CVE 驱动、上下文抽取、静态+动态混合评估)

RoCo Challenge @ AAAI 2026 冠军:ARC-VLA(Anchor & Recovery Curriculum)
ROCO@AAAI2026 决赛冠军|Deployability-First VLA for Sim-to-Real Collaborative Assembly

publications
⭐ [NTCIR 15] SKYMN at the NTCIR-15 DialEval-1 Task
Published in NTCIR, 2020-12
Dialogue Quality, BiLSTM + Attention), CNN (Convolutional Neural Network), Pre‑trained Language Model, MoE
⭐ [EMNLP 2021] MIRTT: Learning Multimodal Interaction Representations from Trilinear Transformers for Visual Question Answering
Published in EMNLP, 2021-10
Multimodal Interaction, Trilinear Transformer, Visual Question Answering (VQA), Two-Stage Workflow
⭐ Towards No.1 in CLUE Semantic Matching Challenge: Pre-trained Language Model Erlangshen with Propensity-Corrected Loss
Published in Arxiv, 2022-08
Semantic Matching, Pre-trained Language Model (PLM), Propensity‑Corrected Loss (PCL), LUE Semantic Matching Challenge
⭐ Fengshenbang 1.0: Being the Foundation of Chinese Cognitive Intelligence
Published in Arxiv, 2022-09
Chinese Pre-trained Models, Foundation Models, Open-Source Ecosystem, Cognitive Intelligence
[ACM 2022] Breaking Isolation: Multimodal Graph Fusion for Multimedia Recommendation by Edge-wise Modulation
Published in ACM MM, 2022-10
Multimedia Recommendation, Graph Fusion, Edge-wise Modulation, Graph Convolutional Network (GCN)
⭐ [EMNLP 2022] Zero-Shot Learners for Natural Language Understanding via a Unified Multiple Choice Perspective
Published in EMNLP, 2022-10
Zero‑Shot Learning, Multiple Choice Format, Pre‑trained Masked Language Model (PMLM), Unified Multiple Choice model
⭐ [CVPR 2023] MAP: Modality-Agnostic Uncertainty-Aware Vision-Language Pre-training Model
Published in CVPR, 2023-06
Multimodality, Uncertainty Modeling, Vision-Language Pre-training, Probability Distribution Encoder (PDE)
⭐ [ACL 2023] Solving Math Word Problems via Cooperative Reasoning induced Language Models
Published in ACL, 2023-07
System 1 & System 2, Cooperative Reasoning (CoRe),Stepwise Feedback, Math Word Problems
[ACL 2023] UniEX: An Effective and Efficient Framework for Unified Information Extraction via a Span-extractive Perspective
Published in ACL, 2023-07
Information Extraction , Unified Across IE Tasks, Triaffine Attention, Span‑extractive Framework, Low‑resource Transferability
GameGPT: Multi-agent Collaborative Framework for Game Development
Published in Arxiv, 2023-10
Game Development, Multi-agent Collaboration, LLM, Redundancy
⭐ [SIGIR-AP 2023] EALM: Introducing Multidimensional Ethical Alignment in Conversational Information Retrieval
Published in SIGIR-AP, 2023-11
Multidimensional Ethics, Ethical Judgment, Large Multimodal Models (LMMs), Binary & Multi‑label Classification
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
Published in Arxiv, 2024-01
Multimodal Understanding, Subject Knowledge Reasoning , University Exam Questions, LMM Performance Evaluation
[COLM 2024] StructLM: Towards Building Generalist Models for Structured Knowledge Grounding
Published in COLM, 2024-02
Structured Knowledge Grounding (SKG), Instruction tuning, Generalist model, Tables / Graphs / Databases
⭐ [ACM TOIS 2024] SSR: Solving Named Entity Recognition Problems via a Single-stream Reasoner
Published in ACM TOIS, 2024-05
Named Entity Recognition (NER), Machine Reading Comprehension (MRC), Single-Stream Reasoner (SSR), Multi-choice Input Format
⭐🚩 PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents
Published in Arxiv, 2024-06
Knowledge‑intensive, Paired and Interleaved Documents, Multimodal Datasets, Data Format
⭐ [SIGIR-AP 2024 最佳论文提名] Data-Efficient Massive Tool Retrieval: A Reinforcement Learning Approach for Query-Tool Alignment with Language Models
Published in SIGIR-AP, 2024-10
Massive Tool Retrieval (MTR), Query‑Tool Alignment (QTA), Massive Tool Retrieval Benchmark, DPO
⭐ [EMNLP 2024] ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
Published in EMNLP, 2024-11
ToolBeHonest, Hallucination, LLM, Multi‑level Diagnostic
[EMNLP 2024] HoLLMwood: Unleashing the Creativity of Large Language Models in Screenwriting via Role Playing
Published in EMNLP, 2024-11
Screenwriting, Large Language Models (LLMs), Role Playing, Creative Generation, Multi-Agent Collaboration
⭐ [ICLR 2025] ChartMimic: Evaluating LMM’s Cross-Modal Reasoning Capability via Chart-to-Code Generation
Published in ICLR, 2025-04
Large Multimodal Models (LMMs), Chart Understanding, Code Generation, Cross-modal Reasoning
🚩 [ACL 2025] Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm Perspective
Published in ACL, 2025-07
Multi-Paradigm, Large Language Model (LLM), Progressive Paradigm Training (PPT), Zero-shot Generalization
💭 VeriGUI: Verifiable Long-Chain GUI Dataset
Published in Arxiv, 2025-08
Long-Chain Complexity, GUI Agents, Subtask-Level Verifiability, POMDP
💭 Nav-R^2 Dual-Relation Reasoning for Generalizable Open-Vocabulary Object-Goal Navigation
Published in Arxiv, 2025-12
Object-Goal Navigation, Chain-of-Thought, Dual-Relation Reasoning, Similarity-Aware Memory
🚩 [AAAI 2026 (Oral)] O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
Published in AAAI, 2026-01
Video Editing, Diffusion Models, Unified Control Signal, Object Distortion Control
💭🚩 OneLatent: Single-Token Compression for Visual Latent Reasoning
Published in Arxiv, 2026-02
Latent Reasoning, Chain-of-Thought Compression, Visual Supervision, DeepSeek-OCR, Minimum Description Length, Reasoning Efficiency
🚩 [TMLR 2026] A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms
Published in TMLR, 2026-03
Autonomous Driving, Reasoning, LLM/MLLM, Cognitive Hierarchy, Long-tail Scenarios, Social Game, Survey
[ICLR 2026] YuE: Scaling Open Foundation Models for Long-Form Music Generation
Published in ICLR, 2026-04
Long-form music (full-song) generation, Audio Language Model, Music In-Context Learning, Controllability, human preference evaluation
💭🚩 Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance
Published in Arxiv, 2026-05
Instruction Following, Rubric-Guided Reasoning, Rubric-as-Reward, Self-Generated Rubrics, Reinforcement Learning, Self-Consistency
💭 Velocity-Space 3D Asset Editing
Published in Arxiv, 2026-05
3D Asset Editing, Rectified Flow, Velocity-Space Editing, Training-Free Editing, Mask-Free Editing, TRELLIS
[ICML 2026] Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO
Published in ICML, 2026-06
GRPO, Policy-Level Diversity, Small-to-Large Policy Optimization, RLVR, Rollout Diversity, Progressive Annealing
💭⭐ WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts
Published in Arxiv, 2026-06
MLLM-Generated Web Artifacts, Requirement-Induced State Evaluation, Interaction Contract Graph, Web Generation Benchmark, DOM/Visual Assertion
[ACL 2026] A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated Code
Published in ACL, 2026-07
AI-Generated Code Security, Repository-Level Benchmark, Large Language Models (LLMs), Common Vulnerabilities and Exposures (CVEs)
🚩 [ACL 2026] ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection
Published in ACL, 2026-07
Probability-Guided Token Selection, High-Value Semantic Signals, Gradient Interference, Training Stability & Rapid Convergence
💭 Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA
Published in Arxiv, 2026-07
Vision-Language-Action, Mixture-of-Experts, Kinematics-Supervised Routing, Robot Manipulation, DIYRobot
💭🚩 Simple-OPD: Demystifying Warm-up for On-policy Distillation
Published in Arxiv, 2026-08
On-Policy Distillation, Warm-up, Chain-of-Thought, Teacher Compatibility, LoRA, Reasoning Models
🚩 AutoResearch: Insight In, Hallucination Out
Published in Arxiv, 2026-08
Autonomous Research, Multi-Agent Systems, Idea Generation, Evidence-Grounded Execution, Independent Verification, Scientific Discovery
⭐🚩 Learning Where Outcomes Change: Credit-Addressable Reasoning for Multimodal Geometry
Published in Arxiv, 2026-08
Multimodal Geometry Reasoning, Credit Assignment, Code-CoT, CE-GRPO, Executable Perception Code, Event-Level Reinforcement Learning
[EMNLP 2026] AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
Published in EMNLP, 2026-10
Controllable Captioning, Omni-modal Intelligence, Plug-and-play Framework, Multimodal Large Language Models
⭐ [EMNLP 2026] SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
Published in EMNLP, 2026-10
Multimodal Large Language Models, Long-Context Understanding, Evidence Chain, Scientific Literature, Benchmark
🚩 [EMNLP 2026] Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
Published in EMNLP, 2026-10
RLVR, Entropy Collapse, Policy Reheating, On-Policy Self-Distillation, Temperature Scaling, Continued Reinforcement Learning
talks
IDEA研究院原作团队解读封神榜体系:致力于成为中文认知智能的基础设施
Published:
随着大模型在自然语言处理、计算机视觉等多个领域兴起,认知智能正在经历范式上的变化。借助大规模的数据以及庞大的参数量,这些模型展现出能够有效处理各种任务的特征,并正在以惊人的速度被部署到各个专业领域中,对社会和经济发展产生深远的影响。但是目前中文社区出现了某种停滞不前的现象,因为模型的体量已经从原本的百万参数飞跃至千亿级别,一些高校和传统公司并不具备足够的算力,也缺少有效的基础设施帮助他们训练和使用模型。因此,要推动人工智能技术进一步发展,坚实的基础设施尤为重要。
首个中文Stable Diffusion模型背后的技术:IDEA研究院封神榜团队揭秘
Published:
全面讲解太乙系列模型从模型的生产到应用。该分享从训练,微调和加速等角度揭秘封神榜开源体系之一的太乙系列(多模态系列)模型是如何生产的。基于该团队训练后开源的权重,讲解如何推理加速以及如何部署在 webui 和 dreambooth 等应用上。
Large Models bridge the Digital-Real World Gap: from Understanding to Generation
Published:
NCAA 2023 tutorial speaker
SIGIR-AP 2023 in Beijing, China
Published:
EALM: Introducing Multidimensional Ethical Alignment in Conversational Information Retrieval
ACL 2025 in Vienna, Austria
Published:
A presentation and a poster.
SIGIR-AP 2025 in Xi’an, China
Published:
From December 7–10, 2025, SIGIR-AP 2025 was held in Xi’an, China. As one of the organizers, I co-organized the BREV-RAG workshop — Beyond Relevance-based EValuation of RAG systems — at SIGIR-AP 2025.
teaching
Teaching experience 1
Undergraduate course, University 1, Department, 2014
This is a description of a teaching experience. You can use markdown like any other post.
Teaching experience 2
Workshop, University 1, Department, 2015
This is a description of a teaching experience. You can use markdown like any other post.