Software Engineering Undergraduate, Tongji University
Multimodal Perception · Audio-Visual Understanding · LLM Reasoning · Model Interpretability · AI for Research
GitHub · Tongji University · Profile Repository
I am an undergraduate student in Software Engineering at Tongji University. My work focuses on multimodal perception and model reasoning, especially how systems combine visual, audio, motion, and textual evidence under practical task constraints.
Multimodal learning. Grounding objects, events, and actions across audio, vision, motion, and language.
Audio-visual perception. Using temporal and motion cues to reduce static visual bias in segmentation and understanding tasks.
LLM reasoning and interpretability. Studying reasoning-budget behavior, budget-aware routing, and internal features linked to model decisions.
AI for research workflows. Building generation, checking, revision, and rendering loops for scientific reading and communication.
Audio-visual segmentation research on probing physical consistency for sounding-object localization. The project uses spectral-kinematic alignment and motion-guided queries to reduce false positives from static visual saliency.
LLM interpretability work studying reasoning behavior under different reasoning budgets, with sparse autoencoders, feature analysis, and budget-aware routing.
An AI-for-research pipeline that turns academic papers into posters through a generation, checking, revision, and rendering loop.
A Cocos2d-x systems project implementing map interaction, character control, collision detection, inventory, and farming simulation mechanics.
- Languages: Python, C++, TypeScript, JavaScript, Java, LaTeX
- ML / Vision: PyTorch, OpenCV, multimodal data processing
- Systems: Linux, Git, Docker, Cocos2d-x, shell scripting
- Research workflow: paper reading, experiment tracking, poster generation, reproducible documentation
