Multimodal AI Systems Architect (AI Engineering)
Hyphen Connect Limited
Apply to this job Hong Kong Until 8/21/2026 First posted April 25, 2026 Last posted April 25, 2026
Job description
We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models. This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative.
Responsibilities:
- Integrate vision encoders and audio-native models into core agent reasoning loops.
- Optimize streaming latency for voice-to-voice AI interactions.
- Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.
Qualifications:
- Experience with Whisper, CLIP, and multimodal LLM integration.
- Knowledge of streaming architectures and WebRTC.
- Expertise in cross-modal alignment.
About this role
Summary
Develop and optimize AI systems integrating vision and audio models for multimodal interactions.
Job title
Multimodal AI Systems Architect (AI Engineering)
Experience level
Industry
software
Location requirements
Hong Kong, on-site work required
Salary
Not specified
Management role
No
Skills & keywords
Required skills
WhisperCLIPmultimodal LLMstreaming architecturesWebRTCcross-modal alignment
Preferred skills
WhisperCLIPmultimodal LLMstreaming architecturesWebRTCcross-modal alignment
Specializations
multimodalAIvisionaudioretrieval
Locations
Structured locations inferred from the posting.
Hong Kong
On-site City