← 피드로
이미지·비디오·오디오를 하나의 아키텍처에서 함께 학습해 생성·이해·행동 예측을 통합하려는 멀티모달 기반 모델이며, FLUX 3 Video부터 Early Access로 제공됨 이미지의 공간 구조, 비디오의 시간·물리 역학, 오디오의 사건·소리 관계를 상호 제약으로 학습하며, Self-Flo…
출처: news.hada.io · https://news.hada.io/topic?id=31791
답글 남기기