Choisissez une catégorie

3 modèles disponibles
8 modèles disponibles

3 modèles disponibles



5 modèles disponibles
6 modèles disponibles
3 modèles disponibles

8 modèles disponibles
HappyHorse 1.1 Text to Video
1080p cinématographique avec son intégré, jusqu’à 15 secondes.
Vision créative
Décrivez la scène, la caméra et le mouvement. Le dialogue dans le prompt est prononcé dans la vidéo.
Paramètres vidéo
Les vidéos plus longues coûtent plus cher.
Aperçu cinéma
Historique des générations0 enregistrements
Générateur texte en vidéo HappyHorse 1.1
HappyHorse 1.1 est le modèle de ce site qui génère aussi le son. Le modèle vidéo cinématographique d’Alibaba crée son propre audio : un prompt avec dialogue produit un clip où les paroles sont prononcées avec des lèvres synchronisées. Neuf formats d’image, 3 à 15 secondes, 720p ou 1080p.
Idéal pour les plans qui doivent s’entendre autant que se voir : dialogue, ambiance et pas arrivent avec la vidéo
Pourquoi choisir le texte en vidéo HappyHorse 1.1
Lancé par Alibaba en juin 2026, HappyHorse 1.1 est conçu pour de courtes pièces cinématographiques plutôt que de simples démonstrations. Sa particularité est l’audio natif : le son est généré avec l’image et non ajouté après coup.
Audio natif et synchronisation labiale
Écrivez le dialogue dans le prompt : il revient prononcé et synchronisé, dans la langue utilisée. L’ambiance et les effets sont générés en même temps. Aucun réglage audio n’est nécessaire, car l’audio est intégré.
720p ou 1080p
720p pour les brouillons, 1080p pour la prise finale. À 3 secondes, les deux niveaux sont arrondis aux mêmes 20 crédits : le test le plus court ne coûte rien de plus en pleine résolution.
Neuf formats d’image
16:9, 9:16, 1:1, 4:3, 3:4, 4:5, 5:4, 21:9 et 9:21. Les deux extrêmes sont particulièrement utiles : 21:9 pour une coupe cinématographique, 9:21 pour un écran de téléphone sans bordure.
3 à 15 secondes
Un curseur à la seconde. Trois secondes suffisent pour vérifier le cadrage et la voix avec 20 crédits ; quinze secondes permettent de porter un moment complet de la scène.
Prompts multi-plans
Le modèle gère les prompts rédigés comme une liste de plans, avec des coupes décrites dans l’ordre. La version 1.1 améliore la cohérence du sujet afin qu’un visage reste identique entre les plans.
Les échecs sont remboursés
Les crédits sont retenus à l’envoi puis automatiquement recrédités si la génération échoue ou si le fournisseur ne répond jamais. Un clip échoué ne vous coûte rien.
Testez en quelques secondes, rendez en entier
Un test de 3 secondes en 1080p coûte 20 crédits et montre déjà comment fonctionnent la voix et le mouvement. Passez à la durée complète une fois le prompt validé.
Comment utiliser le texte en vidéo HappyHorse 1.1
Comme l’audio est généré avec l’image, le prompt remplit deux fonctions à la fois. Écrire pour les deux distingue un clip exploitable d’un clip qui semble muet.
Décrire le plan
Commencez par la scène, la caméra et le mouvement. Le modèle comprend le langage caméra : rapprochement lent, suivi à main levée, plan large fixe, changement de mise au point. Les séquences de plusieurs plans fonctionnent bien.
Écrire aussi le son
Ajoutez entre guillemets la phrase à prononcer et l’ambiance souhaitée. « Elle dit : nous devrions revenir » produit la parole ; « pluie sur un toit en tôle » fournit le fond sonore.
Tester brièvement
Lancez d’abord 3 secondes. Cela coûte 20 crédits dans les deux résolutions et permet de vérifier le sujet, le cadrage et la voix, les éléments qui demandent le plus souvent une correction du prompt.
Rendre la prise complète
Utilisez le même prompt à pleine durée et en 1080p. La génération prend quelques minutes ; vous pouvez quitter la page et retrouver le clip terminé avec son audio dans votre historique.
Une chose à la fois
Ce modèle n’a pas de seed : deux exécutions du même prompt seront donc différentes. Changez un seul élément par exécution au lieu de réécrire le prompt, sinon vous ne saurez pas ce qui a causé le changement.
HappyHorse 1.1 Text to Video
FAQ
Audio, résolutions, formats d’image, durée des clips et coûts en crédits du modèle texte en vidéo HappyHorse 1.1.
HappyHorse 1.1 est un modèle de génération vidéo lancé par Alibaba en juin 2026 et développé au Future Life Lab de son groupe Taotian. La version 1.1 améliore le mouvement, la cohérence du sujet, le respect du prompt et l’audio par rapport à la version 1.0. Cette page utilise son endpoint texte en vidéo ; FlowVeo3 est une plateforme indépendante, sans affiliation avec Alibaba.
Oui, sans réglage à activer. Le son est produit avec l’image : dialogue prononcé avec mouvements des lèvres correspondants, ambiance et effets adaptés à la scène. C’est la principale raison de choisir ce modèle plutôt que ceux du site qui renvoient une vidéo silencieuse.
Entre 20 et 100 crédits. Le tarif est calculé à la seconde : environ 5.1 crédits par seconde en 720p et 6.5 en 1080p, arrondis à un chiffre simple. Ainsi, 3 secondes coûtent 20 crédits dans les deux résolutions, 5 secondes en 1080p coûtent 35 et 15 secondes en 1080p coûtent 100. Le coût exact est affiché avant l’envoi.
Les prix sont arrondis à un chiffre simple et, à 3 secondes, les deux niveaux tombent dans la même tranche. C’est un effet réel de l’arrondi, pas une promotion ; le test 1080p est ainsi l’exécution utile la moins chère de cette page.
Non. HappyHorse 1.1 expose uniquement le prompt, la résolution, le format et la durée : il n’y a ni prompt négatif ni seed. Pour une sortie reproductible avec seed, le texte en vidéo Wan 2.7 du site propose les deux.
Le modèle accepte les prompts dans toutes les langues et gère la synchronisation labiale multilingue. Écrivez la phrase dans la langue souhaitée ; elle sera prononcée dans cette langue, sans traduction.
Comptez quelques minutes, davantage pour les générations de 15 secondes en 1080p. Vous pouvez quitter la page pendant le traitement ; le clip apparaît dans votre historique une fois terminé. En cas d’échec, vos crédits sont automatiquement recrédités.
Essayer le texte en vidéo HappyHorse 1.1
Trois secondes en 1080p coûtent 20 crédits et vous montrent comment l’image et la voix fonctionnent ensemble.